ITBear旗下自媒体矩阵:

AI递归自我改进:技术瓶颈、未来预测与一线专家深度对话

   时间:2026-09-14 02:43:45 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在近期一场由播客主持人Dwarkesh Patel主持的深度对话中,三位人工智能领域的顶尖研究者就AI递归自我改进(RSI)的未来路径展开了激烈讨论。参与讨论的嘉宾包括OpenAI联合创始人、现Thinking Machines首席科学家John Schulman,Zyphra首席技术官Beren Millidge,以及模型训练平台Baseten的模型训练负责人Charlie O'Neill。他们从不同角度剖析了AI技术发展的瓶颈与前景,并对未来几年AI可能达到的里程碑做出了预测。

John Schulman认为,AI在认知任务上的全面超越可能比预期更快到来。他指出,当前模型在代码生成和数学推理等任务上已展现出惊人能力,而这类任务正是AI研究的核心领域。基于这一观察,他预测AI有望在三到四年内达到甚至超越人类顶尖专家的水平。Charlie O'Neill则持相对谨慎态度,认为这一过程可能需要五到十年时间,尤其考虑到自动化AI研究本身就是一个极其复杂的挑战,涉及持续学习和超长上下文整合等系统性短板。

在讨论AI技术瓶颈时,Beren Millidge提出了一个关键观点:当前AI体系在"做什么"方面已接近人类水平,但在"决定做什么"这一更高层次的目标设定能力上仍存在根本性挑战。他以"仿真到现实"的鸿沟为例,指出即便AI能在基准测试中表现卓越,但在真实世界应用中仍可能面临难以逾越的障碍。Charlie O'Neill进一步补充道,现有AI架构可能已接近理论最优解的边界,若要实现质的飞跃,可能需要全新的底层技术突破,而这正是当前AI难以自我实现的困境。

关于AI的持续学习能力,Charlie O'Neill描述了一种更实时的闭环训练模式:模型每五小时评估一次在内部基准上的表现,若有改善则部署,否则丢弃该版本。然而,当这种循环被放大到针对单一企业或任务的小批量更新时,问题便接踵而至。他指出,无论是监督微调还是在线策略蒸馏,在迭代到数百次微更新后都会出现"灾难性遗忘"现象,导致模型丧失早期习得的通用能力。Beren Millidge将这一问题归结为模型可塑性与稳定性的根本张力,认为无限期地在同一基模型上持续训练终将遭遇性能饱和。

在强化学习(RL)的有效性讨论中,Beren Millidge揭示了其成功背后的关键因素:大量高质量的中期训练数据实际上已将模型推进至最终强化学习检查点80%的位置,而RL本身做的只是在这个高质量起点上进行策略微调。Charlie O'Neill则以"量子相变"类比预训练的平滑损失曲线背后隐藏的离散跳跃,认为RL在单个任务上可能经历从0.5%到90%通过率的相变,当数十个任务的相变被平均后,便呈现为宏观层面的持续进步。然而,John Schulman也警示了RL带来的多样性损耗问题,指出经过RL训练的模型会反复使用相同的叙事主题和人物名称,创意写作的分布宽度明显收窄。

对于AI可能实现的重大突破,John Schulman强调了人类在定义目标方面的最后防线。他认为,即便AI承担全部技术工作,确定"我们到底想要什么"仍将是人类需要坚守的阵地。Charlie O'Neill进一步区分了两类研究:目标清晰、可量化优化的"自动化研究"与推动范式转变所需的"开放式科学"。他以GPT的诞生为例,指出这类突破并非优化产物,而是人类直觉的闪现,而AI系统能否复现这类跳跃仍是未知数。Beren Millidge则将这一挑战提炼为RSI的核心难题:AI必须能自主提出目标、优化目标、判断结果,再提出新目标,且这一循环长期不脱轨。

在具体时间表预测上,三位专家给出了不同视角的判断。关于实现全能白领远程工作者的时间点,Charlie O'Neill认为若任务环境有良好的程序化接口,约需一年时间;若依赖浏览器操作,则约两年。Beren Millidge给出了三年预测,理由是真实工作中存在大量零散的长尾任务。John Schulman则认为大致一年内会出现可用版本,但性能会有所差异。对于AI研究者实现10倍生产力提升的时间点,John Schulman和Beren Millidge均认为需要两年,而Charlie O'Neill则认为需要5至10年,其核心顾虑在于自身消化信息、做出最优实验决策的能力是真正的瓶颈所在。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version