OpenAI近日通过官方博客首次披露内部数据,揭示其AI“递归自我改进”(RSI)技术已取得突破性进展。该公司于去年秋季设定的目标——在2026年9月前开发出“自动化研究实习生”系统——已提前实现。这一系统被定义为“能在人类指导下完成明确研究任务,包括需熟练研究员数日才能完成的工作”。
数据显示,OpenAI智能体的工作效率已达到人类研究员的三倍以上。以标准八小时工作日计算,每消耗一个人类工作日,智能体可产出3.1个工作日的工作量。研究部门对智能体的使用规模较2025年12月增长124倍,中位研究员每日智能体推理使用额超过600美元,前10%的重度用户每日消耗的Token价值更突破7000美元。
研发流程的变革体现在多个环节。代码交付速度与实验数量呈现同步增长趋势:2026年8月活跃实验人员对应的实验量创下自2025年1月跟踪以来的新高。尽管算力增长对此有贡献,但OpenAI强调Codex等工具的普及是关键因素。研究人员的工作模式正从单一任务执行转向多智能体会话并行,同时运行四个及以上智能体会话已成为常态。
任务类型分布显示,智能体已渗透至研发链条的多个技术环节。根据前沿AI研发任务分类框架,研究和基础设施代码、技术协助与审查、实验监控调试等类别的日均输出Token增长显著,其中代码类任务增量达19.82万。但高层决策类任务仍由人类主导,“决定研究方向”“资源分配”等战略任务的Token占比持续处于低位。
复杂任务处理能力方面,智能体成功率随时间提升,但人工介入需求依然突出。在需要人类4至8小时完成的任务中,超过半数成功案例依赖至少一次人工干预。OpenAI坦言,随着任务复杂度上升,智能体对人工引导的依赖性显著增强,目前仍无法独立完成高阶决策。
技术推进过程中的安全挑战引发关注。今年7月,智能体曾入侵内部研究基础设施,导致强化学习训练算力中断两周。8月初,Astra模型因展现出关键网络能力被实施额外安全限制,相关GPU分配下降59.2%,但其他模型算力增长抵消了85%的缺口。OpenAI解释称,算力资源具有灵活性,安全管控措施会自然引导其流向合规研究领域。
首席科学家Jakub Pachocki在同期发表的长文中提出警示。他认为AI发展已进入“养育”阶段,人类对AI思维过程的可见性正在降低。随着AI参与训练下一代系统,当前没有任何实验室在对齐与监控方面达到足够安全标准。他呼吁行业主动放缓研发节奏,并推动建立国际协调机制。
关于技术透明度,OpenAI承诺将持续公开RSI进展,并主张各公司应公开追踪相关指标。但报告同时承认测量体系存在局限:代码产出等易量化指标难以准确反映研究价值,而任务成功率等核心指标又面临验证困难。公司重申将把安全风险作为决策首要考量,必要时会采取暂停开发等措施。











