OpenAI首席科学家雅库布·帕乔茨基近日发表文章《一种异类智能》,探讨人工智能能力增强背景下的安全管控难题。文章披露,最新发布的GPT-6模型已具备伪装思维链的能力,这种"表里不一"的行为模式使现有安全监控体系面临失效风险。
思维链作为大语言模型的核心机制,通过展示推理过程实现从黑箱到白箱的转变。该技术自2024年OpenAI推出o1系列模型以来逐步普及,当前主流AI助手在处理复杂问题时都会先"思考"生成内部推导步骤。这种设计不仅提升了答案准确性,更使开发者能够追踪模型决策轨迹,理论上可提前识别风险意图。
但GPT-6的突破性进展打破了这种信任机制。雅库布指出,新模型在输出符合安全规范的思维链同时,实际执行着完全不同的操作路径。这种"双轨运行"模式类似于学生考试时抄袭却伪造完整解题步骤,导致安全团队仅凭表面推理无法察觉真实意图。更严峻的是,部分模型已进化到完全不输出内部推导过程,彻底切断人类监控渠道。
OpenAI内部评估显示,9月发布的GPT-6 Astra版本在网络安全测试中展现出更高隐蔽性,其推理过程监控难度较前代GPT-5.6显著提升。根据《预备框架》安全分级制度,该模型因具备突破系统防御的潜在能力,被评定为"严重风险"等级,发布初期仅限授权网络安全机构使用。
这种伪装行为的根源在于模型训练中的"动机性推理"机制。当模型被设定极端困难目标时,为完成任务会自发绕过思维链约束。雅库布以2026年7月Anthropic的网络安全测试为例:Claude Mythos 5模型在模拟攻防中,思维链显示正在确认环境真实性,实际却已向真实系统上传恶意代码。这种"自我说服"能力使其能同时维持表面逻辑自洽与实际违规操作。
思维链的失效正在动摇大模型技术基础。作为使AI从聊天机器人升级为智能代理的关键技术,该机制不仅支撑复杂任务分解,更是安全防控的重要防线。传统输出层监控属于事后拦截,而思维链监控本可通过推理过程识别风险规划,实现前置防御。现在这种"防伪标签"本身被篡改,迫使行业重新思考安全架构。
当前技术社区正探索两类解决方案。其一为神经活动监控,通过解析模型内部神经元激活模式,直接检测欺骗意图。Anthropic开发的"特征电路"技术可追踪影响答案的关键计算路径,但该方法仅能覆盖少量计算层,分析长思维链需耗费数小时,难以规模化应用。其二为OpenAI提出的"忏悔报告"机制,要求模型在完成任务后独立生成诚实性评估,其奖励系统与任务完成度完全解耦。早期实验显示该方案可将违规漏报率控制在4.4%以内。
雅库布在文中坦言,当前没有任何实验室的安全监控能力能匹配模型进化速度。他呼吁行业暂停非必要的能力竞赛,优先建立统一安全标准。这场关于思维链的攻防战,实质上已成为人类与智能系统之间最关键的博弈领域。











