ITBear旗下自媒体矩阵:

OpenAI“循环Transformer”架构揭秘:Astra如何实现性能跃升与思考“隐身”

   时间:2026-09-03 23:14:48 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

OpenAI下一代模型Astra尚未正式发布,却已在科技圈掀起轩然大波。据多方消息透露,这款模型采用了一种名为“循环深度”(recurrent depth)的全新推理架构,在性能提升的同时大幅减少了思考所需的Token数量,引发了行业对AI技术演进方向的热烈讨论。

传统Transformer模型如同单程电梯,数据从底层逐层向上传递,完成固定次数的运算后输出结果。若要增强推理能力,只能通过增加模型层数或参数规模,但这会带来巨大的算力消耗。而Astra采用的“循环Transformer”架构则打破了这一限制——它让数据在相同的网络层中反复循环处理,通过多次迭代深化推理过程,而非单纯依赖模型规模的扩张。

这种设计并非OpenAI首创。谷歌2025年发表的论文《Reasoning with Latent Thoughts》曾证明,一个包含k层、循环L次的Transformer模型,在多项推理任务中可达到接近k×L层普通模型的性能,而参数量并未同步增加。今年2月,另一项研究通过让35亿参数的小模型核心块循环运行,在足够多的迭代次数下,其表现竟媲美500亿参数的大模型,验证了“循环深度”架构的潜力。

Astra的突破性在于将这一技术推向实用化。据测试,该模型在数学和编程等需要多步迭代的领域表现尤为突出。例如,在解决复杂问题时,它不再像传统模型那样通过输出大量中间步骤的文本(即“思维链”)来展示推理过程,而是将计算隐藏在向量空间中,通过多次循环内部状态完成深度推理,最终仅输出简洁的结果。这种“静默思考”模式虽提升了效率,却也让人类难以直接观察模型的决策路径。

OpenAI首席科学家Jakub Pachocki回应外界质疑时表示,Astra及公司其他前沿模型的计算图深度仅为GPT-4的两倍,远低于部分传闻的夸张程度。但他同时承认,“循环深度”架构通过优化计算流程,实现了性能与成本的平衡。例如,在计算机使用任务中,Astra已展现出接近人类水平的操作能力,且能持续运行数周而不中断,这得益于其内部状态的高效迭代机制。

技术社区对Astra的争议集中于可解释性。传统模型通过输出思维链文本,为人类提供了理解其决策的窗口;而Astra的“隐身思考”模式则关闭了这一通道。支持者认为,这符合AI向更高效、更接近人类认知方式演进的趋势;反对者则担忧,缺乏透明度的模型可能带来不可控的风险。meta此前在“连续思维链”(Coconut)研究中指出,模型使用向量而非文本进行推理,可能更准确且节省资源,但这一优势以牺牲可解释性为代价。

尽管争议未平,Astra的实力已通过部分演示得到验证。在前端开发任务中,其表现堪称“统治级”;在持续性智能体场景中,它能长时间自主运行而无需人工干预。OpenAI多位研究员近期频繁暗示这款模型的强大能力,甚至有内部人士称其为“赛博义父”级别的突破。随着GPT-6上线传闻的扩散,整个行业正屏息等待这场技术革命的正式到来。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version