ITBear旗下自媒体矩阵:

AGI双轨并行:语言与世界模型双路探索,中国AI拓新途

   时间:2026-09-10 22:56:13 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在通往通用人工智能(AGI)的探索之路上,不同技术路径正展现出独特的发展态势。过去三年,以语言为核心的主流叙事占据主导地位,通过增加文本量、扩大模型参数、延长上下文长度以及强化推理能力,结合工具调用与智能体技术,让机器具备了读写、编程、检索和规划等能力,甚至开始承担部分原本局限于电脑屏幕的复杂工作。

然而,当任务从虚拟场景转向物理世界时,挑战陡然升级。以拧灯泡为例,机器人不仅要识别物体,还需精准判断手指的接触方式、旋转角度和力度,并在出现偏差时及时调整。这要求机器人具备一套能够预演行动后果、复盘得失的内部模型,而非仅仅依赖描述世界的静态知识。

当前,AGI领域的竞争正呈现分化趋势。智谱与生数科技作为从清华大学实验室走出的两家代表性企业,分别选择了不同的技术路径:前者以语言模型和智能体为核心,后者则聚焦于世界生成、实时交互与行动模型。这两条路径如同攀登同一座山峰的南北坡,虽起点不同,但目标一致——构建真正理解并适应物理世界的智能系统。

拧灯泡这一简单动作背后,隐藏着机器人技术面临的深层挑战。人类在执行此类任务时,并非通过复杂计算,而是依赖实时感知和反馈调整动作。而当前机器人虽能理解指令并复现训练轨迹,但在面对位置偏差、材质变化或物体打滑等意外情况时,仍缺乏灵活应对的能力。这凸显了构建“内在世界”模型的重要性——只有具备预演和反馈机制,机器人才能真正适应动态变化的物理环境。

世界模型作为AI领域的新前沿,正吸引不同学科的研究者从各自角度展开探索。视频生成领域关注时间维度下的世界演化规律,空间智能强调多视角环境建模,而机器人和自动驾驶技术则聚焦于行动对世界状态的影响。尽管产出形式各异,但这些研究都围绕一个核心闭环展开:智能体通过观察、行动、反馈和再观察的循环,逐步理解并适应世界。

今年6月,李飞飞团队在《A Functional Taxonomy of World Models》中,从经典POMDP框架出发,将世界模型系统归纳为渲染器、模拟器和规划器三大功能模块。两个月后,朱军团队在《General World Models from First-Principles》中进一步提出,通用世界模型需实现理解、想象和行动能力的有机耦合与自我修正。这一研究为构建真正自主的智能系统提供了理论框架。

朱军团队将通用世界模型的发展划分为五个层级:从学习世界演化的基础能力,到与世界交互的动态适应,再到在环境中行动并获取反馈,最终实现围绕长期目标的自主感知、规划和学习。这一路线图揭示了智能体自主性逐步解锁的过程,为技术发展提供了清晰的方向指引。

大语言模型与世界模型并非替代关系,而是构成了智能建设的双重基础。前者以文本、代码和符号为材料,侧重于机器对人类知识系统的理解与运用;后者则基于时间、空间和反馈机制,致力于培养机器对物理世界的动态认知能力。两条路径分别从语言和行动出发,最终都指向构建具备全面认知能力的AGI系统。

维特根斯坦“语言的边界意味着世界的边界”这一论断,在AI时代被赋予新内涵。语言模型扩展了机器的理解与表达能力,而世界模型则赋予其感知物理世界变化的能力。前者让智能系统拥有丰富的语言与计划工具,后者则为其提供扎实的世界经验与因果推理能力。这两条路径的协同发展,将成为推动AGI进步的关键力量。

以生数科技的技术布局为例,其发展路径清晰展现了世界模型的重要性。从视频生成模型Vidu学习世界演化规律,到Vidu S1实现实时交互与状态更新,再到Motus系列探索行动模型,该公司逐步构建起理解、预测、行动与反馈的完整闭环。最新发布的Motus2模型,通过统一框架整合动作生成、后果预测和策略优化功能,标志着机器人技术向自主性迈出了重要一步。

在商业应用层面,生数科技已将世界模型技术转化为实际生产力。其视频生成模型支持长达16秒的多语言视频创作,涵盖多人对话、切镜和多镜头叙事等功能,可应用于影视、广告等领域。Vidu S1则突破传统AI视频生成模式,允许用户在生成过程中持续输入指令并实时调整画面。而世界动作模型Motubrain采用多模态架构,可驱动多种机器人理解并适应物理环境,为工业自动化和智能服务提供了新的解决方案。

生数科技的技术积累源于长期主义的研究坚守。其创始人朱军作为国内概率机器学习领域的领军学者,早在十余年前便开始探索机器在不确定环境中的决策机制。这种学术传承在朱军团队中得到了延续——该团队提出的免训练推理算法被全球多家顶尖机构采用,并应用于知名AI生图工具中。同时,朱军构建的人才培养体系也为行业输送了大量核心骨干,其中不乏扩散模型领域的奠基者和顶级AI实验室的负责人。

在中国AI产业版图中,技术路径的多元化发展正成为显著特征。当智谱持续完善语言与工具的基础设施时,生数科技等企业则在时空感知与行动建模领域展开原生探索。这种分化并非简单的技术选择,而是中国团队针对AGI核心难题提出的差异化解决方案。两条路径的并行发展,既体现了技术自信,也为全球AI创新贡献了独特视角。

随着研究的深入,语言与行动、虚拟与物理的界限正在逐步模糊。未来的智能系统或将同时具备谈论世界与改造世界的能力——既能通过语言理解人类意图,也能在行动前预演后果,并在实践中不断优化认知。这种融合发展态势,正推动中国AI产业在南北两坡同时刻下独特的足迹。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version