ITBear旗下自媒体矩阵:

τ(0)-VLA:具身智能新突破,引领机器人迈向“先想后做”长程任务时代

   时间:2026-07-27 20:03:08 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

在刚刚落幕的2026 WAIC上,具身智能成为备受瞩目的技术焦点。透过这场行业盛会,一个明显趋势浮现:产业关注的焦点正从机器人单点技能展示,转向更具现实意义的挑战——当机器人走出精心设计的演示环境,进入家庭、工厂等真实场景,能否稳定完成复杂任务?这标志着具身智能进入新阶段,竞争重点从“让机器人学会动作”转向“让机器人完成任务”。

过去几年,具身智能领域取得重要进展,机器人开始具备“理解世界并执行动作”的能力。随着视觉-语言-动作(VLA)模型的发展,机器人能根据自然语言指令完成抓取、整理物品、使用工具等操作。然而,真实世界中的任务很少是孤立动作,像“整理房间”“准备一顿饭”“完成仓库拣选”等典型场景,往往包含数十个连续步骤。机器人不仅要感知当前环境,还需理解任务进展、判断下一步行动,并预测行为对最终目标的影响。对人类而言,这些过程依赖长期经验和大脑规划能力自然完成,但对机器人却是巨大瓶颈。

这是否意味着VLA不再适配具身智能新需求?答案是否定的。VLA的能力边界仍在不断拓展。今年4月,Physical Intelligence发布的π0.7模型,通过引入多样化上下文条件,让VLA模型利用更多类型、更大规模现实世界数据,在训练端提升对复杂任务的泛化能力。π0.7的成功让业界看到VLA的潜力,也引发思考:在推理阶段是否还有探索空间?

近期,上海创智学院罗剑岚团队与智元机器人具身研究中心联合发布的τ(0)-VLA模型给出了新思路。该模型提出“慢思考-快执行”分层VLA架构,将高层任务规划与低层动作执行解耦,首次将Test-Time Scaling推理与世界模型推演引入具身智能上层决策。这使得机器人能完成数十个连续决策步的长程任务衔接,并在真实场景下自主闭环执行。与π0.7从数据中提炼规律不同,τ(0)-VLA让VLA“深谋远虑”,执行任务前投入算力长思考后再行动。

τ(0)-VLA还是当下最大规模真机数据预训练的具身基础模型,预训练使用40115小时真实物理世界交互数据,其中超2万小时为真机数据,覆盖多种机器人形态和操作场景。实验显示,在多项长程真实任务中,τ(0)-VLA相比传统VLA模型展现出更强任务完成能力,或许“先想后做”是解锁真实场景闭环执行的关键。

随着具身智能从实验室展示转向真实场景落地,VLA模型的局限逐渐显现。过去两年多,以π0.5、GR00T等为代表的VLA模型推动机器人迈过关键阶段,能理解自然语言并根据视觉环境完成动作,在“短程任务”中展现灵活性。但现实世界任务多为长程任务,以“整理房间”为例,机器人需完成目标搜索、物体抓取、空间移动等多个步骤,并根据环境变化调整策略。当前主流VLA路线存在不足,其本质是反应式决策范式,将当前观测与语言指令直接映射为低层动作,缺乏对任务历史、执行进度与后果的显式建模。这种“看一眼、做一下”的方式在短程任务中尚可,但在复杂场景中会暴露误差累积、步骤重复与遗漏、目标漂移等系统性缺陷。

τ(0)-VLA的解决方案是构建“慢思考”与“快执行”协同的双系统架构,并将世界模型引导的测试时计算引入具身决策。其设计灵感源自人类脑科学的双系统理论:人类完成复杂任务时,先理解目标、制定计划,再通过身体执行,上层负责前瞻规划与推理(慢思考),下层负责运动肌肉反应(快执行)。τ(0)-VLA将机器人系统拆分为高层规划系统和低层动作系统,高层系统理解用户目标、拆解任务、跟踪执行状态,规划下一步行动;低层系统将高层选定的子任务转化为稳定、实时的全身动作。这种分层设计避免了传统VLA的困境,将“决策审议”与“动作执行”解耦,让高层系统投入更多计算进行任务推理,低层系统保持快速稳定动作执行,实现“想清楚”与“做到位”的统一。

高层慢决策系统运行在子任务粒度上,由四大模块协同构建审议与反思闭环。Propose Model结合指令、当前观测与执行历史,生成多个候选下一步子任务;World Model基于图像编辑模型,预测执行候选任务后的环境状态,输出“想象中的未来画面”;Value Model对世界模型推演的未来状态进行多维度打分,评估动作对总体任务目标的完成度、安全性和隐性风险;Reflective Model横向对比所有候选方案推演结果,输出最终子任务决策,若得分最高方案与整体任务进度冲突,则触发重选与规划调整机制。这四大模块构建了子任务级束搜索机制,将测试时算力精准投向对真实物理世界“链式物理影响”的前瞻评估。

低层快执行系统是专为真实物理部署设计的高频全身动作模型,其核心是构建统一40维全身动作空间。通过统一动作表示方式,多种形态机器人无需改变模型主干,仅通过掩码屏蔽无需使用的自由度,即可实现跨本体无缝适配。这不仅降低具身策略对特定硬件的依赖,还为模型从异构机器人数据中学习通用物理交互规律奠定基础。执行过程中,低层动作系统通过视觉反馈持续更新环境状态,以闭环方式生成连续动作,提高面对真实世界扰动时的稳定性。

数据成为具身智能竞争的关键因素。机器人需从真实物理世界中学习动作与环境关系,数据规模和质量决定具身模型能力。为训练τ(0)-VLA,研究团队构建了40115小时真实世界机器人交互数据训练体系,数据包含机器人真机和UMI数据及多个公开数据集,覆盖多种机器人形态。其中超2万小时真机交互数据涵盖多个机器人平台,构成覆盖多机器人、多任务、多场景的物理世界经验库,让模型学习不同机器人形态下的通用操作规律。训练方式上,τ(0)-VLA采用高层规划系统与低层动作系统协同训练方式。低层策略从机器人示范数据和多模态数据中学习动作执行能力,高层规划器利用任务分解标注、执行记忆及世界状态变化信息,学习拆解任务、预测未来并选择行动。团队加入多模态联合训练数据,保持模型视觉语言理解能力,形成从感知、理解到规划、执行的完整训练体系。

为验证长程任务能力,研究团队在真实机器人平台上评估复杂任务场景,实验包括全屋清洁、烹饪、制作奶茶、抽屉搜索以及桌面整理等任务。在“全屋清洁”任务中,机器人进入卧室收集脏衣服放入洗衣篮,找到手提包挂到衣帽架,找到毯子递给人员,完成卧室内任务后前往客厅整理桌面物品,最后将炉灶旁的番茄炒鸡蛋端到客厅桌子上。实验结果显示,引入层级规划系统后,τ(0)-VLA在AGIBOT G1平台上的平均成功率由27.5%提升至45.0%,平均任务进度由80.10%提升至87.85%,相比主流VLA模型,在长程任务完成能力上明显提升。这表明在多步骤、长时间任务中,高层任务规划与世界模型引导的推理机制能显著增强机器人执行能力。

团队还测试了τ(0)-VLA在不同机器人平台上的直接执行能力。在不调用高层规划系统的情况下,τ(0)-VLA在四项操作任务中均取得最高性能表现,其中三项任务达到10/10成功率,展现出更强跨机器人形态泛化能力和稳定操作能力。这表明τ(0)-VLA不仅具备任务规划能力,其低层动作策略也具备跨机器人形态的泛化能力。

τ(0)-VLA展示了从“动作智能”走向“任务智能”的系统架构。早期行业关注机器人“能不能动”,竞争重点在硬件结构等方面;随着VLA发展,竞争转向机器人“能不能理解指令并完成动作”,模型赋予机器人更强视觉理解和操作能力。但进入真实应用场景后,机器人需在开放环境中持续完成复杂任务,具身智能正从“会动”走向“会做事”。τ(0)-VLA提出的“先推演、后执行”范式,探索了新的机器人智能系统路径,在保证低层实时控制的同时,通过任务记忆、世界模型和测试时计算增强高层决策能力,让机器人从被动执行走向主动规划。

此前,团队先后发布了面向真实世界大规模后训练强化学习系统LWD、预训练具身世界模型τ0-WM。如今,τ0-VLA将高层规划、世界模型与低层执行组织到长程任务框架中。三项工作共同指向一条以“大规模预训练 + 大规模后训练”为核心的路线:预训练提供通用能力,世界模型预演行动后果,τ0-VLA完成复杂任务,真实部署产生的数据通过LWD回流训练,形成持续进化的数据闭环,使机器人能力在部署后持续进化,真正从实验室走向复杂真实场景。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version