ITBear旗下自媒体矩阵:

具身智能新突破:李飞飞等大咖助力,T-Rex让机器人灵巧手“触”向未来

   时间:2026-07-26 21:08:06 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

具身智能领域迎来一场引人瞩目的突破,一支由顶尖学者组成的团队聚焦灵巧手技术,提出名为T-Rex的创新架构,为机器人实现精细操作开辟新路径。这项研究不仅汇聚了计算机视觉、深度强化学习、机器人学等领域的权威专家,更通过系统性方案解决了触觉数据与视觉模型融合的难题。

传统机器人操作依赖视觉数据,但在灵巧手执行翻书页、开锁等复杂任务时,纯视觉方案暴露出明显局限。例如,机械手指的精密运动需要毫秒级触觉反馈,而视觉信号处理速度仅能达到5-10Hz,两者频率差异导致模型难以同步感知与决策。研究团队通过实验发现,直接将触觉信号接入预训练视觉模型,任务成功率反而从17%骤降至6%,这暴露出多模态数据融合的深层矛盾。

T-Rex架构采用"异步级联专家模型"设计,为不同模态数据开辟独立处理通道。其中视觉专家负责预测运动趋势,动作专家规划低频轨迹,触觉专家则以20Hz频率进行高频修正。这种分工机制通过扩散模型的"四步分割点"实现:前六步由动作专家生成粗略轨迹,后四步由触觉专家注入实时力反馈数据。实验表明,该架构在12项真实任务中取得65%平均成功率,较纯视觉方案提升30个百分点,尤其在开锁等需要精准力控的任务中表现卓越。

触觉信号处理面临传感器噪声与零点漂移等技术挑战。研究团队采用VQ-VAE时序编码技术,将0.5秒内的力反馈压缩为64个离散码字,使模型能够区分按压、滑动、插入等不同接触状态。通过动态码本激活机制与接触帧加权策略,系统有效过滤了90%的传感器噪声,同时将关键接触点的学习权重提升3倍。这种编码方式使触觉数据具备可解释性,研究人员可直观观察模型对不同接触状态的识别结果。

训练策略采用三阶段递进模式:首先在22,889小时人类视频数据上预训练运动先验知识,接着通过100小时遥操作数据学习207种物体与22种动作基元的组合关系,最后用100条任务演示进行微调。中期训练阶段尤为关键,其通过基元组合策略使模型理解"搓动"在不同材质物体上的力度差异,这种泛化能力使系统在仅10条演示数据时就能达到40%成功率,而未经过中期训练的模型则完全失效。

该研究对硬件提出新要求:灵巧手需具备22个自由度与180Hz触觉采样率,手掌区域需覆盖高密度力传感器。这种设计使触觉数据采集成本达到平行夹爪的5-10倍,但研究团队通过异步架构将数据利用率提升40%。实验显示,系统在处理未知物体时仍能保持58%成功率,证明其具备跨任务迁移能力。

这项突破正在重塑具身智能技术路线。传统方案聚焦关节传动形式与自由度数量的争论,而T-Rex团队证明触觉数据才是精细操作的核心要素。当灵巧手从执行器升级为感知-决策枢纽,其数据价值将占整机系统的60%以上。研究团队已开放项目代码,并与多家机器人企业开展合作,推动触觉感知标准的数据采集与训练范式建立。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version