自变量机器人团队近日推出了一项名为HOST(Human-to-robot One-Shot Skill AcquisiTion)的创新框架,并宣布将其核心代码与研究论文全面开源。该框架旨在通过观察人类操作视频,使机器人快速掌握新技能,同时无需遗忘已具备的能力。据官方披露,HOST仅需一段数十秒的人类演示视频,即可让机器人以62%的成功率复现技能,较传统零样本学习方法提升45%,且数据需求量减少50倍,学习效率提高500倍。
HOST的设计灵感源自认知科学中的“观察学习”理论。研究人员发现,人类在面对陌生任务时,往往通过大脑模拟预期结果来规划行动,而非依赖反复试错。基于这一洞察,团队将传统机器人训练中的“训练时微调”模式,转变为“推理时技能获取”模式,使机器人能够像人类一样,通过观察他人操作直接推导行动策略。这一转变显著降低了机器人对大量标注数据的依赖,为家庭服务机器人等场景提供了更可行的解决方案。
技术实现层面,HOST的核心挑战在于如何同步机器人操作进度与视频演示进度。例如,当人类在10秒内完成切菜并开始炒菜时,机器人可能仍在切菜阶段。若仅按时间对齐,会导致任务进度错位。为此,HOST采用“动态时间规整”算法,将视频帧与机器人操作步骤映射至同一向量空间,通过计算向量间的最优匹配路径,实现“人类视频第X帧”与“机器人操作第Y步”的精准对齐。实验数据显示,该方法将任务进度对齐误差降低了一个数量级,确保机器人执行与视频示范的同步性。
HOST的模型架构采用双专家MoT(Mixture of Time-series Experts)设计,包含“视觉大脑”与“动作大脑”两个模块。“视觉大脑”负责处理视频画面、定位任务阶段,并预测未来场景变化;“动作大脑”则将预测结果转化为具体动作指令,控制机器人执行。这种分工模式使模型能够同时处理时空信息与动作决策,提升了技能迁移的准确性。
训练过程分为两个阶段:在“同体预训练”阶段,机器人通过分析自身执行任务的视频,学习预测任务完成状态并生成对应动作;在“人机视频训练”阶段,模型进一步学习人类演示视频,将人类操作过程转化为机器人视角下的任务结果,再反向推导所需动作。这种分阶段训练策略,使机器人能够从人类示范中提取通用技能模式,而非简单模仿表面动作。
目前,HOST框架已支持多种家庭劳动场景的技能迁移,例如整理物品、操作工具等。其开源特性为机器人研究社区提供了新的技术路径,未来或可推动服务机器人摆脱专业化数据采集的束缚,通过更直观的人类演示快速适应多样化任务需求。












