北美具身智能领域迎来重大突破,初创公司Skild AI近日发布全新机器人基础模型S1,将机器人上下文学习能力推向新高度。该模型通过观看一段人类示范视频,即可完成长达10分钟以上的复杂操作任务,在煎饼制作、咖啡冲泡、植物换盆及设备组装等未见过的任务中,成功率达到66%,远超基于语言提示的视觉语言动作模型(VLA)9%的水平。
传统机器人学习新技能需经历预训练和后训练两个阶段:先在海量数据中学习基础能力,再针对特定任务收集数据并微调模型。这一过程不仅耗时耗力,且数据采集成本高昂。Skild AI指出,若每个新任务仍需数十甚至数百小时真机数据重新训练,所谓"基础模型"的价值将大打折扣。该公司以大模型发展路径为参照,提出机器人应突破"BERT时代"的局限,向"GPT时代"转型——即通过上下文学习(ICL)直接理解任务意图,而非依赖模型权重调整。
S1模型的核心创新在于其上下文学习能力。在官方演示中,机器人仅需观看一段翻煎饼视频,即可完成从原料准备到成品制作的全流程,即使该技能从未出现在训练数据中。更令人瞩目的是,在植物换盆等长程任务中,机器人需连续执行数十个操作步骤,并实时判断当前进度、规划后续动作,甚至在操作失误时自主调整策略。从录制演示到机器人自主完成任务仅需11分钟,且全程未进行任何微调或后训练,模型权重保持不变。
实验数据显示,随着训练数据规模扩大,ICL的优势愈发显著。当训练数据达10万小时时,ICL在见过任务上的成功率达96%,语言提示VLA为89%;在未见过的任务上,ICL成功率66%,语言提示VLA仅9%,差距扩大至7倍以上。在单次演示学习(One-shot Learning)测试中,S1仅需观看一条视频即可达到66%的成功率,而传统VLA需约380次演示后训练才能达到同等水平。尽管增加至2000次演示后,传统方法最终成功率可达86%,但Skild AI强调,ICL的意义在于将新技能学习成本从"反复教导数百次"降至"演示一次即掌握六七成"。
作为北美具身智能领域的明星企业,Skild AI的估值在两年内增长近10倍。2024年完成3亿美元A轮融资后,今年1月又获得14亿美元C轮融资,投资方包括软银、英伟达和杰夫·贝索斯等。与同行专注特定形态机器人或全栈解决方案不同,Skild AI提出"任何机器人,任何任务,一个大脑"的愿景,致力于开发跨形态的通用智能层,类似机器人时代的安卓系统。其最新成果表明,机器人学习新技能的方式可能正在发生根本性转变——从"反复训练"转向"观察理解",这一变革或将重新定义人机协作的边界。












