南洋理工大学与ACE Robotics联合团队近日发布了一项突破性研究,通过构建名为ACE的环境捕捉引擎,首次系统性地记录了人类在真实家庭环境中的完整日常活动。该研究以预印本形式在arXiv平台公开,论文编号为arXiv:2607.28625,同步公开的ACE-Data-0数据集包含超过150小时的多模态同步数据,为机器人学习领域提供了前所未有的训练资源。
传统机器人训练面临的核心困境在于缺乏"生活教程"。尽管语言模型依赖数百年文字积累,图像识别依赖海量照片,但诸如"如何抓握玻璃杯"、"起身走向冰箱时的身体协调"等基础技能,从未被系统性记录。现有数据集要么仅包含视频片段而无身体动作数据,要么在实验室环境中拍摄,无法反映真实家庭的复杂性。研究团队指出,模态碎片化、环境不自然、时间跨度过短已成为制约机器人发展的三大瓶颈。
ACE系统的创新在于将家庭环境转化为专业数据采集中心。该系统分为桌面尺度与房间尺度两种配置:前者通过8台GoPro相机与16台OptiTrack摄像机,能捕捉毫米级的手部操作细节;后者在200平方米公寓中部署8台ZED One相机与12台OptiTrack摄像机,实现全身运动追踪。参与者需佩戴包含41个关节标记点的动作捕捉服、Manus动作捕捉手套及ACE-Sense-Glove Lite触觉手套,使每个动作同时被记录为视觉画面、三维坐标、关节角度、压力分布及环境音频等多维度数据。
时间轴对齐是该系统的工程核心。研究团队以OptiTrack系统的纳秒级时钟为主时钟,通过光学时钟方案将外部摄像机时间精度提升至毫秒级。对于触觉手套,则利用IMU传感器运动相关性进行时间校准。空间对齐方面,特制ArUco标定板同时集成红外标记球与棋盘格图案,使动作捕捉坐标系与RGB摄像机坐标系实现纳米级转换。这种设计确保所有传感器数据在统一时空框架下精确同步。
数据采集采用目标导向的自然行为设计。任务分为原子级手部操作(如倒水)、连锁式家务循环(如烹饪全流程)及人场景交互(如深蹲行走)三类。参与者仅接收目标指令(如"准备茶饮并端至桌上"),而非步骤指导,这种设计使50位参与者展现出自然的行为差异。数据显示,有人先找茶包后烧水,有人则相反,这种多样性显著提升了数据集的泛化价值。
标注体系构建了完整的语义-物理映射。除物体类别与位姿外,系统提供全身41个关节的三维坐标序列、双手42个关节的精确角度、标准化触觉压力热图及Gemini大模型生成的自然语言描述。所有标注均来自传感器直接测量,而非算法估计,确保在遮挡、快速运动等极端条件下仍保持高可靠性。例如,触觉标注与视频帧共享时间轴,可精确查询任意时刻手掌各区域接触强度。
基于该数据集的三级基准测试揭示了当前技术边界。在"视觉预测触觉"任务中,最佳模型的空间重叠精度仍处较低水平,表明从画面推断触感极具挑战;人体姿态估计测试显示,局部关节精度与全局轨迹估计存在显著落差,场景感知方法对轨迹估计有帮助但对关节估计提升有限;手部轨迹重建测试表明,第一视角因头部运动补偿困难导致误差较大,第三视角则因稳定空间参考系表现更优,两者融合或成未来方向。
该数据集已通过Hugging Face平台公开下载,账户名为ACERobotics。其价值不仅限于支撑现有基准测试,更可赋能模仿学习、世界模型构建、视觉-语言-动作系统开发及触觉感知迁移等前沿领域。研究团队强调,当前版本仅覆盖两个采集场地,未来将扩展至更多家庭环境与物体种类,系统设计预留的标准化采集流程可支持快速迭代升级。











