智象未来(HiDream.ai)近日宣布推出具身世界模型HiDream-O1-Embodied,标志着其原生全模态技术路线正式延伸至机器人物理操作领域。该模型聚焦真实环境中的动态感知与任务执行,通过整合图像、视频、3D空间及动作数据,构建起跨模态的统一技术框架,为机器人提供更接近人类认知的交互能力。
在具身智能评测平台RoboColiseum的首次测试中,HiDream-O1-Embodied以0.692的平均分登顶Robustness(扰动适应)子榜单。该评测通过模拟背景变化、光照干扰、材质替换等20余种环境扰动因素,全面检验模型在非理想条件下的稳定性。测试覆盖78个高保真仿真任务,涵盖指令跟随、空间理解等四大能力维度,成为衡量具身智能模型泛化能力的行业基准。
针对真实场景中的视觉干扰问题,研发团队从三个维度强化模型鲁棒性:语言理解模块通过解析不同动词组合与句式结构,减少对固定指令的依赖;视觉感知系统采用多摄像头数据融合技术,当部分视角受遮挡或发生偏移时,可自动调用其他视角信息维持场景判断;容错机制则通过模拟相机抖动、画面污损等异常情况,训练模型在信息缺失时依然保持决策能力。这些技术突破使机器人能在复杂环境中更自主地完成任务。
训练数据构建方面,智象未来创新采用"真实基座+生成增强"模式。以与动作捕捉企业诺亦腾的合作项目为例,团队先将高精度人体运动数据作为基础样本,再通过模型生成百倍规模的扩展数据集。在保持物理约束的前提下,系统可自动调整背景、光照强度及物体形态等参数,使单段真实动作衍生出数千个训练变体,有效解决具身数据稀缺难题。
此次发布的模型与上月问世的交互式世界模型HiDream-O1-World形成技术互补。后者在数字环境推演评测基准WBench的导航任务中取得80.9分,而新模型则专注于物理世界的操作执行。目前智象未来已形成包含图像生成、交互建模、具身控制在内的完整模型矩阵,其技术路线正从单一模态向图像、视频、3D空间与动作的融合体系演进。
据技术团队披露,下一代研发将聚焦跨模态因果推理能力的突破。通过构建物理世界数字孪生系统,模型有望在执行任务前预判动作后果,实现更安全的人机协作。这种从感知到认知的技术跃迁,或将重新定义机器人与真实环境的交互方式。











