正在举行的世界机器人大会上,各类人形机器人成为焦点,其中具身智能的发展前景引发广泛讨论。宇树科技创始人王兴兴在主论坛演讲中提出,行业正等待一个关键转折点——具身智能的"ChatGPT时刻"。他将其定义为:在80%的陌生环境中,机器人仅通过语音或文字指令就能独立完成80%的任务。
这位刚完成科创板上市的企业家预计,这一突破最快将在2至3年内实现,最长可能需要5至10年。这一判断并非首次提出,今年3月的中国网络媒体论坛上,他就曾预测2026至2027年将出现重大技术进展。如今从行业论坛到国际展会,从企业上市到技术研讨,他的核心观点始终未变:硬件能力已非主要障碍,真正的挑战在于AI与实体的深度融合。
当前技术瓶颈集中体现在"对齐"问题上——如何将数字世界的指令精准转化为物理世界的可靠动作。以"取温水"任务为例,理想状态下机器人应能自主完成定位饮水机、调节水温、避开障碍等步骤,但实际场景中常出现定位偏差、动作失误等情况。这种"脑体不同频"的现象,暴露出AI模型与机械系统间的适配缺陷。
技术专家将此比喻为"学霸的动手能力训练":大模型虽掌握海量理论知识,却缺乏应对真实世界的实操经验。就像智能手机爆发不仅依赖处理器性能,更需要操作系统打通软硬件壁垒,具身智能同样需要一套底层架构实现AI与机械的完美协同。这种适配不仅需要算法优化,更需通过大量真实场景测试逐步完善。
展会现场,300余家顶尖企业展示了从运动控制到环境感知的最新成果。宇树、智元等企业的人形机器人已能完成复杂动作演示,但距离王兴兴描述的"通用场景自主作业"仍有差距。行业观察者指出,AI从虚拟世界向物理世界的迁移已成必然趋势,但这个过程需要突破数据采集、实时反馈、安全控制等多重技术壁垒。
这场关于技术时间表的争论持续发酵。支持者认为,随着多模态大模型和传感器技术的突破,关键节点可能提前到来;谨慎派则强调,物理世界的复杂性远超数字空间,每个新场景都需要针对性优化。这场讨论本身,正折射出机器人产业从技术演示向实用化转型的关键特征。










