在世界人工智能大会的展台上,曾经以舞蹈、翻跟头等表演吸引眼球的机器人逐渐退场,取而代之的是能够完成分拣、搬运、操作工具等实际任务的智能设备。这一转变背后,是行业对机器人“价值创造”能力的重新审视,也是具身智能领域数据积累从量变到质变的集中体现。帕西尼感知科技创始人兼CEO许晋诚在接受采访时指出,当机器人不再满足于“动起来”,而是追求“干得好”,数据的质量与规模便成为决定技术突破的关键因素。
作为估值超百亿元的具身智能企业,帕西尼的实践印证了这一趋势。公司已在无锡、天津、宿迁等城市部署了五大数据采集工厂,将传感器嵌入生产车间、物流仓库、公共场所甚至私人空间,通过模拟人类操作、环境交互等场景,积累覆盖触觉、力觉、视觉、听觉等多模态的原始数据。许晋诚透露,目前采集的数据量已突破百万小时,并向千万小时级迈进。这种“数据狂奔”的背后,是团队对传感器融合技术的深度探索——通过将力学传感器、视觉摄像头、关节编码器等设备集成,系统能在5毫秒内完成数据同步,确保机器人操作时“手眼协调”无延迟。
当被问及机器人形态同质化问题时,许晋诚给出了一个颇具颠覆性的观点:未来主流机器人将收敛至人形结构,但移动方式会分化为两条路径。他解释道,当前训练数据90%以上来自人类行为,而人类构型是承载这类数据的最优载体。“如果未来最大规模的数据集来自章鱼,那机器人自然会长出触手。”他举例道。不过,人形机器人并非“千篇一律”,根据应用场景需求,双足行走方案将侧重运动灵活性,轮式方案则追求续航与稳定性,这种分化将体现在下肢结构设计上。
数据模态的丰富性直接决定了模型训练的上限。许晋诚以视觉数据为例,传统第一视角(Ego)数据仅依赖单目摄像头,后期需通过算法提取手部关节信息,不仅耗时且易引入误差。而帕西尼的解决方案是“全模态采集”:在数据采集阶段就集成触觉阵列、六轴力传感器、3D视觉摄像头等设备,让机器人从一开始就“感知”到完整的环境信息。“模态越丰富,数据有效性呈指数级增长。”他强调,这种策略使模型能直接“消化”原始数据,无需额外清洗与标注,大幅降低了算力成本。
真实场景的数据采集面临多重挑战。帕西尼的团队曾遇到这样的困境:在工厂环境中,机器人需要适应金属表面的反光、油污的干扰,以及工人操作时的突发碰撞。为此,他们开发了自适应触觉传感器,能根据环境变化动态调整灵敏度;同时,通过在数据中注入“噪声”——模拟传感器故障、网络延迟等异常情况,提升模型的鲁棒性。“就像人类需要接触不同材质、应对意外状况才能积累经验,机器人也需要‘吃透’各种极端场景。”许晋诚说。目前,公司的数据采集网络已覆盖200余种真实环境,包括高温车间、潮湿仓库、嘈杂商场等,为模型训练提供了“全气候”素材。
对于行业关注的“数据瓶颈”,许晋诚认为,当前最大的挑战并非数据量不足,而是数据分布的失衡。他指出,现有数据集中,80%以上来自结构化环境(如实验室、标准化车间),而非结构化场景(如户外、家庭)的数据占比过低,这导致机器人在复杂环境中表现不稳定。人类操作数据的“主观性”也是隐忧——不同工人的操作习惯、力度控制存在差异,若模型过度拟合特定个体的数据,反而会降低泛化能力。为此,帕西尼正在构建“人类操作行为图谱”,通过分析数万名工人的操作数据,提取共性特征,为模型提供更“中性”的训练样本。











