ITBear旗下自媒体矩阵:

对话朱毅:多模态智能如何突破?2027年或迎关键转折点

   时间:2026-08-23 22:52:59 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在人工智能领域,Coding Agent的快速发展让代码生成与实验验证的闭环成为现实,但Prana Labs联合创始人朱毅指出,真正的挑战在于如何提出创新性的想法,并在最终环节定义标准、验证结果并承担责任。他强调,技术落地的关键在于构建完整的闭环系统,而这一理念贯穿了他十余年的研究历程。

朱毅的学术与职业轨迹跨越多个领域:从加州大学默塞德分校的视频理解研究,到亚马逊AI的多模态表征探索,再到Boson AI的语音交互开发,最终聚焦于Prana Labs的物理智能方向。尽管研究方向看似分散,但他认为这些领域共同指向一个核心问题——如何让智能系统真正服务于人类需求。例如,视频理解帮助机器观察人类行为,语音交互使人与智能体自然沟通,而物理智能则要求模型理解行动的后果。

在朱毅看来,多模态智能仍处于早期阶段,但预计2027年前后将迎来方法论的统一。他将其类比为语言模型的发展路径:从早期探索到GPT系列的规模化突破。这一判断基于当前行业在模型、算法和数据层面的积累,以及李飞飞团队近期提出的“世界模型功能分类”框架——该研究指出,渲染器、模拟器和规划器三大路径的界限正在模糊,为多模态智能的融合提供了理论基础。

朱毅特别强调环境在智能发展中的作用。他指出,传统模型仅通过静态数据学习,而物理智能需要与环境动态交互,通过行动、反馈和修正来积累经验。例如,机器人不仅需要识别物体,还需理解其物理属性——杯子不仅是“可装水的容器”,更是“可抓取、易破碎”的实体。这种理解依赖于系统在闭环中持续学习,而非单一模态的输入输出。

对于技术落地的挑战,朱毅以企业应用为例。他曾在亚马逊参与视频推荐系统的开发,发现实际场景中模型需平衡精度、速度和成本等多重指标,而非单纯追求榜单分数。这种经验促使他关注“人在回路”的定位:在自动化流程中,人类应专注于提出创新想法和定义验收标准,而非介入中间步骤。他建议,任何任务都应先交由AI尝试,若失败则分析差距并改进,而非直接否定技术潜力。

在Prana Labs,朱毅的目标是构建可交互的合成环境,通过结合Coding Agent与3D图形技术,为多模态模型提供训练场景。他比喻道,环境不仅是模型的“输入源”,更是“教师”——通过反馈指导模型理解行动后果。例如,模型在虚拟环境中学习叠衣服时,需通过多次尝试掌握布料物理特性,而非依赖预设规则。

朱毅的务实态度源于早期研究经历。他回忆,博士期间开发视频理解系统时,需在安防和自动驾驶等场景中验证技术价值,而非仅追求论文指标。这种理念延续至今:他长期参与开源项目和技术社区,认为技术普及需要跨领域人才,而社区教育能加速生态发展。他强调学术诚信与谦逊的重要性,称这些品质是合作与创新的基础。

尽管多模态智能的未来充满不确定性,朱毅仍选择深入其中。他拒绝预测技术对人类关系的具体影响,例如虚拟世界是否会改变社交模式,而是专注于构建能持续学习的智能系统。在他看来,技术的发展不可阻挡,与其猜测结局,不如参与塑造其进程。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version