ITBear旗下自媒体矩阵:

香港中文大学举办多模态与世界模型论坛 共探AI现实世界理解新路径

   时间:2026-08-17 17:02:53 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

近日,一场聚焦人工智能前沿领域的学术论坛在香港落下帷幕。这场名为“2026多模态与世界模型论坛”的活动由香港中文大学计算机科学与工程学系语言和视觉实验室主办,吸引了来自中国内地、香港及海外多所高校和研究机构的专家学者齐聚一堂,共同探讨多模态大模型、世界模型、计算机视觉及具身智能等热门话题。

近年来,生成式人工智能在大语言模型的推动下发展迅猛,而当前人工智能研究的焦点正逐步向多模态智能和世界模型延伸。这一转变的核心在于,如何让AI不再局限于处理和理解语言,而是具备对现实世界的理解、预测和规划能力,从而从数字空间迈向物理环境。论坛期间,多位专家围绕这一议题发表了主题演讲,深入剖析了AI在跨领域应用中的挑战与机遇。

香港中文大学计算机科学与工程学系助理教授王历伟作为论坛组织者指出,AI研究正从大语言模型向多模态人工智能转型。未来的AI不仅要能处理文字信息,还需理解真实世界,并最终部署到实际物理环境中。他强调,多模态技术和世界模型已成为学术界和产业界共同关注的研究方向,尤其是世界模型,其目标是通过帮助AI理解物理规律、预测环境变化,进而实现决策和规划,这与Physical AI(物理人工智能)及具身智能的发展紧密相关。

与会专家普遍认为,与几年前AI领域主要围绕ChatGPT和大语言模型展开讨论不同,当前的研究重点已转向如何让AI理解和推理现实世界。这一转变的技术路径包括从语言理解向世界理解拓展、从数字空间向物理空间延伸,以及从内容生成向实际物理系统应用发展。通过这些路径,AI有望突破现有局限,在更复杂的场景中发挥作用。

多模态模型和世界模型的研究具有广泛的应用前景。例如,在自动驾驶领域,AI可通过融合视觉、语言等多模态信息,提升对复杂路况的判断能力;在机器人和智能制造领域,AI可借助世界模型预测环境变化,优化生产流程;在智慧医疗和科学发现领域,AI则可通过分析多模态数据,辅助诊断和科研决策。这些应用表明,AI系统正逐步从“感知”向“认知”进化,其行动能力也将随之增强。

王历伟透露,其带领的香港中文大学LaVi实验室正致力于推动AI从理解多模态信息向横跨数字世界与物理世界的学习、预测和规划能力发展。他认为,未来的智能系统需同时具备在数字空间和物理空间进行理解、预测、推理及规划的能力,这将是AI技术突破的关键方向。

除模型能力外,AI评测体系也是论坛讨论的重点之一。自2025年起,香港中文大学研究团队与凤凰智媒合作建设了面向粤语AI系统的动态评测平台,目前双方正进一步推进多模态视频评测研究。王历伟指出,在多模态视频评测中,持续更新的高质量数据对防范数据污染、提高评测可靠性至关重要,这将为AI技术的落地应用提供更可靠的评估标准。

随着多模态、世界模型和具身智能等方向的持续发展,人工智能研究正从以语言和内容生成为主,向对现实世界的理解、预测和行动能力探索迈进。这一转变不仅为AI技术开辟了新的应用场景,也为学术界和产业界提供了更多合作与创新的机会。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version