ITBear旗下自媒体矩阵:

SPARGen模型:打破模块壁垒,让AI一眼看穿空间与语义的奥秘

   时间:2026-08-22 03:42:37 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在人工智能领域,如何让机器像人类一样理解三维空间中的复杂关系,一直是科研人员探索的核心课题。传统方法往往依赖多个独立模块分工协作,例如用专门的网络计算深度信息、预测相机拍摄角度、重建三维点云,再通过光流网络追踪物体运动轨迹。若要实现空间问答功能,还需额外接入语言模型。这种"模块拼接"的架构虽然能完成特定任务,但各模块间缺乏实质性知识共享,导致系统整体效率低下且难以协同优化。

浙江大学与商汤研究院联合提出的SPARGen框架,通过创新性地将所有空间感知任务统一为生成式问题,成功打破了这种技术壁垒。该模型基于"混合专家Transformer"架构,将视觉几何任务与语言推理任务深度融合,在保持参数规模精简的同时,实现了多项性能指标的突破性提升。实验数据显示,在MindCube空间推理基准测试中,SPARGen以76.04分的成绩大幅领先同类模型,参数规模仅为70亿的它甚至超越了720亿参数的Qwen2.5-VL模型。

研究团队创造性地将所有输出目标分为序列输出和密集场输出两大类。对于文字答案、相机姿态等离散符号数据,采用自回归生成方式逐个token预测;对于深度图、点云等连续数值数据,则通过变分自编码器将其压缩为潜在向量,再利用整流流技术生成。这种设计避免了为不同任务设计专用预测头,而是充分利用预训练模型原有的图像生成能力。以相机姿态预测为例,系统将旋转矩阵转换为四元数,与平移向量共同量化为数字token序列,通过语言生成通道完成预测。

在几何数据处理方面,研究团队开发了针对性的转换算法。深度图通过归一化处理转换为三通道"假彩色图";点云数据经全局坐标系统一后进行归一化,确保多视角一致性;光流场则采用符号平方根变换优化数值分布。特别设计的"预测-变形-预测"精炼流程,使光流估计误差在KITTI数据集上降低40%。这种端到端的处理方式,使得几何信息能够自然地渗透到语言推理模块中,形成真正的知识共享。

训练机制的创新同样值得关注。系统采用双损失函数协同优化策略,序列生成任务使用交叉熵损失,密集场生成任务采用整流流匹配损失,并通过权重系数平衡两者差异。这种设计使得所有参数在反向传播过程中同时接受几何和语言任务的梯度更新,就像乐队成员根据统一节拍器协调演奏。消融实验证明,移除几何监督信号会导致光流估计误差增加4.7%,空间推理得分下降6.3%,充分验证了多任务联合训练的有效性。

在视觉几何基准测试中,SPARGen展现出惊人的综合能力。在Sintel深度估计任务中,其AbsRel误差低至0.235,优于专精模型VGGT的0.265;在7Scenes三维重建任务中,完整度误差仅0.034,达到业界领先水平。更令人瞩目的是空间推理性能,在SPAR-Bench测试中以66.60分领先第二名24.71分,这种跨模态能力突破为机器人导航、增强现实等应用开辟了新可能。研究团队坦承,当前VAE编码器的空间压缩仍存在精度瓶颈,未来计划探索更高分辨率的潜在空间表示方法。

这项研究对多模态学习领域产生深远影响。传统方法往往陷入"精度与灵活性"的两难困境,而SPARGen通过统一的生成框架实现了两者兼得。其核心启示在于:当不同任务的监督信号能够共享底层表征时,系统学到的空间知识会比单独训练更加扎实。这种设计哲学或将推动新一代空间智能系统的发展,使机器真正具备理解三维世界的"常识"能力。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version