商汤科技近日宣布,其面向社区开源的轻量级统一多模态模型SenseNova U1.5-Lite-Preview正式发布。这一模型并非单纯通过扩大参数规模实现升级,而是在SenseNova U1的基础上进行了系统性架构迭代,首次将视觉理解、推理、生成与编辑四大核心能力整合至同一框架中,为轻量级多模态模型的发展开辟了新路径。
该模型最显著的突破在于其轻量化设计——仅采用8B-MoE参数规模,便实现了4K分辨率图像生成、更精细的局部纹理还原以及更复杂的视觉控制能力。商汤科技表示,如果说U1验证了统一架构的可行性,那么U1.5-Lite-Preview则进一步探索了这种架构下能力的可持续扩展性,证明轻量级模型同样能支撑高精度视觉任务。
在核心能力提升方面,U1.5-Lite-Preview针对四大方向进行了优化:原生支持4K图像生成,显著提升局部纹理与真实质感;中英文文字生成准确性更高,复杂版式组织能力更强;图像编辑稳定性大幅提升,视觉指令遵循能力更精准。技术层面,商汤通过重新设计生成头结构,有效解决了网格伪影问题,并扩展训练至4K分辨率;在图像编辑任务中,优化了数据组织与训练策略,强化了对原图内容、主体身份、空间结构的保留能力,确保编辑过程中非目标区域不受影响。
商汤科技强调,U1.5-Lite-Preview的开发遵循“架构创新优先于规模扩张”的原则,通过系统性优化生成与编辑全链路,实现了能力与效率的平衡。这一路线为轻量级多模态模型的持续迭代提供了参考——当8B参数规模即可支持4K生成与精细编辑时,统一多模态架构的潜力或许才刚刚开始显现。











