商汤科技宣布面向社区开源轻量级统一多模态模型 SenseNova U1.5-Lite-Preview。这款模型并非简单的规模升级,而是基于 SenseNova U1 的系统性迭代,在同一架构中贯通视觉理解、推理、生成与编辑四大能力。
最引人注目的是其轻量体量——仅以 8B-MoE 的参数规模,就将能力推进到 4K 分辨率、更精细的真实质感以及更复杂的视觉控制。商汤表示,如果说 U1 验证了统一架构的可行性,那么 U1.5 要进一步证明能力能否持续扩展。
四大方向显著提升,生成与编辑全链路优化
相比 U1,U1.5-Lite-Preview 在四个核心方向带来显著提升:原生支持 4K 图像生成、更精细的局部纹理与真实世界质感、更准确的中英文文字生成与复杂版式组织、更稳定的图像编辑和视觉指令遵循。
在技术细节上,商汤针对网格伪影和高分辨率细节建模问题,重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练扩展至 4K 分辨率。在图像编辑方面,模型重新组织了编辑数据与训练任务,强化对原图内容、主体身份、空间结构和非编辑区域的保持能力,确保在完成目标修改的同时尽可能保留原图中不需改动的部分。
多项基准测试大幅提升,编辑能力尤为突出
商汤强调,U1.5-Lite-Preview 的核心思路是不盲目扩大模型规模,而是对生成与编辑全链路进行系统性优化。这种"以架构创新换取能力增长"的路线,为轻量级多模态模型的持续迭代提供了一个值得关注的范本——当 8B 参数就能跑通 4K 生成与精细编辑,统一多模态架构的潜力或许才刚刚开始释放。











