商汤科技近日宣布开源其新一代轻量级多模态大模型SenseNova U1.5 Lite,这款原生支持4K画布的模型在图像生成与编辑领域展现出突破性能力。通过扩展上下文处理窗口至3-4K超长容量,该模型成功解决了传统AI制图工具在处理复杂指令时易丢失上下文关联的痛点,为专业创作场景提供了可靠的技术支撑。
在核心性能提升方面,SenseNova U1.5 Lite实现了三大技术突破:首先是原生支持超长上下文处理,即使面对包含数百个元素的详细提示词,仍能保持画面元素的高度一致性;其次是精准的区域编辑能力,用户可通过标注指定修改区域,模型将自动识别边界并仅对目标区域进行优化;第三是跨模态信息保留技术,在翻译图片文字或调整布局时,原始图像的风格、字体乃至光影效果都能得到完整保留。
实际测试显示,当要求模型将柏林观光指南中的德文翻译为中文时,系统不仅准确完成了文字转换,更保持了手绘风格的连贯性,连建筑阴影的笔触方向都未发生改变。在区域编辑测试中,模型成功将指定企业的IPO数据更新至信息卡片,而未对卡片背景图案产生任何意外修改,这种精准控制能力在同类模型中极为罕见。
技术团队特别强调了模型在多图合成场景的应用潜力。通过维持长上下文记忆能力,SenseNova U1.5 Lite可同时处理多张原始图片的信息特征,在保持各自风格独立性的基础上实现自然融合。这种特性为广告设计、出版编辑等专业领域提供了高效的生产工具,创作者无需反复调整参数即可获得符合预期的视觉效果。
行业观察指出,该模型的开源标志着AI制图技术从实验性探索转向工程化应用。传统文生图工具常因随机性过强被戏称为"抽卡游戏",而SenseNova U1.5 Lite通过确定性输出机制,将图像生成误差率降低至行业领先水平。对于预算有限的小型创作团队而言,这种稳定可靠的技术方案大幅降低了AI工具的使用门槛。
值得关注的是,商汤选择在2026世界机器人大会期间发布这项技术,暗示着多模态AI与实体机器人产业的深度融合趋势。当被问及技术路线选择时,研发负责人透露模型采用动态注意力分配机制,通过智能识别关键信息区域来优化计算资源分配,这种设计使其在消费级硬件上也能流畅运行。











