ITBear旗下自媒体矩阵:

商汤科技开源SenseNova U1.5-Lite-Preview:多模态能力升级,赋能创作新体验

   时间:2026-08-03 22:36:57 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

商汤科技近日宣布,面向全球用户开源轻量级统一多模态模型SenseNova U1.5-Lite-Preview。这一版本基于此前发布的SenseNova U1架构进行系统性升级,在保持8B-MoT模型规模的前提下,实现了4K分辨率图像生成、更精细的视觉质感、复杂文字排版及可持续迭代的图像编辑能力,标志着原生统一多模态技术向真实创作场景迈出关键一步。

与前代模型相比,U1.5-Lite-Preview在四大核心方向实现突破:原生支持4K分辨率图像生成,在自然风光、商业海报等超大画幅场景中可呈现真实光影与材质细节;通过优化局部纹理建模算法,显著提升画面中文字、图标等精细元素的清晰度与稳定性;强化中英文双语生成能力,支持复杂版式设计,在信息图、杂志排版等任务中实现文字与视觉元素的精准对齐;引入encoder-free视觉建模方式,减少信息压缩损失,使图像编辑过程更可控,避免非编辑区域意外改动。

在复杂创作场景中,该模型展现出独特的优势。例如,在生成"WAIC发展历程长卷"时,通过3880字的超长提示词,模型以中国传统山水画的散点透视手法,将上海城市景观、智能工厂、机器人等元素融合在10:3比例的4K画布中,放大后仍能清晰呈现建筑纹理与文字标注。在文字生成测试中,模型可准确处理中英双语混排、拉丁文标注等复杂需求,在杂志内页生成任务中实现字体风格、段落间距的自动化适配。

图像编辑能力的升级尤为显著。通过统一架构设计,模型将视觉理解、目标定位、约束推理与像素生成整合为单一流程,支持"哪里不对改哪里"的可持续迭代创作。开发者演示案例显示,用户可先生成基础画面,再通过自然语言指令逐步调整文案内容、元素位置或整体风格,无需重新采样。针对专业设计需求,模型支持多参考图元素提取、单图条件创作等高级功能,例如从不同图片中分别提取人物、场景与字体风格,融合生成新的营销海报。

为降低创作门槛,商汤同步推出实验性Prompt Enhance Skill工具,可将用户简短描述自动转化为包含主体、布局、风格等要素的完整创作方案。例如,用户输入"生成一张复古风格的产品解析图",工具会自动补充"五章结构、中英双语对照、博物学标本图鉴风格"等详细约束,帮助模型生成更符合预期的结果。

目前,SenseNova U1.5-Lite-Preview已通过GitHub、Hugging Face及魔搭社区开源,提供模型权重、推理代码及使用文档。商汤同时透露,面向专业用户的交付级创作模型U1 Pro正在邀测阶段,将在近期开放公众服务。该系列模型的持续迭代,体现了商汤在原生统一多模态架构上的技术积累,其通过单一模型实现视觉理解、推理与生成的能力,为AI创作工具开发提供了新的技术路径。

作为人工智能软件领域的领军企业,商汤科技长期致力于通用人工智能技术研究,业务覆盖生成式AI、视觉AI及创新业务领域。其自主研发的AI大装置SenseCore,整合了算力、算法与平台能力,支撑起"商汤日日新SenseNova"大模型体系的发展。此次开源的U1.5系列模型,进一步丰富了商汤在多模态内容生成领域的技术布局,为开发者与创作者提供了更高效的AI工具链。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version