
单模型融合多专家能力,理解、推理、生成与编辑一体化。智东西8月21日报道,今天,商汤科技开源了轻量级、原生统一多模态大模型SenseNova U1.5 Lite正式版。该模型仅8B参数规模,原生支持3-4k字符超长复杂指令遵循与4K高分辨率输出。商汤公布的基准测试结果显示,在多项图像生成、文字渲染和图像编辑指标上,SenseNova U1.5 Lite的得分要优于Qwen-Image-2.0、Seedream-4.5等模型,并在部分基准测试中超过GPT-Image-1.5,但距离GPT-Image-2还有一定距离。商汤公布的案例显示,这一模型可以用于高密度信息图生成,并提升文字、数据等细节的准确度。在图像编辑时,这一模型可以按照超长的提示词精准修改图片,保留原图细节的同时让色彩与材质更加细腻。这是商汤在原生统一多模态路线上的又一次迭代。今年4月,商汤发布SenseNova U1,展示了基于NEO-Unify架构的原生统一多模态路线,即在同一模型中贯通视觉理解、推理、生成与编辑;8月3日,商汤开源U1.5 Lite预览版,将这一架构推进到4K分辨率和更复杂的视觉控制。SenseNova U1.5 Lite正式版目前已通过GitHub、Hugging Face和魔搭社区面向全球开发者开放,也支持在线体验。智东西第一时间上手实测了这款模型。根据我们的体验结果,这一模型的确可以理解复杂的超长提示词,对文字的渲染准确度较高,但在风格的多样性、细节的真实度上还有一定的提升空间。https://github.com/OpenSenseNova/SenseNova-U1https://huggingface.co/collections/sensenova/sensenova-u15https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT
https://unify.light-ai.top/
指令遵循能力是SenseNova U1.5 Lite的核心能力之一。目前大多数开源模型在指令超过1k字符时容易崩溃、遗漏细节,该模型原生支持3-4k字符长度,可同时处理主体、数量、空间关系、文字、布局、风格等多重约束。我们撰写了一段2000多字的中文提示词,让SenseNova U1.5 Lite生成对应图像。这段提示词精准限定了文字、空间关系等信息,细节很多。▲我们用AI辅助撰写的超长提示词(部分截图)
SenseNova U1.5 Lite用大约20秒完成了生成,从最终结果可以看到,它完整理解了提示词中的细节要求,文字没有出现崩坏问题,风格也与我们要求的一致。▲SenseNova U1.5 Lite的生成结果
SenseNova U1.5 Lite在图像编辑场景增强了主体身份、空间结构和非编辑区域的保持能力,支持局部修改、元素替换、文字精修和多参考图编辑,配合Bounding Box、Visual Marker等指定区域的控制方式。为测试这一能力,我们先让SenseNova U1.5 Lite生成了一张底图。然后要求它进行12项修改,包括改变桌上饮品的类型、糖包的数量、黑板上的文字等等。可以看到,SenseNova U1.5 Lite的确修改了这些细节,但修改后的元素和原图在物体比例、画面质量上还有些差别,导致略微有些出戏。在1:1的画幅下,SenseNova U1.5 Lite支持4K图片的生成。生成4K图片的耗时要比普通图片更久,大概需要1分多钟。这一图片的生成效果其实并没有那么理想,车标文字的角度看上去不太自然,汽车上水珠的比例失衡,汽车内饰也和真实汽车不太一样。放大后可以看到,我们在图中汽车卡钳上要求生成的文字出现了崩坏。我们将同样的任务交给了GPT-Image-2,可以看到在这一任务上GPT-Image 2做得也不好,水珠同样出现了比例不正常的问题,不过光影质感和画面主体的真实度要好一些。
商汤在博客中分享了这一模型的技术细节。面对不同视觉任务,业界通常采用显式Router(路由)或多专家协同机制将渲染、美学、编辑分发给不同模型。但这大幅增加了系统开销与推理时延。SenseNova U1.5 Lite采用的NEO-Unify统一架构,能有效解决上述问题。训练阶段,商汤团队针对文字、美学、编辑分别独立训练专家模型(Expert);交付阶段,通过多专家在线策略蒸馏技术(MOPD),将多专家能力融合至单体8B模型中。与此同时,视觉语义理解与空间建模形成的认知可以反哺生成,模型由此能自然消化多层级指令,并在多模态理解榜单上保持不错的表现。这套架构在部署时可以带来一定优势:8B参数量支持单卡流畅运行,无需Router频繁切换,单次Pass即可兼顾语义理解与像素生成,调用成本与推理延迟降低。官方还放出了在OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench与Qwen-Image-Bench等基准上的生成延迟与平均性能对比,可以看到SenseNova U1.5 Lite在速度上的优势较为明显。架构之外,正式版强化了任务导向的强化学习(RL)后训练,主要有三大优化方向:指令遵循,即解析超长Prompt并执行多重复杂限制;视觉偏好,即优化构图、材质与光影,提升画面质感与视觉完成度;编辑保持,即实现更好的局部修改,完整保留非目标区域的内容与结构。复杂指令跟随与精细编辑的能力,让模型可以支持多轮迭代修改而不跑偏,轻量级模型由此得以参与长流程的持续创作与二次改造。
实测下来,SenseNova U1.5 Lite这样的轻量生图模型的价值是实实在在的。对电商物料、海报设计、内容生产这类高频刚需场景来说,用轻量模型做批量产出、快速修改是更有性价比的选择。但如何在轻量的同时,保持对多种风格、材质细节的驾驭能力,是这类模型接下来必须跨过的一道坎。9月20-21日,智东西主办的2026全球AI芯片峰会将在上海举行,设有开幕式,大模型AI芯片、Agent推理芯片、具身智能芯片3场高峰论坛,以及Token工厂异构混训混推、超节点、AI芯片架构创新、新型存储器、大模型KV Cache5场技术研讨会。
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。