开源国产8B模型,比肩闭源Image 2了!

量子位 2026-08-21 12:51
金磊 发自 凹非寺
量子位 | 公众号 QbitAI

时隔仅仅三周,国产生图模型,又进化了。

,这个生图模型是4K直出的,开源的,只有8B大小的。

这一次,它的正式版本来了!若是用三个词来概括,那就是——

更完整,更准确,更稳定。

例如我们现在一口气把九张不同的食物照片丢给它:

开源国产8B模型,比肩闭源Image 2了!图1

并简单附上一句Prompt:

请将这九款美食拼成一张精美的食谱分享卡片。

开源国产8B模型,比肩闭源Image 2了!图2

原本各自拍摄、比例和背景都不一样的九张图片,一下子就被整整齐齐地设计到了一张图里;并且AI还精准识别出了每道菜品,同时还给它们适当加了美化处理,让图片整体变得更加养眼。

再来看一个编辑图片的例子。

我们在原图的基础上,用“框选+标注”的方式,把想要修改的图片局部细节给标了出来:

开源国产8B模型,比肩闭源Image 2了!图3

AI在接到任务改完以后是这样:

开源国产8B模型,比肩闭源Image 2了!图4

可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来。

而这个AI,便是商汤科技这次正式开源的SenseNova U1.5 Lite,其亮点如下:

而且啊,SenseNova U1.5 Lite依旧保持了8B的大小,还能在复杂排版与精准编辑等核心的场景上比肩闭源的GPT-Image-2:

开源国产8B模型,比肩闭源Image 2了!图5

如果说三周前的SenseNova U1.5 Lite Preview版本是验证一个统一模型能够把视觉能力扩展到哪里。

那么到了今天的正式版本,商汤科技则是进一步验证这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。

效果怎么更强了?看细节

接下来,我们继续拿效果来说话。

第一个任务,先来一个考验信息组织能力的实测,主题是从可可豆到巧克力。

开源国产8B模型,比肩闭源Image 2了!图6

要在一张竖版信息图里,需要同时塞进Harvesting、Fermentation、Roasting、Grinding、Tempering到Finished Chocolate六个阶段。

每个阶段既有文字解释,也有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素,而且六层内容还得顺着版式一路往下走。

从最终的效果来看,SenseNova U1.5 Lite已经做到了可以组织一整套视觉表达,包括长文本、多层级结构、插画、数字顺序和版式关系。

这种能力再落到更日常的内容生产里,就变成了类似做社交媒体封面这类任务。

比如下面这张图:

开源国产8B模型,比肩闭源Image 2了!图7

这类图看上去虽然元素不算多,但难点就在于要做到“封面感”这三个字。

标题要立得住,主体要足够抓眼,三只狗的造型、服饰和表情既要各有区分,又不能彼此打架;同时,整张图还得维持住统一的时尚调性,而不是变成几个可爱元素拼在一起。

从最后的结果来看,正式版在这类应用型视觉任务上,已经开始更接近一张能够直接拿来用的封面作品。

接下来,我们再来看下SenseNova U1.5 Lite的局部编辑能力。

Prompt是这样的:

仿照参考图的折纸拼贴视觉,生成一张社区共享厨房运营模式信息图。

开源国产8B模型,比肩闭源Image 2了!图8

乍一眼看过去,两张图片整体的结构和风格几乎是没有变化的,因为我们的要求就是“仿照参考图”。

仔细看细节,原来属于教育项目的元素被替换成厨师帽、砧板、菜谱等厨房相关视觉,左侧的信息也跟着变成Membership Fees、Commercial Rental、Cooking Classes、Market Sales和Event Hosting。

在这类任务中,模型得先分辨出一张图里哪些东西属于主题内容,哪些东西属于更底层的设计逻辑。然后保留后者,再让新内容沿着原来的视觉语言长出来。

不过若是参考图从一张变成了多张,那任务难度就会更大了。

例如我们输入下面这三张参考图片:

开源国产8B模型,比肩闭源Image 2了!图9

然后附上这样的Prompt:

Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster’s distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background. Preserve all original text and all other poster elements.

这次Prompt更细节的一点是,第三张参考图只允许参考内容和信息层级,原来的白色卡片背景不能一起搬过来,新歌单需要直接长在海报原来的黑色做旧背景上。

SenseNova U1.5 Lite给到的结果如下:

开源国产8B模型,比肩闭源Image 2了!图10

从结果来看,Radiohead五个人进入了原来的乐队区域,人物处理后的质感和整张海报基本接上了;左下方的信息重新压缩,ESSENTIAL LISTENING则直接融进右侧版面,没有留下一块突兀的白底。

而对于刚才给到的三张参考图来说,第一张负责版式和风格,第二张负责人物身份,第三张只负责文字内容和结构。模型必须先把这三件事分开理解,最后才能重新合成到一张图里。

但在真实设计工作里,还有一种需求没有前面这么复杂,却可能出现得更频繁——改几个字

这次我们在输入原始图片后,Prompt如下:

请将左下角深蓝色矩形信息栏内的展览时间与地址详情,从
“JUNE 15 - JULY 30, 2024
URBAN GALLERY
123 CREATIVE WAY
ARTSVILLE, USA”
替换为
“AUGUST 10 -
SEPTEMBER 28, 2024
METRO MUSEUM
456 DESIGN ROAD
CREATIVITY CITY, UK”,
保持原有的白色与粉色字体样式及排版布局不变。

开源国产8B模型,比肩闭源Image 2了!图11

最终,左下角的信息完成替换,画面中心巨大的“RHYTHM OF FORM”、周围高饱和度的几何图形,以及原本的文字层级都留在原来的位置。

先拆开练,再合回来

在看完的效果之后,接下来的一个问题就是,一个8B模型是如何做到文字、审美、复杂布局、长指令、局部编辑都过关的?

据了解,SenseNova U1.5 Lite继续沿用了NEO-unify原生统一多模态架构,把视觉理解、图像生成和编辑放在同一套模型里。

也就是说,在真正动像素之前,模型先要理解画面。

哪里是主体,谁在谁旁边,哪些是文字,用户指的是哪块区域,一张参考图里到底哪些东西值得保留……这些理解过程,并不会和后面的生成、编辑彻底分家。

而正式版这次比较关键的一处变化,发生在训练阶段。商汤采用了一套很容易理解的办法:先拆开练,再合回来。

文字渲染、美学表达、图像编辑这些目标,先会分别训练对应的专项Expert

等这些Expert练完以后,再通过多教师在线策略蒸馏技术MOPD,把它们的专项能力重新融合回同一个SenseNova U1.5 Lite里。

所以训练时虽然有多个专项老师,到了最后真正交付和部署的时候,用户拿到的依然只有一个8B模型。

没有额外Router在背后判断“这次应该调用哪个子模型”,用户也不用在文字、美学、编辑几个模型之间自己来回切。

这种做法和前面的案例其实是能对上的。

比如Radiohead那组多参考图任务,模型先得理解原海报的视觉骨架,再识别人物,还要从另一张图里提取文字结构,最后才能完成生成。

到了海报改字也是一样。

“只改左下角”首先得先理解什么叫“左下角”,哪些文字属于目标区域,周围哪些图形、字体和版式不能动。等这些判断做完,才轮到最后的像素生成。

所以在统一训练体系里,视觉语义理解和空间建模形成的结构化认知,可以继续反过来帮助生成和编辑。商汤在新闻稿里把这件事概括为“理解与生成双向反哺”。

而要让这种能力在复杂任务里稳定下来,正式版后训练又专门强化了三件事。

第一件叫指令遵循。用户写了一大串要求,主体有几个、谁在左边、文字放哪儿、什么颜色、哪些东西不许改,最后模型到底执行了多少。

第二件叫视觉偏好。指令都完成以后,整张图的构图、材质、光影和最终质感到底过不过关。

第三件是编辑保持。要改的区域能不能改准,原本已经正确的地方还能不能留下来。

这三项其实刚好对应了前面几个案例最容易出问题的地方:复杂信息图怕漏要求,STYLE这样的封面直接考验美学完成度,而卧室修改、Radiohead和文字替换,则都离不开对非编辑区域的保持。

另外还有提示词增强。如果用户只给一句比较简短的需求,PE可以先帮忙把意图整理成更完整的创作方案,再交给U1.5 Lite执行。

以上便是正式版SenseNova U1.5 Lite背后的技术关键了。

生图模型的标准,得变了

若是把时间线拉长一些,回头再看SenseNova U系列这几次变化,其实我们会发现一个比较明显的趋势。

早期大家看生图模型,最容易比较的是够不够惊艳。但当AI的生图能力越发的普及,真正决定模型能不能进入工作流的问题,开始出现在第一张图生成以后。

这也是SenseNova U1.5 Lite正式版反复强调“稳定”的原因。相比再增加几个看起来新鲜的玩法,它更想解决的是一项视觉任务从生成到交付的完整链路。

对应地,评价模型的标准也在发生变化。一张图够不够漂亮依然重要,但真正拉开差距的,越来越可能是模型能不能从理解需求、生成内容,一路完成修改、细化和最终交付。

统一模型的价值也正是在这里体现出来。

SenseNova U1.5 Lite最终交付出去的依然只有8B。它没有不断叠加外部路由,也没有把不同任务拆给多个模型分别完成,而是先通过多个专项Expert补强能力,再把这些能力重新收进一个统一模型里。这样做的好处很直接:调用链路更短,部署更轻,同时还能尽量保住不同任务之间的一致性。

落到开发者和创作者的实际使用里,最终对应的其实就是三个字,快、好、省。

商汤的判断是,多模态仍然会是AI走向物理世界、真正进入生产环节的重要方向。因此这次U1.5 Lite正式版继续把大量精力放在稳定性、指令遵循和编辑精度上。它们未必像某个新玩法一样第一眼就很抓人,却更直接决定了模型能不能被真正用起来。

如果说三周前的Preview版本更多是在验证,一个8B统一模型的视觉能力究竟能铺到多宽。

那么到了正式版,问题已经开始变成另一件事:

这些已经铺开的能力,究竟能不能稳定地拿来干活。

GitHub:
https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:
https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio在线体验:
https://unify.light-ai.top/

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
NVIDIA 与本地 AI 社区共同推动开源模型和智能体发展
英特尔XPU Manager 2.1发布:开源工具强化锐炫Pro显卡运维能力
震撼!OpenAI全面开源Codex Harness
这个靠中国开源模型"撑"起的美国公司,要70亿美元卖身了
Meta重押开源赛道,扎克伯格喊话华盛顿:松绑政策以抗衡中国AI崛起
小扎拼了,刚遭 1.4 万亿索赔,连夜开源 AI 小钢炮刷好感
招聘|沐曦开源生态技术运营实习生(AI Infra方向)base上海
编程能力最强开源模型!智谱GLM-5.3登场,国产AI又一猛将
港大&腾讯重磅开源:用相机射线重构Attention位置编码,给世界模型换上「3D坐标系」!单图WASD复杂轨迹漫游,FVD降43%
GOAI世界人工智能开源大赛【报名公告】
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号