40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源

机器之心 2026-07-28 09:22
40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图1


训练一个顶级文生图模型,到底需要多少钱?


Qwen-Image、HunyuanImage 这些优秀的开源模型,预训练动辄用掉数十亿张图像;而 GPT-Image-2、Nano-Banana-Pro 等闭源系统虽然效果惊艳,其内部实践却始终不对外公开。对于绝大多数研究机构来说,这条赛道的入场券太贵了。


近日,华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了 Boogu-Image-0.1—— 一个仅用 2.08 亿张独立图像、理论训练成本约 40 万美元,就在多个基准上做到开源第一、逼近闭源水平的统一多模态模型家族。模型权重、代码与训练配方已全部以 Apache 2.0 协议开源Boogu 系列模型是最早支持原生 2K 的开源模型之一,并支持华为昇腾 Ascend NPU,vLLM-Omni 框架等, ModelScope 和 ComfyUI 均已上线。


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图2


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图3


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图4


从「文生图」到「需求生图」


Boogu 团队的核心判断是:图像生成正在从 Text-to-Image 走向 Requirement-to-Image


用户早已不满足于给一句描述性 prompt—— 他们希望模型能理解复杂意图、隐含约束、多层指令,甚至跨模态上下文。而现实需求又极度多样:有的只想快速出图,有的需要精细排版的海报。单一模型配置很难同时服务好所有场景。


因此,Boogu 把「理解」提升为与数据质量、训练配方同等重要的一等公民,并将其拆解到系统的每一个环节:



40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图5



40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图6



在 Boogu 自建的 Arena 盲测中(与公开 LMArena 排名的 Spearman 相关系数达 1.0, Pearson 相关系数 0.986),Boogu-Image-0.1-Turbo-Thinking 以 1048 的 Elo 位列开源第一,仅次于 GPT-Image-2 和 Nano-Banana-Pro。在新发布的 Qwen-Image-Bench 上,其 Base-Thinking 变体在中英文双语下均取得开源模型最佳总分;编辑模型 Boogu-Image-0.1-Edit-Thinking 更是在 ImgEdit-Bench 上拿下全场最高的 4.64 分。


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图7


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图8


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图9

40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图10


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图11


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图12


敢说真话的技术报告


这份 71 页的技术报告有意思的地方,不只是结果,还有大量业内「靠试错才能学到」却很少被写进论文的细节。


公开基准正在失效。团队用 6 个近期模型对比了 LMArena 人类偏好排名与 GenEval、DPG-Bench 分数,发现明显的排名倒挂:人类偏好最强的 GPT-Image-2 在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估,并呼吁社区重新审视其适用性 —— 甚至坦率指出自家模型在 ImgEdit-Bench 上分数虽高,但人评中仍不如 Nano-Banana-Pro。


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图13


「“足够” 的数据」是不够的,但结构化的数据可以很省。团队用 1.87 亿开源数据训练的模型明显撞上性能天花板;而利用少量按人类先验组织的「Boogu Syllabus」教学大纲式数据(仅 2162 万独立样本)进行后训练反而能全面提升性能。原则很朴素:系统性细粒度拆解、能力全覆盖、每个类别数据量充足 ——「如果模型训练时没见过猫,就默认它画不出猫」—— 数据的精细的 “质” 大于朴素地堆砌 “量”。


几个可复用的量化结论。一个汉字要被稳定渲染,训练中至少需要约 300 次曝光;覆盖 3500 个现代常用字即可满足日常中文渲染需求。让模型记住一个从未见过的人物身份,需要约 4500 次语言匹配的曝光 —— 团队用一位志愿者(也是论文作者之一)的 170 张日常照片做了完整消融。


40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源图14


不要盲目过滤「坏数据」。水印、过曝、运动模糊的图片不必丢弃 —— 只要在 caption 里明确详细地描述缺陷,它们反而能让模型学会理解并可控地规避(或复现)这些视觉元素。


慎用 RL。重度美学 RL 会让输出分布坍缩:让模型画「一位六十岁的中国女性」,重 RL 模型倾向输出精致妆容的理想化形象。Boogu 选择把人类偏好放进理解系统而非烙进生成器,只在肢体结构、文字渲染等不损害多样性的问题上使用 RL。


此外,作为最早的原生 2K 训练的开源模型之一,团队发现标准的动态时间偏移策略在 2K 分辨率会产生「过度挤压」效应导致收敛变慢,并给出了简单有效的截断修正方案;附录还提出了免训练的推理增强方法 BOG(Boosted Orthogonal Guidance),把 DiT 预测视为二维矩阵做结构化归一化,强化垂直于 flow 流场的信息,一定程度提升照片摄影艺术质感。


写在最后


Boogu-Image-0.1 当然有局限:世界知识仍落后于头部闭源系统,文字渲染只优化了中英双语,复杂多人交互场景仍会出现肢体畸变。但在 40 万美元的预算约束下,它给出了一条可复现、可验证的路径 —— 并把过去藏在工业团队内部的工程经验摊开在了论文里。


正如团队在结语中所说:希望 Boogu-Image-0.1 让图像生成向「真正理解用户想要什么」的系统迈进一步。


团队介绍


Boogu 团队来自华为香港小艺大模型应用实验室(莱布尼茨所),联合香港大学、香港科技大学、香港理工大学、香港城市大学、香港中文大学与南京大学共同完成。项目负责人为 Chenyang Lei,通讯作者包括 Chenyang Lei、Rui Liu 与 Chao Huang。团队致力于以理解驱动的统一智能体多模态生成研究,模型、代码与训练配方均以 Apache 2.0 协议开源。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
华为
more
华为万级大电池手机曝光!中端定位,你买吗?
华为畅享90 Pro Max激活超310万,你买了吗?
让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME
华为智驾拐点之年(2021-2022):摸高与变现,调令与谈判
任正非:τ定律是华为可以选择的唯一一条突围道路
华为Pura X Max阔折销量超预期,迭代可期
华为靳玉志称境和界是互补关系;比亚迪大汉实车曝光;Kimi K3打破美AI领先中国认知;西班牙二度夺冠,EA连续五次成功预测世界杯冠军...
华为鸿蒙6.1新版本开推,Mate/Pura/nova都有份
华为昇腾950超节点首次真机亮相!
一颗“螺丝钉”的修养:华为乾崑如何定义自己
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号