三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”

量子位 2026-07-29 15:39
SmartPhotoCrafter团队 投稿 
量子位 | 公众号 QbitAI

在日常摄影中,后期处理往往是决定照片最终观感的重要一步。

同样的场景和构图,经过适当的曝光调整、色彩优化、细节增强后,照片的质感和视觉吸引力能够得到显著提升。

然而,对于绝大多数普通用户来说,面对繁杂参数往往不知道应该如何调整,或是难以准确描述自己期望的效果。很多时候,人们只是觉得照片“差点意思”,却说不清究竟哪里出了问题。

如果把AI修图比作请摄影师帮忙处理照片,那么现有大多数图像编辑方法更像是一个“听指令的修图助手”——用户需要明确告诉模型“把天空调蓝一点”、“增加一些对比度”、“去掉雾气”,模型再根据指令完成修改。但现实中,真正困难的往往不是执行修图,而是发现问题并制定合理的优化方案

研究团队提出了SmartPhotoCrafter,实现“从理解到生成”的自动摄影图像优化,在无需人工指令的情况下,实现低质量图像修复与摄影级调色,维持内容一致性的同时提升图像美学质量。

研究背景:让模型先思考、后修图

近年来,基于生成式模型的自动摄影图像编辑(Automatic Photographic Image Editing)逐渐从“指令驱动的局部修图”发展为“无需明确指令的智能美学增强”范式。针对摄影图像优化任务,其对模型的要求不仅包括低层视觉退化的修复(如去雾、去模糊、低照度增强),还希望模型能够自动完成摄影级调色与美学优化,实现从图像理解到审美增强的端到端自动化编辑。然而,现有方法在复杂场景中仍然面临挑战:

第一个问题是审美缺陷感知与结构化推理缺失:现有图像编辑模型大多依赖端到端的条件生成或基于指令的局部调整,非专业用户难以准确提供图像优化指令。同时,若缺乏图像质量进行显式建模的能力,无法系统性回答“图像哪里存在问题、问题来源是什么、应如何修复与优化”。因此模型往往只能学习统计意义上的映射关系,而难以形成类似摄影师的诊断式理解。

第二个问题是图像优化中修复与调色任务的割裂:调色类方法虽然能够在色彩与风格维度进行细粒度控制,但往往缺乏对严重退化图像的修复能力;而以生成式模型能较好实现图像修复,却通常忽视美学一致性与摄影风格表达。现有模型在复杂场景下缺乏同时实现内容保真、结构恢复与美学优化的能力。

针对这些问题,研究团队提出SmartPhotoCrafter,一个面向摄影图像的全自动增强框架,用户只需输入一张照片,无需提供任何修图指令,模型便能先自主分析图像质量,再推理出相应的优化策略,并最终完成针对性的图像编辑。从图像理解、问题诊断、编辑决策到结果生成,整个过程无需人工干预,实现了从“你说我改”到“模型先思考、再修图”的全新范式。如图所示,SmartPhotoCrafter支持以下能力:

三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”图1

核心技术:SmartPhotoCrafter框架

整体框架

SmartPhotoCrafter框架主要包含两个高度协同的模块:Image Critic(图像评论家)Photographic Artist(摄影艺术家)。前者负责分析和决策,后者负责执行和生成,两者共同构成了一条完整的“审美诊断→编辑决策→图像优化”链路。

三步训练法:逐步成为“修图大师”

SmartPhotoCrafter的核心能力采用一个由浅入深、逐步对齐的三阶段训练策略。

多层奖励机制促进协同优化

第三阶段强化学习对Image Critic和Photographic Artist进行端到端优化,奖励设计充分考虑从语义理解到属性级精细控制的优化,实现更稳定、更精确的图像增强效果。其中,奖励函数重点强化了属性级别的参数敏感性,将原本难以精确建模的整体图像质量评价,分解为曝光、对比度、饱和度、色温等细粒度可解释属性维度,使模型能够对细微色调变化做出更稳定且可控的响应。这种属性解耦的设计显著增强了优化过程对微小调色差异的感知能力。完整设计如下图所示。

三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”图2

多任务数据集构建

为支撑SmartPhotoCrafter从图像理解到可控生成再到跨模块协同的逐步学习,团队构建了分阶段多任务数据,用以逐步强化模型的理解能力、细粒度可控生成能力以及Critic–Artist的对齐协同能力。

三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”图3

性能表现:多种场景下的图像优化能力

SmartPhotoCrafter在多种图像优化场景下进行测试,充分验证其自动摄影图像优化能力。

三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”图4
三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”图5
三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”图6

总结

SmartPhotoCrafter把“看图理解+修图”合在一起,通过把语义理解和图像生成打通,实现涵盖图像修复和调色任务的自动摄影图像优化,在多种增强场景下都能稳定输出自然好看的修图结果。该模型目前主要集中于修复和色彩类的低层调整,未覆盖复杂的构图级编辑。未来可以在现有基础上,进一步往“理解构图并整体优化”的方向扩展,实现更全面的图像后期优化。

关于作者

vivo BlueImage Lab

蓝图实验室,主要负责移动影像算法创新,包括图像/视频处理、图像/视频交互、图像/视频增强、多模态理解大模型等方面的技术前沿探索。

致力于不断提升vivo移动影像的算法能力,使用户能够拍摄出更加清晰、美观的照片和视频。同时积极探索增强现实、具身智能等新兴技术领域的应用,努力为用户提供更加丰富和便捷的影像体验。

论文链接:https://arxiv.org/abs/2604.19587
论文主页:https://vivocameraresearch.github.io/smartphotocrafterweb
论文代码:https://github.com/vivoCameraResearch/SmartPhotoCrafter

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI vivo
more
【前沿】vivo X500 Pro Max配置曝光 6.85英寸直屏?
三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”
vivoX500系列影像参数曝光|一加16T配置前瞻 骁龙8E6/超高刷小直屏
最强折叠+全新原子工作台 vivo X Fold6在MWC26震撼亮相
新品 | vivo G5i/G5z上架;长安启源 Q06 预告
vivo多款新品前瞻|iPhone18ProMax电池细节曝光
vivo X500 Pro Max再曝,6.85英寸2K大屏机
vivo X Fold6正式开售,后续还有新机待发
遏制恶意App,谷歌联合荣耀/OPPO/三星/传音/vivo/小米做了决定
小米、OPPO、vivo Ultra大战,第一名竟是它?!
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号