视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成

量子位 2026-09-29 12:35
OmniHarness 团队 投稿 
量子位 | 公众号 QbitAI

重绘一张涂鸦后,AI都学会了什么?

涂鸦变成鲜花,鲜花再长成一片花田——每一步的输出都是下一步的输入,中间任何一环偏了,误差就会沿着流程一路传下去。而当视觉AI完成了全部规划和试错,正确的经验能留下来吗?

由北航、港中文与新国大团队共同完成的OmniHarness给出了一种办法:参数不变,把做对的流程收进方法库,让下一次创作有经验可用。

画得出脑洞,改得准细节

从一张花朵涂鸦开始。

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图1

先重绘成写实红花,再沿用其风格生成花田。

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图2

前一步的结果,成为下一步的参考。

四格漫画要串起“醒来—看手机—发现周日—继续躺平”的剧情,兼顾动作、文字和画面衔接。

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图3

海报与书封,还要满足指定内容、标题和布局要求。

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图4

局部编辑更考验分寸:移除叉子或换成勺子,还要保留食物、杯子和桌面布局。

“其他地方,尽量别动。”

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图5

一次成功,怎样变成一类任务的方法?

画对一次之后,换张图片、换个主题,经验还能派上用场吗?视觉智能体要走向实际创作,就绕不开这个问题。

OmniHarness通过符号策略学习,把验证有效的做法提炼成一类任务可复用的方法。

红花和输入草图,是这道题的细节;“先重绘、再用结果引导生成”,则是一种可迁移的做法。换个主题,这条流程仍可作为适配新需求的起点。

策略是一套带使用说明的工作流:保留共享步骤、适用条件和依赖资源,去掉当前任务的具体输入。

新任务到来后,系统检查条件、填入新输入,再调整或组合已有策略。

自己出题、边做边检查、把经验留下来

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图6

第一步:挑选“踮踮脚够得着”的挑战

任务未到,先练起来。

反复练熟悉的题,收获可能有限;题目远超当前能力,也容易陷入低效尝试。选题要兼顾探索价值与现有方法的支撑。

默认每轮提出10个候选任务,按新颖性与能力边界评分的乘积选题:

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图7

其中,视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图8为候选任务集合。

新颖性视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图9看哪里练得少;能力边界评分视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图10看难度是否适合当前能力。

新颖性随尝试次数递减:

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图11

其中,视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图12为所需能力集合,视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图13统计对应“情境—能力”的练习次数。图生图按源图区分情境,文生图使用统一标记。

对所需能力取平均,还能避免任务仅因包含更多能力,就获得更高的新颖性评分。

系统按调用与验证成功次数估计可靠性,取95%Wilson置信区间下界;每项能力选最可靠的适用且未停用工作流。

任务能力估计由最薄弱的一项决定:

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图14

多步任务的短板,可能决定全局:某个关键环节缺少可靠方法,就会拖累最终结果。

再计算能力边界评分:

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图15

当视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图16=0.5时评分最高,能力估计接近0或1时评分降低,鼓励探索有基础、仍有提升空间的任务。

这里的视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图17是基于策略可靠性的能力估计,并非任务真实成功率。

第二步:边做边检查

系统先规划步骤与依赖,再将代码转换为ComfyUI工作流,验证流程可执行性、中间结果与最终输出。

中间验证尤其关键。如果红花已经偏离要求,继续用它生成花田,偏差可能沿流程传递。及时检查,才能尽早调整。

发现问题后,定位并修复失败环节,保留已验证部分;必要时调用子智能体,在有限重试内重新验证。

第三步:把经验留下来

成功流程抽象为策略;失败留下证据、原因和修正办法。系统持续更新可靠性、合并等价流程,让新经验参与下次选题与执行。

成功一次,也不意味着从此可靠。后续调用的成功与失败,会继续影响策略的可信度和复用优先级。

创意任务解决率95%,提升在哪里?

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图18

在ComfyBench创意任务上,OmniHarness解决率达95%,比最强对照SymbOmni高27.5个百分点;Codex GPT-4o配置总体达92.5%。

Pass衡量工作流能否运行,Resolve衡量结果是否满足要求。

两种配置的工作流运行通过率均为100%;ComfyMind和SymbOmni也已达到这一水平。因此,更值得看的是流程跑通后,究竟完成了多少任务。

同用GPT-4o,OmniHarness总体解决率为89.5%,高于ComfyMind的83%;创意任务为95%,对照为57.5%。

同用GPT-4o仍有提升,支持了整体框架的有效性,也让工具组织与经验复用成为值得进一步观察的因素。

换成Codex规划配置,总体解决率从89.5%升至92.5%,复杂任务从76.7%升至83.3%,体现了规划配置对多步流程表现的影响。

复杂任务仍有进步空间:Codex配置为83.3%,略低于ComfyMind的85%。

换个智能体、换成视频,经验还能用吗?

视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图19
视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图20
视觉AI上线经验积累新范式,图像策略也能直接迁移到视频生成图21

自主练习得到的策略库保持冻结,经知识接口适配交给其他智能体使用,保留宿主控制流程,不微调模型。

这份策略库既包含可复用的工作流模板,也包含失败证据与修正方法,供其他智能体通过自身的检索、规划和执行流程调用。

接入后,总体解决率变化如下:

创意任务解决率分别提升27.5、17.5和10个百分点。

三个系统在创意任务上的增幅,都高于各自的总体增幅。这提示,面对新的创作要求,可调用的方法和修正经验尤其值得重视。

只用图像任务练习得到的冻结策略库,还能参与视频生成。

视频总体解决率达85.9%,比表中最佳对照高5.1个百分点;视频到视频任务达80.0%,比该对照高13.3个百分点。

图像策略支持内容构建、参考保持等操作,视频专用组件处理时序,二者经适配和组合完成任务。

让每次实践,都留下方法

OmniHarness让经验成为可积累、可复用的能力资源。自主练习与多轮检查仍有计算开销,后续需优化检索、验证与推理预算。

完成任务之后,还能留下些什么?OmniHarness的回答是可验证、可调用、可继续修正的方法。让下一次行动接住上一次的经验,是这条研究路线的价值。

论文全文:https://arxiv.org/abs/2609.16057
项目主页:https://omniharness.github.io/
代码与运行说明:https://github.com/OmniHarness/OmniHarness

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
Manus 2.0回来了!给AI配手机号和钱包,还能拉群干活
AIVA ME7巴黎首秀,以生命之美塑造AI智慧生命体
零刻GTR9 Pro迷你机发布,搭载Ryzen AI Max+ PRO 495芯片,首发价29998元
在AI抢人大战里吃到红利的人,年入2亿
曝OpenAI紧急叫停新模型发布!
探路「AI+试验场」,宁波市鄞州区的「场景」吸引力从何而来?
梅耶尔再战AI赛道:Dazzle试图用“相册记忆”重构个人助手逻辑
OpenAI将重新开放200美元套餐,但Tibo被骂惨了
腾讯内测AI游戏伴侣“鹅次元”:数字人陪玩能否重构社交变现逻辑?
活动推荐 | 国际半导体前沿技术赋能AI与绿色交通高峰论坛
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号