还在手搓论文poster?自进化设计Harness直接出

机器之心 2026-08-21 09:49
还在手搓论文poster?自进化设计Harness直接出图1


AutoDesign:

让 Harness 学会自我进化


未来多智能体系统的发展,需要模型参数与 Harness 协同进化,不能忽略任何一端。


还在手搓论文poster?自进化设计Harness直接出图2
AutoDesign For AutoDesign 示例:通过自进化迭代的最终 DesignHarness,在 40 分钟内为本论文生产了海报。整个过程调用了 253 次工具,进行了 11 轮编辑循环,最终在 3 美元的成本内完成了海报设计。


多模态输入输出任务需要一个能够长程运行的 Agent System:以 Coding 作为基础行动能力,结合工具调用、视觉感知与反馈、环境交互,以及持续的自我修改和迭代,逐步达到人类专家处理真实复杂任务的水平。在这个系统中,模型参数提供思考、推理与行动的基础能力;Harness 则负责组织流程、约束行为,让模型能够更高效、更准确地完成长程任务。


当前,模型训练已经形成了较成熟的工业化 Pipeline:通过大规模数据学习参数,再借助后训练和强化学习约束行为。相比之下,Harness 的迭代优化仍有许多问题尚未研究清楚:每次迭代应该修改哪些模块和组件?改动范围应该多大?接受一次更新的机制和标准是什么?Evaluator 应该如何设计?面对主观任务,又该使用什么指标?出现性能回退时如何定位和处理?如何提出新的方案,并保证系统沿着正确方向持续演进?


AutoDesign 选择多模态设计这一长程复杂任务,研究 Harness 的自进化问题。


还在手搓论文poster?自进化设计Harness直接出图3



由于开源社区此前缺少一套整合多种指标和跨学科标准的海报 Benchmark,我们同时构建了 PosterBench 及完整的 Evaluation Protocol,从七个维度评价生成结果:事实来源真实性、内容覆盖度、信息密度、视觉质量、版式正确性、整体可读性和美学表现。


这套评价体系采用 Hybrid Evaluation:主观质量由 VLM Judge 评估,版面越界、文字重叠、元素比例等可以明确计算的问题,则由 Rule-based Python 算法检测。PosterBench 包含 100 篇论文,并提供由 10 篇论文组成的 PosterBench-mini,方便快速测试和比较。


除 Design Agent 主赛道外,我们还开源了固定 DesignHarness 的 CodingHarness 赛道,并通过不同子赛道控制变量,分别评价 CodingHarness、模型本身以及 DesignHarness 的质量。


基于我们提出的 MetaHarness Optimization 方法,AutoDesign 在 Paper-to-Poster 任务中的得分随着自迭代持续提升:49 → 53.2 → 68.8 → 69.7 → 73.5 → 76.3 → 78.6 → 80.9


多种模型接入 DesignHarness 后,平均提升 12.4 分;在相同 Agent 和模型配置下,AutoDesign 比 Claude Design 高 7.45 分。在一次完整的海报设计中,Agent 共调用 253 次工具,进行了 11 轮编辑循环,并将总成本控制在 3 美元以内。也进一步证明了自进化得到的 DesignHarness 是可泛化到不同模型不同的 Coding Harness 上的。


还在手搓论文poster?自进化设计Harness直接出图4

AutoDesign 通过自主优化与人工引导持续进化 DesignHarness,使各类 Coding Agent 提升 5.0–19.6 分,最高达到 81.5 分。


AutoDesign 方法论细节


AutoDesign 将模型周围的 DesignHarness 作为持续学习和优化的对象。DesignHarness 由五类组件构成:上下文与记忆、工具与规范、执行运行时、任务编排,以及评估与反馈。它们共同决定系统如何读取多模态来源、调用工具、生成作品、发现问题并完成交付。


还在手搓论文poster?自进化设计Harness直接出图5


AutoDesign 通过嵌套的内外循环实现自进化。在内循环中,Designer 根据来源上下文调用工具,生成可编辑的 HTML,并结合渲染结果、规则验证和 VLM Critic 的反馈进行局部修订。


在外循环中,MetaHarnessOptimizer 汇总多个任务中的 Rollout 轨迹、工具调用、渲染诊断和 Evaluator 反馈,识别反复出现的失败模式。随后,Optimizer Code Agent 针对一个明确的 Harness 组件提出有边界的代码更新。为了保证收益可以归因,每次外循环只允许修改一个组件;候选更新只有在提升训练任务表现,且不导致独立 Development Set 退化时,才会被接受并写入下一版 DesignHarness。


“一次只修改一个组件” 和 “使用独立开发集” 是我们从大量实验中总结出的两个重要原则。前者避免多个改动同时发生,导致 Credit Assignment 混乱;后者防止系统只记住训练任务。二者共同保证每次被接受的更新都能沉淀为可审计、可复用的设计经验,而不是一次性的 Prompt 调整。


因此,最终得到的 DesignHarness 不是一组固定 Prompt,而是一套可复用的设计生产系统。它能够构建来源上下文、协调工具调用、生成并检查可编辑输出,同时保留可追溯的执行证据,支持后续修订和下一轮系统演化。


还在手搓论文poster?自进化设计Harness直接出图6

Design Harness 利用 Critic 反馈迭代生成和修改作品,构成内循环;外循环则通过在设计任务中运行该 Harness、评估输出、提出单个组件的更新,并决定接受或拒绝候选更新,持续优化 Design Harness。整个过程可自主运行,也可选择性地加入人工指导。


为什么选择 “论文到学术海报” 作为验证场景?


我们将 Paper-to-Poster 作为主要验证任务。与侧重风格和视觉氛围的商业海报不同,学术海报需要把长篇、多模态论文压缩成单页传播媒介,同时保证事实可追溯、核心结果完整、图表和数值准确,版式可读且内容可编辑。一张海报即使视觉精致,只要写错数值或遗漏核心贡献,就无法承担科学传播的功能。因此,Paper-to-Poster 是检验设计智能体能否完成长程设计、检查和修订的严格场景。


好不好,不能只靠 “看起来不错”


为了使用统一、独立的标准评估优化后的系统,我们发布了 PosterBench。主赛道覆盖五个学科的 100 篇论文,PosterBench-mini 则提供由 10 篇论文组成的低成本测试集。评测从七个维度衡量生成结果:事实忠实性、内容覆盖度、信息密度、视觉证据、布局、可读性和美学表现。


PosterBench 采用规则算法与 Rubric-based VLM Judge 相结合的评测方式。规则算法负责检查文本溢出、元素重叠、空间利用率和数值一致性等可程序化问题;VLM Judge 则结合论文来源,评价视觉表达和科学传播质量。此外,我们还通过系统盲测的人类评审,检验自动评价与人类偏好的一致性。


PosterBench 是一套在优化完成后使用的冻结评测协议,并不直接作为驱动内外循环更新的打分器。这一隔离可以降低系统针对最终评测过拟合的风险。


还在手搓论文poster?自进化设计Harness直接出图7

Benchmark 的规则驱动评测算法可视化,以及它们分别监测了哪些部分、具体是如何监测的。


AutoDesign 还提供了可本地部署的客户端。Agent 生成内容后,系统会将结果加载到可视化画布中,用户可以通过三种方式继续编辑,编辑完成后,系统支持导出 PPTX、PDF 等格式。


  1. 与 Coding Agent 进行多轮对话,实时修改内容;

  2. 选中并圈出需要调整的区域,以多个 Comment 的形式向 Agent 提出修改要求;

  3. 使用传统设计软件中的手动编辑功能,调整颜色、配色、字体和间距,或者插入、删除图片。



在 PosterBench Main Track 的相同 Claude Code + Claude 4.8 设置下,AutoDesign 获得 78.32 分,超过闭源商业系统 Claude Design 7.45 分。将学习得到的 DesignHarness 接入七组控制变量实验的 Coding Agents 后,平均分从 54.99 提升至 67.39,平均提高 12.4 分。而我们还人类评测做了系统盲测人评:收集了 933 个有效判断,AutoDesign 的 Bradley–Terry(离线版本的 ELO 测试,跟各种 Arena 方式一样)AutoDesign 的胜率估计为 64.0%,同样在受评系统中居首。


还在手搓论文poster?自进化设计Harness直接出图8


未来展望:从一张海报开始,

但不止于海报


AutoDesign 作为我们研究路线的第一个项目,未来,我们会从海报继续扩展到 PPT、网页和学术演讲视频等多模态内容。当前系统已经能够一键将论文转化为这四种传播媒介,但方法论和效果仍有优化空间。


更长期的问题是:能否让一个 multimodal-in、multimodal-out 的 Agent System,将人类偏好和任务经验持续积累为系统级能力,并实现 Recursive Self-Improvement?我们的下一个项目将继续探索这一方向,希望构建一个能够持续自我进化的系统,同时避免类似 Reward Hacking 的评测投机,并将这种能力泛化到不同的生产级任务中。


还在手搓论文poster?自进化设计Harness直接出图9


欢迎体验代码,提 issues,PRs,一起参与这套系统下一阶段的共建。


还在手搓论文poster?自进化设计Harness直接出图10


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR
more
闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5
万字长文拆解DeepSeek V4 Pro与Harness:从后训练到「代理自进化」,更大的变化在开源框架里
昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!
“中国芯”第三届EDA专项产品革新奖候选连载 | 比昂芯ArrangeX:从概念到解决方案的微系统和先进封装EDA平台,为Chiplet设计前置排险
行芯科技品牌战略升级!IDAS 2026 邀您共赴 τ-Aware 之约
DeepSeek Harness 插件热拔插背后的《时空可组合性编程范式》
刚刚,英伟达AI刷爆ARC-AGI-3!华人班底一口气屠了183关
Joby和Archer处理失速带来的性能问题
展品预览 | 韩国 XR 企业展团集结 2026深圳国际AI+AR智能眼镜产业展 ,多赛道沉浸式显示方案集中亮相
DeepSeek的Harness,为何是一头黑色鲸鱼?
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号