配套CLI与Skills,浙大开源可插拔Agent评测底座

量子位 2026-09-12 16:30
ZJU-REAL 团队 投稿 
量子位 | 公众号 QbitAI
配套CLI与Skills,浙大开源可插拔Agent评测底座图1

同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。

而在本地、Docker与各类云沙箱之间来回适配,又容易陷入写不完胶水代码的泥潭。

针对这一问题,浙江大学ZJU-REAL团队开源了ageval(agent eval)。它的核心思路是将待测Agent与运行环境通过插件彻底解耦:在配置文件中修改一行,同一份dataset就能在不同环境、不同Agent间自由切换运行。

配合专用的CLI与skills,ageval还能让coding agent自主编写benchmark、迁移已有测试集并执行自动化评测。

演示视频:配置一次评测,任意切换运行

功能一览:从本地调试到Hub协作

做Agent评测,开发者常遇到两个痛点:一是换个Agent或换套环境就得重写一遍适配脚手架;二是跑完只给出一个笼统的分数,中间卡在哪一步完全无法追溯。ageval覆盖了从本地复盘调试到云端结果共享的完整工作流。

本地轻量复盘:逐轮交互轨迹回放

评测未通过时,定位问题最需要看清Agent的实际执行轨迹。

在终端执行ageval view,即可在本地启动轻量Web轨迹查看器,按照Jobs→Tasks层级完整复盘每一次运行:

配套CLI与Skills,浙大开源可插拔Agent评测底座图2
本地Viewer中的一次运行轨迹与事件明细

插件中心:自由组合环境与Agent运行时

ageval将运行环境与Agent运行时均封装为标准插件,免去重复编写适配胶水代码的成本:

如果需要切换执行环境或待测Agent,只需在配置文件profiles.yaml中修改对应声明,原有的dataset无需任何改动即可直接运行。

配套CLI与Skills,浙大开源可插拔Agent评测底座图3
插件市场:浏览与接入环境插件和Agent运行时插件

插件详情页:依赖契约与运行参数一览

点击进入任意插件详情页,可以直观查看该插件对外export的服务、所依赖的环境capabilities,以及安装命令与参数配置示例:

配套CLI与Skills,浙大开源可插拔Agent评测底座图4
dsh插件详情页:查看DeepSeek官方harness的插件配置与能力说明
配套CLI与Skills,浙大开源可插拔Agent评测底座图5
nooa插件详情页:NVIDIA官方Agent运行时插件详情

公开榜单(Leaderboard):环境与配置严格对齐的对比

许多公开benchmark往往只公布模型名称与得分,既没有说明使用的是哪套Harness,也没有标明沙箱环境版本与Prompt模版,外界往往难以真正复现。

在ageval Hub的公开榜单上:

配套CLI与Skills,浙大开源可插拔Agent评测底座图6
Hub Leaderboard榜单:查看不同环境与Agent组合下的真实评测成绩

Agents市场:沉淀与复用Agent资产

在实际业务中,调优出一套好用的Agent(包括Prompt模版、工具链编排与执行逻辑)通常需要投入大量的工程精力。

在ageval Hub上,团队可以直接将调优好的方案打包发布为Agent包:

配套CLI与Skills,浙大开源可插拔Agent评测底座图7
Agents Hub:浏览、发布与复用已配置好的Agent包

点击进入单个Agent主页,可以进一步查看该Agent的配置详情、参与测评的模型列表与dataset历史记录。

配套CLI与Skills,浙大开源可插拔Agent评测底座图8
dsh-agent详情页:查看Agent架构、配置参数与历史评测记录

Models视图:模型画像与横向PK

在针对业务场景进行模型选型时,团队通常关注两个核心问题:

Models Hub:以模型为维度的综合画像

Models Tab中,可以按照模型维度查看其在各类dataset与Agent组合下的解题成功率和调用成本:

配套CLI与Skills,浙大开源可插拔Agent评测底座图9
Models Hub:以模型为主维度的全景观测面板

点击具体模型进入详情页,可以进一步查看该模型在不同dataset和不同Agent下的表现明细:

配套CLI与Skills,浙大开源可插拔Agent评测底座图10
Model详情页:查看模型在各个dataset和不同Agent下的表现明细

固定Agent架构,横向对比不同模型

在Agent详情页中,可以固定同一套Agent运行时(保持相同的Prompt策略与工具调度链),横向对比不同模型在同一个dataset下的代码生成质量与解题通过率:

配套CLI与Skills,浙大开源可插拔Agent评测底座图11
在Agent Hub中比较Model表现:固定同一套Agent运行时,横向比对不同模型的解题效果

自动化评测:让coding agent驱动整个流程(Skills&CLI)

在本地开发环境中,只需为coding agent安装ageval CLI和配套skills:

uv tool install ageval-cli
npx skills add ZJU-REAL/ageval

安装完成后,你的coding agent就能理解ageval的CLI指令与数据结构规范。你可以直接吩咐它完成原本繁琐的工程操作:

配套CLI与Skills,浙大开源可插拔Agent评测底座图12
Agent借助skills自动化运行评测

运行机制:为什么能做到自由插拔?

要既能无缝适配多种执行环境(本机、Docker、云沙箱),又能兼容完全不同的Agent运行时,关键在于底层两项核心设计:一次运行的五个标准阶段以及基于服务契约的插件机制。

一次运行的五个阶段

ageval的执行底座是一条确定性的单向流水线:

lock→environment→run→evaluate→record

无论运行过程是成功、失败、超时还是被外部中断,cleanup钩子都会在finally阶段可靠执行,彻底清理容器实例、注销网络并擦除临时凭证。

配套CLI与Skills,浙大开源可插拔Agent评测底座图13
一次运行的生命周期:从静态lock、gold隔离、run任务循环到独立评分与evidence封存

插件机制:基于export与inject的服务契约

框架内部没有面向特定环境或特定Agent的硬编码if/else分支,所有组件均通过声明式的服务契约实现解耦:

配套CLI与Skills,浙大开源可插拔Agent评测底座图14
插件机制与依赖图:通过export与inject服务契约解耦环境与Agent,由ExtensionGraph驱动调度

服务声明(export与inject):

在lock阶段校验并编排依赖拓扑:

实战:零侵入接入DeepSeek官方harness

以DeepSeek开源的deepseek-harness(dsh)为例。接入dsh不需要改动ageval框架的一行源码,只需要提供一份简明直观的插件声明:

plugins/dsh/plugin.yaml——Agent插件声明(节选)
plugin_id: dsh
slots:
exclusive:
id: executor Agent执行器
inject:
service: environment 
capabilities: [exec, upload] 

对于使用者而言,调用dsh与运行普通Agent完全一致。原有的dataset保持原样不动,切换对应的配置文件即可直接执行:

#1.安装带dsh支持的extras
uv tool install 'ageval-cli[dsh]'
#2.dataset保持不动,指定dsh配置开跑
ageval run <dataset> --task <task-id> --profiles profiles.dsh.yaml

快速开始

ageval现已正式开源。你可以通过pip/uv安装CLI,也可以直接从源码编译体验。

方式一:直接安装CLI(推荐)

CLI
uv tool install ageval-cli
(含e2b,dsh,daytona等)
uv tool install 'ageval-cli[all]'

ageval -V

npx skills add ZJU-REAL/ageval

直接运行公开的dataset,或本地dataset目录:


ageval registry list

ageval run <org>/<name>@<version> --task <task-id>

ageval view <org>/<name>@<version>

方式二:从源码体验最小示例


git clone https://github.com/ZJU-REAL/ageval.git
cd ageval

uv sync --frozen --all-packages

uv run ageval run examples/datasets/minimal-demo --task terminal-jsonl-agg

uv run ageval view examples/datasets/minimal-demo

GitHub仓库:https://github.com/ZJU-REAL/ageval
项目主页:https://zju-real.github.io/ageval
文档与插件指南:https://zju-real.github.io/ageval/docs/

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
机器人开源项目清单:GitHub上这些项目,硬件工程师值得收藏
开源模型夯爆了!ZDTaichu5.0-9B,10B以内空间具身智能卷出通用类第一
ECCV 2026开源 | LinStereo:仅2次迭代超越全迭代效率型基线,零样本跨域立体匹配SOTA,遮挡误差暴降37%
开源模型不再免费,月之暗面、阿里开始要分成,“大模型税”能落地吗?
15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
刚刚,国产2B小钢炮开源!逼近人类水平,跑出端侧通用Agent雏形
2B参数!国产“小钢炮”模型开源,打赢12B谷歌Gemma 4
9月21日-23日,世界人工智能开源大赛GOAI开源周开放报名中!
Game Bub:开源 FPGA 掌机,横屏终于开源了
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号