点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
作者供稿直发 | 文末进3D视觉交流群
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
同样是失败,完成了 99% 和只完成了 5%,真的应该得到同一个分数吗?
同样是成功,一次干净利落地完成,和经过反复试错、回退、停滞后勉强完成,真的代表同样的能力吗?
成功率回答“有没有完成”,却回答不了“走了多远、走得多稳、在哪里失误,以及失误后能否恢复”。
PRM-as-a-Judge 1.5 提供了一套面向机器人执行过程的细粒度评测方法和工具链,让进展、停滞、回退与恢复都成为可以分析和比较的信号。

机器人评测,不该只剩一个比特
随着机器人操作从简单的抓取放置走向长时程、强接触和多阶段任务,传统成功率的局限越来越明显:早期崩溃与“最后一厘米”的失败都会被记为 0;稳定完成与依赖反复纠错的成功都会被记为 1。
更细的规则式评分可以提供阶段分数,但需要为不同任务单独设计规则,难以完全避免主观判断。辅助状态指标借助物体位姿、接触、力和关节状态等获取更客观的信息,但依赖于特定的环境状态,使用范围受限。
因此,机器人评测需要一种更通用的方法:只依赖普遍可获得的任务指令与轨迹视频,就能恢复全过程信息的统一评测方式。
PRM-as-a-Judge:把“进度尺”搬到评测环路
过程奖励模型(Process Reward Model,PRM)原本就具备估计任务进展的能力。过去,这类信号更多用于训练时的奖励或测试时的动作选择。
PRM-as-a-Judge 则将 PRM 放到机器人完成执行之后,对已经发生的固定轨迹进行分析。评测不会更新被评策略的参数,也不会改变本次执行行为。
整体流程可以概括为:

PRM-as-a-Judge 1.5 不提出新的 PRM 模型。PRM 负责估计任务进度,PRM-as-a-Judge 则先检验评判器是否可靠,再利用它完成轨迹测量、统计和诊断。
三个新增指标,补充成功率
PRM-as-a-Judge 1.5 延续了 1.0 版本的 OPD 指标体系。OPD 分别从三个层面描述机器人执行过程:Outcome 关注机器人推进到了什么阶段,Process 关注完成任务的过程是否高效,Diagnosis 则关注执行中的停滞、回退和恢复。
在这一体系中,MC 和 MP 主要描述任务进展,PPL 用于衡量推进效率,CRA 和 STR 用于刻画回退与停滞。1.5 在此基础上新增 FNS、DRR 和 SQS,分别关注失败轨迹距离成功还有多远、最大回撤后恢复了多少进度,以及成功轨迹的执行质量,进一步补充失败、恢复和成功质量方面的信息。
FNS:失败接近度
FNS 只分析失败轨迹,衡量机器人在失败前曾经达到的最高进度。
它可以区分两类不同的失败:
已经接近完成,但在最后阶段失误; 任务刚开始不久就失去有效进展。

DRR:回撤恢复率
DRR 衡量机器人发生最大回撤后恢复了多少进度。
对于真实机器人来说,执行过程中出现偏移、抓取失败或姿态变化并不罕见。更重要的问题是,机器人能否在失误后重新找到方向并继续完成任务。

SQS:成功质量
SQS 只分析成功轨迹,综合评价执行是否高效、稳定,以及是否存在过多的回退和停滞。
两条轨迹都完成任务,并不意味着过程质量相同。一条轨迹可能动作连续、几乎没有额外尝试;另一条轨迹则可能经过多次调整后才完成。SQS 用于保留这种差异。

从评测代码到可交互的模型体检
为了让过程评测能够用于日常研发,PRM-as-a-Judge 1.5 完善了从数据输入到报告生成的工具链:
研究者可以使用 JSONL 清单描述任务指令、轨迹视频、模型和基准信息,也可以通过 Notebook 或命令行运行评测。系统会生成进度曲线、单轨迹指标以及任务级和模型级汇总结果,并支持查看失败位置、回撤区间、当前帧和实时指标。
后续可以通过进度曲线、轨迹指标和交互式报告,定位机器人在哪个阶段停滞、回退或恢复。

在实际评测中,看见“成功率之外”的能力
在 RoboDojo 的公开轨迹分析中,覆盖了 42 个仿真任务和 18 个真实世界任务。下面两张表分别展示了模型在真实世界和仿真环境中的多指标表现:


结果显示,同一个模型在成功率和过程指标上的排名并不完全一致。过程评测不仅能判断模型是否完成任务,也能进一步比较模型的任务达成能力、执行质量和环境适应性。
VLA 整体表现更强,但模型越大不一定越好
在 RoboDojo-Sim 中,VLA 模型总体上优于 WAM 模型。不过,模型参数量与最终表现之间没有明显的正相关,一些规模较小的模型也取得了更好的排名。
π₀.₅ 在多个指标上表现最稳定
它在任务进展、成功率、失败接近度和回撤恢复等多个维度上都保持了较强表现,说明单一指标的领先并不一定代表整体能力更强。
不同任务类型暴露出不同的能力差异
精细操作类任务整体表现最好,开放词汇任务最困难,长时程任务则表现出最大的模型差异。过程指标因此能够帮助研究者判断模型究竟在哪类任务上存在短板。
仿真表现与真实世界表现之间的对应关系较弱
在共享模型的仿真与真实世界评测中,成功率排名的相关性为 0.58,而最大进度 MP 和失败接近度 FNS 的相关性只有 0.18 和 0.22。需要精确对齐或处理复杂接触的任务,通常会出现更明显的真实世界性能下降。
它补充成功率,也尊重评测边界
PRM-as-a-Judge 1.5 并不取代成功率。成功率仍然负责回答任务是否完成,过程指标则用于补充成功率无法表达的信息,包括机器人推进到了哪个阶段、失败发生在什么时候、执行过程中是否出现明显停滞或回退,以及失误后能否继续恢复。 同时,进度曲线会受到评判器自身误差和感知盲区的影响。一维进度也无法完整表达多物体、并行子任务和复杂接触关系。因此,过程指标适合用于发现问题和缩小排查范围,但不能单独证明问题的因果原因。 正因为如此,PRM-as-a-Judge 强调可检验、可复查和可下钻:先验证评判器,再查看曲线与案例,最后把指标作为模型分析与迭代的证据,而不是不可质疑的裁决。
从结果比较走向过程分析
当机器人任务越来越长、接触越来越复杂时,仅用一个成功或失败标签已经很难完整描述模型能力。
PRM-as-a-Judge 1.5 通过进度曲线、过程指标和交互式报告,把机器人执行过程中的进展、停滞、回退与恢复保留下来。 机器人评测因此不再只关注任务是否完成,也能够进一步观察任务是如何完成的,以及失败发生在什么地方。
相关链接
PRM-as-a-Judge 1.0 论文:https://arxiv.org/abs/2603.21669
PRM-as-a-Judge 1.5 论文:https://arxiv.org/abs/2608.14284
GitHub 代码仓库:https://github.com/YuyangLiu2003/PRM-as-a-Judge
项目主页:https://prm-as-a-judge.github.io/index.html
用户手册:https://prm-as-a-judge.github.io/doc.html
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。