香港大学MMLAB提出了一个非常简洁且高效的自进化具身智能系统基线,“PhysicalRSI 1.0”,登顶RoboDojo。让机器人根据任务改写自己的工具、代码、记忆、与技能,再由物理环境选出更有能力的“下一代”。
PhysicalRSI 1.0在RoboDojo上取得了31.38%的平均任务成功率。相较于GPT-6 Astra在RoboDojo上全量测试一次需消耗20万人民币tokens费用,PhysicalRSI 1.0仅用百分之一的成本,比GPT-6 Astra的成功率相对提升了39.6%。
从训练动作模型,到让通用大模型直接控制机器人
通用大模型,开始在机器人评测中超过专用策略。 9 月,GPT-6 Astra在 RoboDojo上取得 28.97 Score、22.48%平均成功率,超过报告比较的40个公开机器人策略。直接看图、理解指令、决定机械臂如何运动,正在成为通用大模型的一项新能力。
VLA、WAM 等路线从动作学习和物理预测入手,通用大模型则将语义理解与任务推理带入控制过程。如今,这些路线开始在同一套机器人任务上接受检验。但GPT-6 Astra的成绩也呈现出鲜明反差:总体成绩领先,精密操作成功率却只有4%。 抓取之后怎样调整姿态、如何对准插孔、多步操作如何衔接,仍是机器人必须解决的具体问题。
香港大学MMLAB提出了一个简单且高效的方案,PhysicalRSI 1.0(Physical Recursive Self-Improvement),让通用模型进一步参与这些控制问题的改进:看完一次失败的执行,模型可以修改动作程序、更换工具、调整记忆与技能的调用方式,生成不同的子代智能体,再由环境中的任务表现决定保留哪个版本。
该方案是“System 1–2 协同自进化(System 1–2 Co-Evolution)”,让负责理解与规划的“System 2”改进负责动作执行的“System 1”,同时修改两者协作的Harness。一次任务留下的经验,由此进入下一代智能体实际运行的代码与配置。
团队的目标是为RoboDojo实现一套简洁而且强大的baseline,PhysicalRSI 1.0在项目统一任务的对比中取得 36.27 Score、31.38% SR,位列第一。其中最鲜明的差距来自精密操作:GPT-6 Astra的成功率为 4%,PhysicalRSI 为 32.50% 。

PhysicalRSI 1.0珠峰成绩图。
GPT-6 Astra的短板,落在“理解之后”的控制过程
插钥匙就是一个直观的例子。理解“把钥匙插进锁孔”并不难,但机器人需要先抓住钥匙,调整到可用的姿态,必要时在两只手之间交接,再让钥匙与锁孔对齐。前几步取得进展,也可能在最后的插入环节失败。Astra的RoboDojo Precision成功率为4%,说明通用推理能力尚未充分转化为精细控制能力。
在GPT-as-policy设置中,大模型根据观察直接选择运动目标,再由底层接口转成机器人指令。PhysicalRSI 1.0希望把这两层职责组织得更有效:“System 2”负责判断如何完成任务、分析哪里出错;“System 1”用技能模型、控制程序和工具完成具体动作,例如π0.5就只是其中一个可调用的动作工具。
分工之后还需要持续改进。例如,机械臂松开衣服后的回撤路径影响了后续折叠,“System 2”就可以修改回撤程序;下一次执行时,“System 1”直接运行新程序。与此同时,Harness也可以改变“System 2”读取哪些历史、何时检查结果、选择哪个工具。决策方式与执行能力都成为可修改、可评估、可继承的对象。
这就是“System 1–2 Co-Evolution”要解决的问题:将一次任务中的分析,落实成下一代智能体实际运行的程序与配置。环境中的后续表现,检验这次修改是否有效。
Self-Harness:让机器人改写自己完成任务的方法
PhysicalRSI 1.0用Embodied Self-Harness实现这套协同自进化。Harness可以理解为智能体的工作程序。它把基模、工具、技能和记忆连接起来:看到什么信息,采用什么计划,调用哪个技能,保留哪些状态,出现偏差后怎样处理。Self-harness 则让智能体自己修改这套工作程序。
叠衣服的版本记录给出了一个具体例子。某个候选版本改动了释放衣物后的回撤方式:下降时,记录机械臂实际经过的关节位姿;松开衣物后,沿这条路径反向返回。参数home和descent每个回合重新测量。下一代继承的是“记录路径并沿路径回撤”的方法,因此衣服位置变化后,程序仍会按当前现场重新建立状态。

Self-harness把这样的修改纳入选择过程:父代读取任务录像、动作记录和评估反馈,生成绑定不同工具、代码、记忆与技能的子代;父代与子代进入环境评估,表现更好的版本留下来,继续产生下一代。 不同候选可以修改不同环节,新增代码也可能被淘汰。这里的“适者生存”,由任务奖励或成功率具体定义。
记基模为F,第k代的完整工作程序与配置为Hₖ,则智能体为Aₖ = Agent(F, Hₖ)。主算法可简写为:
agent = Agent(F, initial_harness())
for k in range(budget):
plan = agent.plan(task) # System 2:理解与规划
trace = agent.act(env, plan) # System 1:执行与反馈
variants = agent.reflect_and_rewrite( # System 2:反思并生成子代配置
task, trace, agent.harness,
editable=("tools", "code", "memory", "skills"),
)
children = [Agent(F, h) for h in variants]
pool = [agent, *children]
fitness = evaluate_in_environment(pool, eval_tasks)
agent = select(pool, fitness) # 环境选择;继承选中的 harness
F的权重可以保持不变。变化的是H:动作技能、记忆组织、工具接口,以及规划与调用规则。大模型的推理由此能沉淀成程序,程序通过环境反馈继续被修改,选中的子代又具备改写下一代的能力。这给出了递归自我改进的具体对象、更新方式和选择依据。

子代继承完整的 harness 配置。System 2 提出修改,System 1 在环境中执行,任务表现决定哪些子代进入下一轮。
在叠衣服的迭代中,不同版本先后探索了回撤路径、腕部对齐、目标选择和布料跟踪。下方录像展示相应行为的变化;共同开发场景上的五个选取节点,SR 从 27.5% 提升至 60%,Score 从 31.5 提升至 61.5。这些记录让“自进化”可以对应到具体版本、具体代码与具体动作。
迭代案例|从错过袖子抓取,到改进接近与回撤路径,再结合腕部对齐和布料跟踪完成折叠。视频沿用项目剪辑及片内速度标注。

共同开发场景上的五个选取节点:SR 从 27.5% 提升至 60%,Score 从 31.5 提升至 61.5。
一套简单有效的baseline,在RoboDojo对比中取得第一
RoboDojo仿真评测涵盖42个任务,考察泛化、精密操作、长程任务、记忆与开放能力。基于此,PhysicalRSI 1.0设计了一套极为简单但有效的基线。

PhysicalRSI 1.0 baseline:System 2分析经验并修改Harness,System 1通过技能与工具调用Physical API,执行反馈进入下一轮改进。
这套baseline的结构很直接:多模态基模负责理解、规划和改写harness;code-policy skills、π0.5与工具负责操作;所有动作经Physical API进入环境。 例如,代码技能可以把数字识别、排序和抓取串起来,也可以保存被遮挡物体的位置,或安排两只手的交接顺序 。
在相同任务子集、五类能力宏平均的口径下,PhysicalRSI 1.0取得36.27 Score/31.38% SR,高于Astra的 28.86/22.21% 和单独使用 π0.5 的 11.03/6.63%。当前官方快照中总Score最高的其他模型Simate-beta,重算到这一口径后为 31.72/25.74%。PhysicalRSI 1.0的成功率较Astra高8.90个百分点,较Simate-beta高3.42个百分点,约为π0.5的4.53 倍 。
相同任务口径、五类能力宏平均。PhysicalRSI:38.25 Score/33.01% SR;Simate-beta:31.72/25.74%;GPT-6 Astra:28.86/22.21%;π0.5:11.03/6.63%。
精密操作:从抓到钥匙,到真正完成插入。
Precision 维度,PhysicalRSI 的 SR 为 32.5%,为 Astra(4%)的 8.125倍。项目提供的三个 seed 评估截图中,插钥匙成功率为 39.33%,π0.5、Astra 和 Simate-beta 均为 0%;插管为 66%,三个对照分别为 3.33%、0%、22%。下方的成功录像可以看到完整的抓取、交接与插入过程。
12 秒成功回合:先抓取钥匙,再双臂交接,最后由接收侧机械臂完成插入。原速播放。
以下单项采用截图中的三个 seed 均值,每格为 Score / SR;基线来自官方对应任务记录。
| 任务 | PhysicalRSI 1.0 | π0.5 | GPT-6 Astra | Simate-beta |
|---|---|---|---|---|
| 86.00 / 86.00% | ||||
| 48.43 / 39.33% | ||||
| 78.93 / 66.00% | ||||
| 62.27 / 56.00% | ||||
| 79.33 / 79.33% | ||||
| 60.00 / 60.00% | ||||
| 98.33 / 94.00% |
交换积木:先腾出位置,再完成交换,朝向也必须正确。
两块 T 形积木占着彼此的目标位置,直接搬向目标会发生冲突。PhysicalRSI 的程序先找缓冲区,将 A 移走,再把 B 放到 A 原来的位置,最后把 A 放到 B 原来的位置;每一步都保留目标朝向。网页评估记录中,这项任务的 SR 为 92.67%,π0.5 为 0.67%,Astra 为 18%。视频左侧的 π0.5 回合最终朝向不满足要求,右侧完成了位置与朝向交换。
执行组织案例|交换两块 T 形积木的位置与朝向。左侧最终朝向未满足目标;右侧使用空闲缓冲区,规划三次搬运,并在每一步保留目标朝向。
遮挡后揭盖:把“刚才看见了什么”保存成后续动作可用的状态。
机器人先盖住积木,再按红、绿、蓝的顺序揭开。盖住以后,当前画面已无法直接提供积木颜色;程序需要保存颜色与位置的对应关系,再按阶段调用抓取动作。网页记录中,PhysicalRSI 的 SR 为 100%,π0.5 为 13.33%,Astra 为 46%。下方左侧回合最后一次抓杯失手,右侧完成了顺序揭盖。
状态记忆案例|先盖住积木,再按红、绿、蓝顺序揭开。左侧最后一次抓杯失手;右侧保存位置并按阶段执行,展示回合内状态如何服务后续动作。
符号任务:把识别出的规则接到真实操作上。
截图记录中,解方程的 SR 为 60%,Astra 为 40%,π0.5 为 0%;井字棋为 94%,Simate-beta 为 60.67%。这类任务同时要求理解符号关系与完成多步操作。随机数字排序的视频则把控制过程展示得更直接:识别当前数字,按数值排序,分配目标位置,再依次抓取和放置。排序规则写进 code-policy skill,动作工具完成每一步搬运。
技能案例|随机数字排序。左侧尝试未完成数字排列;右侧识别数字、按数值排序,再依次放入目标位置。两个独立回合均按原速播放。
这些案例说明了 baseline 的具体作用:用程序表达顺序、空间约束与状态,用技能完成动作,再把任务反馈送回 self-harness 修改过程。π0.5 的动作能力是其中一个组成部分,PhysicalRSI 改进的是组织这些能力的完整智能体。
从一个baseline,走向具身自进化的研究基础设施
RoboDojo 是PhysicalRSI 1.0的第一个主要示例场。项目希望进一步建立具身自进化研究的基本标准:明确智能体可以修改哪些部分,子代如何生成,环境如何评估,哪些修改能够被继承。每一次能力提升,都应能追溯到对应的版本、交互记录与选择过程。
以此为基础,PhysicalRSI 1.0希望提供一套可扩展的具身自进化基础设施:用统一接口接入不同的基模、VLA、工具和物理环境;管理候选智能体及其演化谱系;记录任务反馈,并支持在一致的评估与资源预算下比较不同演化算法。这样,社区可以分别研究记 忆如何影响选择、技能如何跨任务迁移、什么样的变异与选择机制更有效。
这也是香港大学MMLAB团队所期待的principled and fundamental research foundation:把具身自进化变成有明确对象、有共同接口、有可检验过程的基础研究。今天的最小实现从桌面任务出发,后续可以接入更多机器人、接触更复杂的任务,并让来自不同环境的经验参与下一轮进化。
PhysicalRSI 1.0希望为社区提供共同的起点,去探索智能体在更广阔物理世界中持续获得新能力的方法。
项目与更多演示:
mmlab.hk/research/PhysicalRSI
-END-
点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀