具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型

机器之心 2026-08-27 18:30
具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图1


不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。


给它一只单目摄像头、四个动作按键,剩下什么都不给。


来自阿德莱德大学吴琦(Qi Wu)团队的一项新研究干了一件听起来有点大胆的事:把 coding-agent(就是 Claude Code、Codex 这些天天用来写代码的 AI 工具)原封不动地接上机器人,让它在陌生的房子里按语言指令导航。


不给地图,不给记忆模块,不给路径点预测器,不做任何导航训练,连一行领域代码都不写。


结果:在视觉语言导航(VLN)最经典的 R2R-CE 基准上,这个「裸奔」的通用 Agent 跑出了 78% 成功率,追平甚至超过了最近一批用大规模数据专门训练出来的工业级导航模型。


作为参照:人类在这个基准上的成绩是 94%。


具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图2



具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图3


一图看懂这篇论文。左:三条路线的区别在「谁主导决策循环」:policy 是一张网络每步出动作,workflow 是固定流水线,agentic 是模型自己掌舵。中:最小接口探针,一个 coding-agent,一路单目相机,四个动作,别的什么都没有。右:R2R-CE 主结果。


这事为什么反常识


先交代下背景。视觉语言导航是具身智能的经典难题:给机器人一句话,比如「出卧室,沿走廊走,在盆栽处右转,停在沙发旁」,它得在没见过的房子里走到指定位置。


过去这个领域有两条正统路线。


一条是训练专用策略模型:NaVid、StreamVLN、NavFoM 这些工作,用海量导航数据把「看到什么就怎么走」直接训进模型里。


另一条是工程化的零样本流程:比如开创者 NavGPT,以及后来的 MapGPT、SmartWay,不训练,但给大模型配上一整套脚手架:建地图、存记忆、路径点预测器、树搜索,用固定流程一步步喂。


中间还有大厂爱走的「快慢双系统」,训一个慢脑做规划、快脑出动作。方向本身很有前景,但目前的实现本质上还是固定流水线。


这些路线的共同预设是:通用大模型自己走不了这段路——要么替它练,要么替它搭。


这篇论文(作者管这套探测方法叫 MIP,Minimal-Interface Probe,最小接口探针)偏要反着来:把所有脚手架全拆了,只留两个函数:



然后让推理模型自己决定每一步:自己看图、自己想、自己走,走错了自己发现、自己退回去重走。论文把这种组织方式称为 agentic embodied control:推理模型直接掌舵每一个动作,推理和控制始终对齐。


具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图4


它真的在这样干活。R2R-CE 第 10 集真实回放(mini-swe-agent × fable-5):左边是 agent 的逐步思考和 step()/observe() 调用,右边是它此刻看到的 512 × 512 单目画面。中间有个细节:撞了床角之后,它自己发现「我几乎没动」,然后主动调整角度绕了过去。


成绩单


在 R2R-CE val-unseen 随机抽取的 100 条路径上(全部零样本,不做任何训练):


具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图5


SR = 成功率;SPL = 按路径效率加权的成功率,越高越少绕路;「上 arXiv」为各系统 arXiv 首发年月。路线按「谁掌控决策回路」分:policy=训练好的网络每步直接出动作;workflow=控制流由代码固定的分级流水线(与是否端到端训练无关);agent=模型自己掌舵每一步。


注意「导航机制」那一列:别人家写满了各种模块,它这里是——none。


三个有意思的发现


研究团队在三套 coding-agent 框架(mini-swe-agent、Claude Agent SDK、Codex CLI)× 多个前沿模型上跑完了整个消融矩阵,结论很干脆:


一、决定成绩的是模型,不是框架。换模型能拉开二十多个点,换 harness 只有几个点的差异。百行代码的开源 mini-swe-agent 和官方 SDK 打得有来有回。


二、「帮忙」可能是帮倒忙。团队试了给 Agent 强制接上一个训练好的路径点预测器,结果弱模型确实涨分,强模型在原本就高 SR 的任务上反而可能掉分。脚手架的价值在随模型能力上升而贬值。


三、但把工具「递过去」而不是「绑上去」,是另一回事。当路径点预测器作为可选工具提供、由 Agent 自己决定用不用时,fable-5 混合版在默认思考档就从 68.3 ± 1.5% 跑到 76.7 ± 0.6%,而且环境步数减半、总耗时只有纯裸奔版的四分之一。作为对照,同一个预测器强制「绑上去」只有 69% 的 SR。


具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图6


三条消融轴,一张图。A:接口和 harness 都不动,只换模型,成绩从 5 分铺到 72 分;B:同一个模型换 harness,差距只有几个点;C:接口里塞进 waypoint 工具,弱模型大涨,强模型未必受益。


一行不改,换任务照跑


更有意思的是通用性测试:同一套循环、同一个 agent,不做任何针对性开发,直接换基准:




跨了任务、跨了模拟器,成绩没塌。


长程导航还是盲区


先泼盆冷水:78% 是短指令基准上的成绩。团队特意换上路线更长、指令更啰嗦的 RxR-CE 再跑(同一模型、同一框架),成功率直接掉到 26%;就算把路径点预测器递给它,也只爬到 39%,比自己在 R2R-CE 上的成绩低了 30 个点。


掉分的同时,账单也在涨:每集耗时中位数从 187 秒涨到 527 秒,上下文翻了一倍多。路一长,历史观察越堆越厚,一个可能的原因是真正有用的线索反而被稀释了。论文没有下定论,但把话挑明了:长程导航目前还是这套玩法的盲区,也是下一步要啃的骨头。


也上了真机,也有翻车现场


团队还把同一个 Agent 部署到了宇树 Go2 机器狗上,在两个真实室内场景跑了 31 条诊断任务。这批任务是手工设计的,普遍比标准 VLN/EQA 基准更刁钻:有的指令埋着要先观察世界才能判断的条件分支(「出门后看左边,如果只有一个垃圾桶就走过去停下,是多个就改去电梯」);有的要求边走边数数,还不能数重(「数数这间屋里有几把高椅子,矮凳不算」);有的要求多段折返回到之前经过的物体旁,还有专门测「身体意识」的过门任务。标准基准考「照路线走」,这批题考的是走路的同时还得动脑、记数、知道自己身子有多大。


能过的很利落:条件判断类(「如果门开着就……」)4/4 全过,汇报类 4/4 全过。


翻车的也很诚实:数数类 0/2 全挂,多阶段任务只过一半,过门时相机过去了身子没过去——Agent 不知道自己有个身体。


具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图7


真机翻车实录(Go2 ep6,「出门」任务)。镜头刚探出门框,半米长的身子还没跟上:头卡在墙沿,agent 却根据画面判断自己「正望回房间里」,随后彻底迷失方向。看见门外,不等于身在门外,缺的是本体感觉。


模拟器里的失败分析同样坦率:30 个失败案例里,有 23 个 Agent 停下来时声称自己成功了。错误本身不致命,致命的是对错误毫无察觉。


划重点



论文由阿德莱德大学 AIML 吴琦(Qi Wu)团队主导,联合 CSIRO Data61 与昆士兰大学完成。作者:Jian Zhou*、Xunyi Zhao*、Gengze Zhou、Zerui Li、Sihao Lin、Jiajun Liu、Qi Wu(*共同一作)。


具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型图8


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
功率 导航 工业 机器人 大模型
more
道交法修订草案设「自动驾驶汽车特别规定」专章;任少卿创立具身公司;小鹏机器人完成超9亿美元首轮融资丨物理AI双周报
盖茨新论:给机器人征税与划定“人类保留区”,AI治理的激进尝试
第一代机器人创业者,揭穿当下具身智能“假商业化”
当机器人开始读懂“想走路”:迈步从柔性外骨骼到脑机接口的十年跃迁
宇树科技研发费不及牧原养猪?经济学家警示人形机器人估值泡沫
上半年中国扫地机器人新品销量占比达36%
工信部认证+500强客户集体认购:乐聚正在改写工业机器人的落地公式
新松机器人上半年亏损1.89亿元
小灵通老将再出山,这次要带着机器人冲刺IPO
瑞萨亮相 2026 第四届中国具身智能机器人产业大会,展示全链路半导体解决方案
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号