点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
想象一下,你坐在一台自动驾驶配送车里。前方路口,导航说“右转”。你扫一眼路面,几乎是本能地,目光就锁定在了右转车道那个模糊的入口——不是精确的 GPS 坐标,不是距离路沿 3.27 米,就是画面中“那个位置”。这就是人类导航的奥秘:我们的大脑在不同层级上分工。海马体管路线,视觉皮层管“往那儿走”,小脑和脑干管怎么稳稳地转过去。
过去两年,VLA模型的叙事逻辑高度统一:用一个足够大的模型,直接从像素映射到底层控制指令。这个愿景足够性感,但在导航这个具体任务上,端到端路线正在遭遇一种结构性的阻力:VLM 擅长识别“那里”,却不擅长输出“距离 3.27 米”。互联网图文数据教会了它理解场景,却没给它精确的三维坐标标签。
2026年7月,一篇名为 DA-Nav 的论文给出了一个务实的回答:既然 VLM 不擅长微积分,那就让它专注“指哪打哪”。这不是一个更大的模型,而是一套更聪明的分工。

一、真正的创新:重新定义智能与控制的接口
绕开这个结构性矛盾,DA-Nav的答案是:让VLM不再输出精确的三维坐标,而是输出一种“意图”。它的做法,表面看是用29×24的二维图像网格取代三维连续坐标作为动作表示;但真正意义更大的事情是——重新定义了视觉语言模型与机器人控制系统之间的接口。
过去的端到端方法通常把模型输出直接绑定到某一种特定本体上:轮式机器人输出线速度和角速度,机械臂输出关节角。这种绑定看似直接,却让模型同时承担了三个性质完全不同的任务:理解环境、决定行为、适配特定本体的动力学。一旦更换底盘或相机位置,整个动作空间就可能失效。
DA-Nav 的做法是把这三件事拆开。模型输出的是图像平面上的空间意图,不是“左转 15 度”,而是“向画面中这个区域移动”。至于如何将这个意图转化为具体运动,由下层几何投影和控制器根据本体特性完成。这在 VLM 和机器人之间建立了一种新的协议:大模型负责描述意图,控制器负责实现意图。
论文展示了从 Unitree Go2 四足机器人迁移到 Leju Kuavo-V 人形机器人的零样本部署,本质上正是因为中间表示与本体解耦。同一个导航模型不需要重新学习两种完全不同的行走动力学。

二、离散网格:以精度换鲁棒性的哲学
确定了“指哪打哪”的接口之后,下一个问题是:具体怎么“指”?
DA-Nav的选择是把图像划分成29×24的离散网格,让模型从中选择目标点,而不是输出连续坐标。离散网格之所以比连续坐标更稳定,是因为它主动丢弃了一部分信息。
连续坐标要求模型区分图像横坐标 0.503 与 0.517。对 VLM 而言,这种细粒度差异没有稳定的语义依据,可能因为光照、相机抖动或背景纹理变化而剧烈波动。离散网格则相当于加入了一个量化边界:只要目标仍然落在同一个网格单元内,视觉输入的小幅变化就不会改变输出。连续空间中的高频噪声被压缩了,模型只需要保持方向层面的稳定。
这是一种典型的“以精度换鲁棒性”的策略。它揭示了一条重要原则:模型输出的分辨率应该与其感知精度相匹配。让模型输出超出认知能力的精确数字,不会增加信息量,只会制造虚假的精确性。
当然,这种策略也有明确代价。网格越粗,模型越稳定,但轨迹分辨率越低。DA-Nav 选择 29×24 并只使用下半部分的 319 个候选位置,是在语义稳定性和控制精度之间寻找的工程折中。不同相机视场角、不同机器人速度、不同道路宽度可能需要不同的网格密度,这恰恰是未来可以动态适配的方向。
三、数据闭环:把“出错后怎么办”刻进模型 DNA
前两部分解决了“正常怎么走”,但一个闭环系统必然会出错。一旦机器人偏离了那条被精心规划的轨迹,下一帧看到的画面就不再是训练数据里的“理想状态”。这是模仿学习领域著名的covariate shift问题,也是决定系统能否在真实世界长期运行的关键。
如果说前面的表示革命决定了DA-Nav的性能上限,那么ReDA恢复数据集就决定了它的性能下限。
传统行为克隆只在专家轨迹上训练。模型学到的是“完美状态到完美动作”的映射,但闭环执行中一旦出现微小误差,下一帧就进入了训练从未覆盖的状态分布,模型不知道该怎么办,于是输出更错误的动作——这就是模仿学习中经典的 covariate shift 问题。
DA-Nav 的回应是设计了一个三态有限状态机:STABLE(稳定跟随)、DRIFTING(人为注入转向扰动制造偏航)、RECOVERING(当横向误差超过 0.35 米时由专家控制器拉回正轨)。而其中最精妙的工程细节是:DRIFTING 阶段的中间帧被丢弃了。
因为这些数据是“有毒”的。如果保留,模型就会学到“偏航时继续往偏的方向走”——那正是偏航发生时机器人正在做的错误动作。只保留 RECOVERING 阶段,意味着模型只学习一件事:“检测到偏航,就执行纠偏。”这是对数据安全的极致尊重:我们只教“正常时怎么走”和“偏了以后怎么回来”,绝不教“怎么偏”。
ReDA 最终生成了约 28.6 万个序列样本,其中恢复数据占比接近 45%。消融实验把这套设计的威力赤裸裸地展现出来:删除恢复数据后,成功率从 59.00% 暴跌到 29.71%,偏航后成功恢复的比例从 98.15% 断崖式下滑到 15.46%。
这个对比揭示了一个关键事实:DA-Nav 不是靠“更少犯错”赢的——它的偏航频率 1.85 次/100 米甚至比一些基线还高——它是靠“犯错后能回来”赢的。这引出了一个值得深思的命题:在长程闭环任务中,恢复能力可能是决定系统成败的第二条 Scaling Law。 当任务距离不断拉长,偏航次数的累积会让单次纠偏成功率不足 100% 的系统快速逼近失败。反之,只要局部恢复能力接近 100%,即使偏航相对频繁,系统仍可能完成很长的闭环任务。恢复数据不应被看作普通训练数据的补充,而应被视为长程任务得以扩展的基础设施。
不过也需要明确 ReDA 的覆盖边界。它训练的主要是由受控转向扰动造成的几何偏航,机器人虽然偏离了理想轨迹,但通常仍处在原路线附近,画面中仍然能看见道路和正确方向。真实世界中的失败分布远比这复杂:路口被施工围挡封闭、GPS 漂移导致上层指令与真实位置冲突、强逆光或雨雾使可通行区域不可见、机器人转身后正确路线已位于视野之外。这些状态需要的是重新定位、重新规划、等待协助,甚至主动终止任务。ReDA 证明的是针对一种定义明确的偏航类型可以显著提升恢复能力,还没有证明模型具备开放世界中的普遍自救能力。

四、逻辑护栏:结构化 CoT 作为机器可执行协议
数据闭环让模型学会了纠偏,但还有一个隐蔽的问题:VLM本质上是概率模型,它可能在同一帧里一边说“没偏航”,一边输出一个向右修正的轨迹。这就像一个人在说“我没事”的同时往左倒——逻辑上是矛盾的,但在概率生成里随时可能发生。
DA-Nav的第三道保险,是结构化Chain-of-Thought输出设计:强制模型先判断是否偏航,再选择动作类别,最后给出轨迹点序列。
很多人把 CoT 理解为让模型“自言自语”一段推理过程。但 DA-Nav 的设计更接近一份机器可读的执行协议,而不是面向人类的解释文本。每一个输出字段都有明确的工程含义:偏航状态决定是否进入恢复模式,动作类别定义当前行为语义,轨迹点提供具体控制目标。
它的核心价值不在于“让模型把思考说出来”,而在于将原本隐藏在神经网络内部的部分状态显式化,使其他模块可以读取、校验和干预。当模型输出“偏航=No”但动作类别是 CORRECT LEFT,系统可以直接判定存在逻辑冲突并拒绝执行。这使结构化输出成为模型与系统之间的一份控制契约:模型必须同时给出动作和动作所依赖的状态判断,下游模块根据契约检查一致性,决定接受、降级还是拒绝。
消融实验验证了这一设计:去掉结构化 CoT 后,成功率从 59.00% 降到 38.91%,偏航频率从 1.85 飙到 4.30,CSR 从 98.15% 腰斩到 50.11%。没有了前置状态判断的约束,模型的动作选择和轨迹输出丧失了因果一致性,决策变成了在逻辑护栏内随机游走。
这个设计的工程价值还延伸到调试层面。当机器人出了问题,工程师可以精确追溯到故障点:是偏航检测错了,还是动作选了但轨迹指错了方向,还是投影到三维空间时出了问题。对一个部署大模型到物理世界的团队来说,这种模块化诊断能力是无价的。

分层智能
把四个技术支柱串在一起看,DA-Nav给出的是一套完整的“分层智能”方案:接口层把意图与执行分离,表示层用离散网格换取鲁棒性,数据层把恢复能力提升为一级训练目标,逻辑层用结构化协议锁死决策一致性。
这套方案的核心哲学可以概括为一句话:让模型控制需要语义理解的部分,把精确几何与安全约束留给确定的系统。 这不是保守的妥协,而是对不同智能能力边界的清醒认知。
更深一层看,DA-Nav代表的是一种“学习型模块化”的新范式。它不同于传统机器人上百个手工规则拼成的脆弱大厦,那些规则无法应对开放环境的复杂性。它也不同于端到端模型从像素直连电机、不可解释的“黑盒赌局”,一旦出错,你甚至不知道从哪查起。它的要义是:系统的功能边界由人依据物理逻辑清晰定义,每个模块内部的能力则由数据驱动、通过学习获得。边界可控,能力灵活。
未来的机器人,很可能就是这个样子的:它不是一团混沌的神经网络,而是一套协议驱动的多层智能体。有一个大脑理解世界,有一份契约规范行动,有一套机制确保它总能从错误中回家。
具身智能的终局,不是模型吞噬一切,而是智能找到了它该待的位置。
-END-
Ask Me Anything|提问箱
❝对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀