换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26

新智元 2026-07-27 22:11

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图1

  新智元报道  

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图2


扩散策略正在成为机器人控制中的热门路线。它可以把动作生成看成一个逐步去噪的过程,从噪声中一步步恢复出可执行的动作序列。

问题在于,真实机器人世界从来不是一个固定剧场:地面摩擦会变,身体参数会变,质量和阻尼会变,甚至同一个任务也会因为动力学不同而需要完全不同的动作模态。

UC Berkeley、北京大学、CMU、清华大学联合提出的DADP(Domain-Adaptive Diffusion Policy)不是为每个动力学条件单独训练一个策略,而是训练一个能够感知当前域、并在生成动作时主动利用这个域信息的统一策略。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图3

论文链接:https://arxiv.org/abs/2602.04037

实验结果显示,DADP在MuJoCo和Adroit的零样本跨域控制任务中取得强表现,OOD场景优势尤其明显。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图4

图1:论文中给出的跨域MuJoCo总览结果,DADP在Seen、Unseen、OOD三类设置上整体表现最强。


换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图5
机器人策略的「换环境失灵」难题


在强化学习和模仿学习里,策略往往与某个训练环境深度绑定。它看到的是特定重力、特定摩擦、特定身体比例下的数据;一旦部署环境发生变化,原本学到的动作模式就可能失效。

过去的主流思路大致分成两步:先从交互历史里抽取一个域表征,再把这个表征喂给策略网络,让策略知道自己正处在什么样的动力学条件下。问题是,这两步都可能出错。

第一,最近历史里不仅有静态域信息,比如摩擦系数、腿长、关节阻尼,也有瞬时状态信息,比如当前速度、步态相位、高阶运动趋势。如果表征学习任务只要求预测下一状态,模型很容易把这些瞬时线索也编码进去。这样得到的表征会在同一个域内漂移,反而不够稳定。

第二,即便学到了不错的域表征,简单把它拼接到策略输入上,也不一定能让扩散模型真正利用它。标准扩散策略从同一个纯高斯噪声分布开始去噪,不同域的动作模态都要从同一团噪声里被恢复出来,域信息只是在旁边提醒一句,生成过程本身并没有被重写。


换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图6
先学静态域
再改写生成过程


换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图7

第一步:把上下文「拉远」,过滤瞬时线索


DADP的第一个核心动作叫Lagged Context Dynamical Prediction。直观来说,它不再只使用紧邻当前时刻的最近历史来预测下一状态,而是引入一个时间偏移量Δt,让上下文与当前预测点隔开。

当Δt很小时,最近历史中的速度和步态相位可以直接帮助预测下一状态,模型会顺手把这些瞬时信息也塞进表征里。当Δt逐渐增大,时间局部线索的帮助变弱,模型更依赖那些在整个域内保持不变的因素。论文最终采用一个更极端、也更干净的默认设置:Δt→∞,也就是从同一域的另一条episode中采样上下文。

这一步的效果很像让模型回答一个问题:不要告诉我机器人这一秒正迈哪条腿,只告诉我它生活在怎样的物理世界里。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图8

图2:随着Δt从1增大到32,再到∞,Walker2d的域表征从混杂逐渐变成清晰簇。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图9

图3:表征质量随Δt增大而提升。Walker2d线性探针准确率从27.9%提升到99.3%。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图10

第二步:把域表征写进扩散策略,而不是只放在输入旁边


DADP的第二个核心动作,是domain-aware diffusion injection。标准扩散策略从纯高斯噪声出发;DADP则让去噪过程从一个带有域偏置的混合高斯分布出发。简单说,学到的域表征z不再只是策略输入的一部分,而是变成扩散先验的中心之一。

这带来一个直接好处:不同动力学域不必从完全相同的噪声云里各自摸索动作模态,而是从更靠近自己动作流形的位置开始生成。与此同时,DADP还把表征偏移纳入扩散目标,让模型在每一步去噪中同时学习噪声和域偏移。

如果说普通条件策略只是告诉模型「你现在在哪个域」,DADP更像是提前把模型放到了「这个域应该出发的位置」。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图11

图4:标准扩散与DADP扩散的去噪过程对比。DADP的生成轨迹更早按域分离。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图12
实验结果


论文将评测分成三类。

Seen是训练中出现过的域,用来测试策略能否同时掌握多个训练动力学;Unseen是训练范围内部的新参数组合,用来测试插值泛化;OOD则采样到训练因子空间之外,考验真正的外推能力。

在MuJoCo中,研究团队使用Ant、HalfCheetah、Walker2d、Hopper四个环境,并引入摩擦、阻尼、腿长、躯干长度、质量等动力学变化。

为了验证复杂接触和操控场景,论文还加入Adroit的Door与Relocate任务。评测采用zero-shot设置:测试时没有未见域的专家数据,策略只能依赖在线交互历史形成上下文。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图13

图5:主结果表。DADP在大多数MuJoCo设置中领先或接近最优,OOD优势尤其明显。

结果最醒目的地方在Walker2d:DADP在Seen、Unseen、OOD三档分别达到3999、2834、2197,而Meta-DT对应为1304、889、954。也就是说,当身体参数和接触条件变化更强时,DADP的优势被显著放大。

在Ant和Hopper上,DADP同样稳定领先。在HalfCheetah上,Meta-DT在Unseen插值设置略高,但DADP在Seen与OOD设置更强。Adroit操控任务中,DADP在Door的Seen设置不是最高,但在Unseen与Relocate上保持竞争力,说明方法并不只适用于行走机器人。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图14

消融实验:表征更好,还是扩散用法更好?


论文的消融实验把问题拆开看。第一组看Δt是否真的提升表征质量。结论很直接:随着上下文与当前时刻的距离拉大,线性探针准确率上升,重建损失下降。Walker2d从Δt=1到Δt=∞,准确率从27.9%到99.3%,重建损失从476.1降到3.2。

第二组看表征到底该怎么用。只把表征拼到输入里,效果并不稳定;只把先验变成混合高斯,也有帮助但不够。DADP的完整版本同时做两件事:用表征偏置扩散先验,并让模型预测包含表征偏移的复合目标。

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图15

图6:表征使用方式消融。完整DADP在Walker2d和HalfCheetah上取得最高或接近最高表现。

在Walker2d上,端到端扩散基线的Seen/Unseen为3722/2852,条件策略如果使用Δt=1的表征,反而降到2093/1617;完整DADP达到3991/3015。HalfCheetah上,完整DADP的mastery达到96%,明显高于端到端扩散的80%


换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图16
为什么这条路线值得注意


DADP的意义不只是把扩散模型又用到一个机器人控制任务上。更关键的是,它把「域表征」从一个附加输入,提升为生成分布的一部分。

对于需要跨摩擦、跨质量、跨形态泛化的机器人策略,这种做法更接近控制问题本身:不同动力学下,最优动作分布本来就应该不同。

论文还给出两个工程上很有意思的补充结果:

第一,在非平稳摩擦变化下,同一个Walker2dcheckpoint仍能保持较高表现,说明在线上下文能在一定程度上跟踪变化;

第二,在把DDIM采样压缩到一步时,标准扩散策略性能几乎崩塌,而DADP保留了更多性能,因为它从一开始就站在更靠近目标动作流形的位置。

当然,DADP也不是终点。论文明确指出,当前方法主要围绕静态或分段稳定的动力学展开。未来更难的问题是:当域本身随时间持续变化时,如何既保留稳定域因素,又不丢掉真正有用的时间变化信号。

结语

从「识别当前环境」到「改写动作生成过程」,DADP给出了一个很清晰的方向:跨域控制不应只停留在给策略额外喂一个标签,而应让域信息进入策略生成动作的底层机制。

对于机器人来说,真正的泛化不是在一个固定模拟器里跑高分,而是在换了地面、换了身体、换了动力学以后,依然知道自己该如何行动。

DADP的野心就在这里:让扩散策略不只是会生成动作,还能先读懂动作背后的物理世界。

参考资料:

Wang,P. et al. DADP: Domain Adaptive Diffusion Policy. ICML 2026. https://arxiv.org/abs/2602.04037


编辑:LRST


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图17

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26图18

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC 动力 机器人
more
国际影响力学术盛会ICAP首落中国  PAQ开启量子理论与应用技术对话新篇章
倒计时30天丨DIC 2026同期会议日程公布,组团观展礼遇再升级
AMD密集“上新”:Helios 量产、Venice 投产、机器人芯片首秀
卡帕西辟谣:我没从Anthropic离职
【K230/K230D新技能点亮】CanMV K230 MicroPython版小智语音助手正式上线,速来体验
黄仁勋领衔25家巨头联名反监管,Anthropic工程师犀利回击引争议
Anthropic发布Opus 5:性能反超Fable 5,安全限制大幅松绑
SiC 扩展中小功率段!辉芒微推出PSR合封SiC芯片FT836CXX
车载摄像头PMIC进入集中上新期
纳芯微推出车载PMIC,助力车载摄像头模组变革
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号