
新智元报道
新智元报道

扩散策略正在成为机器人控制中的热门路线。它可以把动作生成看成一个逐步去噪的过程,从噪声中一步步恢复出可执行的动作序列。
问题在于,真实机器人世界从来不是一个固定剧场:地面摩擦会变,身体参数会变,质量和阻尼会变,甚至同一个任务也会因为动力学不同而需要完全不同的动作模态。
UC Berkeley、北京大学、CMU、清华大学联合提出的DADP(Domain-Adaptive Diffusion Policy)不是为每个动力学条件单独训练一个策略,而是训练一个能够感知当前域、并在生成动作时主动利用这个域信息的统一策略。

论文链接:https://arxiv.org/abs/2602.04037
实验结果显示,DADP在MuJoCo和Adroit的零样本跨域控制任务中取得强表现,OOD场景优势尤其明显。

图1:论文中给出的跨域MuJoCo总览结果,DADP在Seen、Unseen、OOD三类设置上整体表现最强。

在强化学习和模仿学习里,策略往往与某个训练环境深度绑定。它看到的是特定重力、特定摩擦、特定身体比例下的数据;一旦部署环境发生变化,原本学到的动作模式就可能失效。
过去的主流思路大致分成两步:先从交互历史里抽取一个域表征,再把这个表征喂给策略网络,让策略知道自己正处在什么样的动力学条件下。问题是,这两步都可能出错。
第一,最近历史里不仅有静态域信息,比如摩擦系数、腿长、关节阻尼,也有瞬时状态信息,比如当前速度、步态相位、高阶运动趋势。如果表征学习任务只要求预测下一状态,模型很容易把这些瞬时线索也编码进去。这样得到的表征会在同一个域内漂移,反而不够稳定。
第二,即便学到了不错的域表征,简单把它拼接到策略输入上,也不一定能让扩散模型真正利用它。标准扩散策略从同一个纯高斯噪声分布开始去噪,不同域的动作模态都要从同一团噪声里被恢复出来,域信息只是在旁边提醒一句,生成过程本身并没有被重写。


DADP的第一个核心动作叫Lagged Context Dynamical Prediction。直观来说,它不再只使用紧邻当前时刻的最近历史来预测下一状态,而是引入一个时间偏移量Δt,让上下文与当前预测点隔开。
当Δt很小时,最近历史中的速度和步态相位可以直接帮助预测下一状态,模型会顺手把这些瞬时信息也塞进表征里。当Δt逐渐增大,时间局部线索的帮助变弱,模型更依赖那些在整个域内保持不变的因素。论文最终采用一个更极端、也更干净的默认设置:Δt→∞,也就是从同一域的另一条episode中采样上下文。
这一步的效果很像让模型回答一个问题:不要告诉我机器人这一秒正迈哪条腿,只告诉我它生活在怎样的物理世界里。

图2:随着Δt从1增大到32,再到∞,Walker2d的域表征从混杂逐渐变成清晰簇。

图3:表征质量随Δt增大而提升。Walker2d线性探针准确率从27.9%提升到99.3%。

DADP的第二个核心动作,是domain-aware diffusion injection。标准扩散策略从纯高斯噪声出发;DADP则让去噪过程从一个带有域偏置的混合高斯分布出发。简单说,学到的域表征z不再只是策略输入的一部分,而是变成扩散先验的中心之一。
这带来一个直接好处:不同动力学域不必从完全相同的噪声云里各自摸索动作模态,而是从更靠近自己动作流形的位置开始生成。与此同时,DADP还把表征偏移纳入扩散目标,让模型在每一步去噪中同时学习噪声和域偏移。
如果说普通条件策略只是告诉模型「你现在在哪个域」,DADP更像是提前把模型放到了「这个域应该出发的位置」。

图4:标准扩散与DADP扩散的去噪过程对比。DADP的生成轨迹更早按域分离。

论文将评测分成三类。
Seen是训练中出现过的域,用来测试策略能否同时掌握多个训练动力学;Unseen是训练范围内部的新参数组合,用来测试插值泛化;OOD则采样到训练因子空间之外,考验真正的外推能力。
在MuJoCo中,研究团队使用Ant、HalfCheetah、Walker2d、Hopper四个环境,并引入摩擦、阻尼、腿长、躯干长度、质量等动力学变化。
为了验证复杂接触和操控场景,论文还加入Adroit的Door与Relocate任务。评测采用zero-shot设置:测试时没有未见域的专家数据,策略只能依赖在线交互历史形成上下文。

图5:主结果表。DADP在大多数MuJoCo设置中领先或接近最优,OOD优势尤其明显。
结果最醒目的地方在Walker2d:DADP在Seen、Unseen、OOD三档分别达到3999、2834、2197,而Meta-DT对应为1304、889、954。也就是说,当身体参数和接触条件变化更强时,DADP的优势被显著放大。
在Ant和Hopper上,DADP同样稳定领先。在HalfCheetah上,Meta-DT在Unseen插值设置略高,但DADP在Seen与OOD设置更强。Adroit操控任务中,DADP在Door的Seen设置不是最高,但在Unseen与Relocate上保持竞争力,说明方法并不只适用于行走机器人。

论文的消融实验把问题拆开看。第一组看Δt是否真的提升表征质量。结论很直接:随着上下文与当前时刻的距离拉大,线性探针准确率上升,重建损失下降。Walker2d从Δt=1到Δt=∞,准确率从27.9%到99.3%,重建损失从476.1降到3.2。
第二组看表征到底该怎么用。只把表征拼到输入里,效果并不稳定;只把先验变成混合高斯,也有帮助但不够。DADP的完整版本同时做两件事:用表征偏置扩散先验,并让模型预测包含表征偏移的复合目标。

图6:表征使用方式消融。完整DADP在Walker2d和HalfCheetah上取得最高或接近最高表现。
在Walker2d上,端到端扩散基线的Seen/Unseen为3722/2852,条件策略如果使用Δt=1的表征,反而降到2093/1617;完整DADP达到3991/3015。HalfCheetah上,完整DADP的mastery达到96%,明显高于端到端扩散的80%

DADP的意义不只是把扩散模型又用到一个机器人控制任务上。更关键的是,它把「域表征」从一个附加输入,提升为生成分布的一部分。
对于需要跨摩擦、跨质量、跨形态泛化的机器人策略,这种做法更接近控制问题本身:不同动力学下,最优动作分布本来就应该不同。
论文还给出两个工程上很有意思的补充结果:
第一,在非平稳摩擦变化下,同一个Walker2dcheckpoint仍能保持较高表现,说明在线上下文能在一定程度上跟踪变化;
第二,在把DDIM采样压缩到一步时,标准扩散策略性能几乎崩塌,而DADP保留了更多性能,因为它从一开始就站在更靠近目标动作流形的位置。
当然,DADP也不是终点。论文明确指出,当前方法主要围绕静态或分段稳定的动力学展开。未来更难的问题是:当域本身随时间持续变化时,如何既保留稳定域因素,又不丢掉真正有用的时间变化信号。
结语
从「识别当前环境」到「改写动作生成过程」,DADP给出了一个很清晰的方向:跨域控制不应只停留在给策略额外喂一个标签,而应让域信息进入策略生成动作的底层机制。
对于机器人来说,真正的泛化不是在一个固定模拟器里跑高分,而是在换了地面、换了身体、换了动力学以后,依然知道自己该如何行动。
DADP的野心就在这里:让扩散策略不只是会生成动作,还能先读懂动作背后的物理世界。
参考资料:
Wang,P. et al. DADP: Domain Adaptive Diffusion Policy. ICML 2026. https://arxiv.org/abs/2602.04037
编辑:LRST

