清华AIR投稿
量子位 | 公众号QbitAI
机器人控制出现抖动,自动驾驶过度反应,无人机操纵不稳定……这类问题的根源往往不在单步动作,而在动作之间的突变。
然而,现有策略学习默认只监督单点动作,相邻时刻的动作变化始终缺少显式约束。
针对这一问题,清华大学智能产业研究院(AIR)的一项NeurIPS 2026录用工作,把训练目标从单点动作拟合范式进行了拓展:策略既要拟合数据集中的动作标签,也要拟合动作对时间的一阶变化。
该改动不要求重构策略网络,可覆盖确定性、随机和流匹配三种策略类型,并进一步进入离线强化学习的价值学习与策略优化。
当策略只关注动作标签
主流模仿学习和强化学习通常只监督零阶动作——状态s下应输出什么动作a。连续控制却不同:机器人关节力矩、车辆转向角、无人机推力都沿时间连续演化,相邻时刻的动作即使各自合理,其间的跳变仍会造成轨迹偏移、机械磨损和额外能耗。
论文用迷宫导航给出直观例子:普通行为克隆只拟合动作标签,一阶动作方向频繁摆动,最终走出次优路径;加入高阶动作监督后,零阶与一阶动作都更平滑,智能体沿更稳定的路径到达目标。这里的一阶动作即动作变化率,在离散数据中由相邻动作之差近似。

△迷宫任务中的行为克隆与高阶动作监督对比。绿色箭头为零阶动作,红色箭头为一阶动作
关键一步:策略约束项考虑动作变化
一种简单直接的思路是接让策略网络同时输出动作a和一阶动作ȧ,然而并不合理:两者处在不同动作空间,新增输出项不但会扩大优化问题,还可能引入多任务梯度冲突。论文选择另一条路—在不更改原有策略网络框架的基础上,额外增加一阶动作约束项。
具体而言,对离线轨迹中的连续样本(s,a,s′,a′),作者采用单位时间间隔,把状态变化和动作变化分别写成ṡ=s'-s与ȧ=a'-a。基于策略π(s)沿物理时间求导后,链式法则得到下面的核心公式:

△策略沿状态轨迹方向的导数给出一阶动作
训练时只需让这个方向导数接近数据中的动作差,对最基础的确定性行为克隆,新增项就是策略方向导数与真实动作差的平方误差。
一种思想覆盖三类策略
确定性策略
确定性策略最直接:标准行为克隆继续拟合π(s)与a,新的一阶损失拟合策略方向导数与a′−a。TD3+BC一类确定性离线强化学习算法可沿用原策略网络,只在损失中增加这一项。

△确定性策略中加入一阶动作监督项
高斯随机策略
随机策略方面:采用Ornstein–Uhlenbeck(OU)过程刻画高斯策略采样扰动的时序相关性,据此推导一阶动作的条件分布。训练时联合优化原始动作与一阶动作的似然,使策略兼顾动作分布拟合与动作的时序演化:

△高斯策略的一阶动作条件分布。⊙和⊘分别表示逐元素乘法与除法
流匹配策略
流匹配策略里有两种时间:把噪声变成动作的生成时间k,以及真实控制轨迹的物理时间。标准流匹配只学习前者,不约束状态变化后生成动作应如何变化。论文对速度场关于状态的方向导数施加监督,使其沿物理时间的变化与数据中的一阶动作一致,同一思路由此覆盖基于流匹配的策略范式。

△流匹配策略的一阶速度场监督项
从策略监督走进离线强化学习
在模仿学习里,一阶动作是额外的行为监督;离线强化学习还要训练价值函数,为了将一阶动作监督学到的额外一阶信息注入价值函数更新过程,论文引入连续时间Hamilton–Jacobi–Bellman(HJB)框架:Q函数定义为沿连续轨迹积累的折扣回报,γ控制衰减速率。

△连续时间HJB框架中的Q函数定义
HJB方程把长期回报写成局部的价值平衡:除即时奖励r(s,a)外,还要计算Q沿状态轨迹和动作轨迹的变化。下式中的两个内积分别是状态方向导数∇ₛQ·ṡ与动作方向导数∇ₐQ·ȧ。

△HJB局部动态规划关系
普通离线强化学习通常用一个标量Bellman目标来回归Q(s,a)。即使标量目标能够拟合,价值曲面沿真实轨迹的梯度方向仍可能不对。高阶策略则提供了ȧ=π̇_θ(s),使HJB中的动作方向项可以直接估计。

△带一阶方向一致性的价值学习目标
上式保留原算法的Bellman平方残差,再加入两个类余弦对齐项:第一项使∇ₛQ与数据轨迹的状态变化ṡ=s'−s一致,第二项使∇ₐQ与策略的动作变化π̇_θ(s)一致。目标是最小化,蓝色项前的负号鼓励两个归一化内积变大;归一化防止梯度幅值主导目标,约束的是方向而非尺度。

△加入一阶动作监督的策略优化目标。蓝色部分为新增项
上式是针对策略优化损失项进行的改进。策略函数在优化的过程中除了考虑最大化奖励和与数据集中的示例动作保持一定的一致性以外,额外地引入一阶动作监督约束项
来学习动作数据中蕴含的一阶信息。基于该策略优化范式,作者在无需更换策略网络架构的基础上,对TD3+BC、ReBRAC、IQL和IFQL方法的策略优化损失项进行了轻量级改造。
50个OGBench任务和10k数据设置
作者在OGBench与D4RL的两个基准平台上展开了大量的实验验证所提方法的有效性。其中,OGBench部分含10个任务类别共50个state-based任务,涉及长时序导航、物体交互和机器人操作,状态维度在28–83之间、动作维度在5–21之间。D4RL部分使用Hopper、HalfCheetah和Walker2d,构造每个任务约10k transitions的小数据集,保留计算状态差与动作差所需的时间连续性。主结果均在5个随机种子上汇总。

△OGBench 10个任务类别上的平均归一化得分

△D4RL MuJoCo 10k小数据任务上的平均归一化得分
平均分之外,部分困难任务的变化更醒目。OGBench上,ReBRAC在antmaze-giant-navigate的类别平均分从26升到61,在humanoidmaze-medium-navigate从22升到55;IFQL在cube-double-play从14升到42,在scene-play从30升到56。更细的单任务结果中,scene-play-singletask-task2的IFQL基线为0,加入一阶监督后达到88。
小数据D4RL的增益更集中:walker2d-expert上TD3+BC从2.7提升到82.3,hopper-expert上IQL从55.7提升到99.5;没有奖励信号的纯行为克隆下,确定性Walker2d-expert也从26.7提升到91.1。这支持了论文最重要的经验判断:连续轨迹里的局部变化信息,在样本稀缺时尤其有价值。
动作输出平滑也意味着更平稳的学习
论文进一步比较了学习曲线和rollout中动作变化范数的分布:无论纯行为克隆还是TD3+BC,加入一阶监督后曲线整体更高,动作变化分布更集中于较小范围,即相邻时刻更少大幅跳变。图中阴影和得分基于5个随机种子,动作变化分布汇总自10条rollout轨迹。

△10k小数据下确定性行为克隆的学习曲线与动作变化分布。蓝色为加入一阶监督

△10k小数据下TD3+BC的学习曲线与动作变化分布
增益来自策略端和价值端
离线强化学习新增两类信号:策略端的一阶动作监督,以及价值端沿局部状态动作流的一阶一致性约束。消融中固定一项、扫描另一项,IFQL在cube-single-play和antmaze-large-navigate上均获益;TD3+BC、IQL的附录实验方向一致,收益不依赖单一算法或策略参数化。

△IFQL的价值端与策略端权重消融。上半部分为价值正则权重,下半部分为一阶动作监督权重
研究结论
本研究将连续轨迹中的一阶动作变化转化为高阶监督信号,无需改动原有策略架构,仅增加一项损失即可适配确定性、高斯随机和流匹配等多种策略。实验显示,该方法在OGBench上提升了整体性能,在仅使用约1%数据的D4RL场景中仍显著改善小样本表现,同时使动作变化更平滑,为复杂工业控制和具身智能提供了轻量、即插即用的策略优化思路。
关于作者
成鹏是北京交通大学与清华大学智能产业研究院(AIR)联合培养博士,研究方向包括小样本与高泛化离线强化学习、表示学习和高阶策略约束。担任清华AIR孵化的工业物理AI公司“臻效智能”的联合创始人之一,关注复杂工业场景与能源系统的自主优化控制。
论文标题:Higher-Order Action Supervision Makes A Strong Policy Class(NeurIPS 2026)
作者:成鹏、侯云献、周郅、詹仙园等
作者单位:清华大学智能产业研究院(AIR)、臻效智能
arXiv:https://arxiv.org/abs/2610.11175
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟