点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
作者供稿直发 | 编辑:3D视觉工坊
文末进3D视觉交流群
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
世界模型(World Model, WM)借助对未来视频帧的预测,学习交通场景在时间维度上的演化规律,从而为端到端自动驾驶提供了一种有别于单纯轨迹模仿的动态先验。近期,世界-动作联合模型(World-Action Model, WAM)进一步将视频生成与动作预测置于同一框架下进行联合建模。然而,现有自动驾驶WAM大多遵循“先想象后行动”(imagine-then-act)的范式,其轨迹预测需要依赖未来场景或其特征表示,因此在测试阶段必须持续运行未来场景生成模块。SimWAM的核心思路在于:将未来视频预测用作动态监督信号,把世界模型所习得的交通动态先验迁移至动作专家(Action Expert),使其能够独立完成轨迹规划,无需依赖在线视频生成。
在此思路基础上,SimWAM进一步借助强化学习来优化Action Expert的轨迹策略。具体实现上,模型将确定性的流常微分方程(flow ODE)转换为具备探索能力的随机微分方程(SDE),从而产生具有差异性的候选轨迹,并配合GRPO算法,依据组合驾驶奖励函数直接对轨迹策略进行优化——在强化学习阶段不再需要未来视频预测的参与。这种设计使两类学习信号形成了清晰的分工:视频预测负责提供对交通动态的建模能力,而强化学习则面向实际驾驶质量来调整策略行为。最终,SimWAM在NAVSIM的navtest评测集上取得了91.5 PDMS,同时推理阶段无需显式生成未来帧,成功实现了从训练时动态建模到测试时直接规划的自然过渡。


论文标题:
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
论文地址:https://arxiv.org/abs/2608.07468
代码地址:https://github.com/H-EmbodVis/SimWAM
模型权重:https://huggingface.co/H-EmbodVis/SimWAM
单位: 华中科技大学,东风汽车研发总院
摘要
本文提出了一个简洁而高效的端到端自动驾驶WAM——SimWAM。该方法以未来视频预测作为动态监督,将视频生成模型所习得的交通时序先验迁移至Action Expert,并进一步结合强化学习优化轨迹策略,从而实现无需显式未来帧预测的直接规划。
动态先验迁移: SimWAM通过联合流匹配(joint flow matching)协同训练视频专家(Video Expert)与轻量级动作专家(Action Expert),以未来视频预测为监督信号,将视频生成模型捕获的时序先验知识迁移至轨迹规划任务中。
强化学习优化驾驶策略: 在视频-动作协同训练之后,SimWAM将确定性的流ODE转换为可探索的SDE,并结合GRPO直接优化组合驾驶奖励,使Action Expert在模仿专家轨迹之外,进一步改善整体驾驶表现。推理时,Action Expert仅依赖当前观测即可直接生成轨迹,无需预测未来帧。
灵活扩展与高效推理: Video Expert与Action Expert可独立调整:更强大或蕴含更丰富驾驶先验的视频生成模型能够增强训练阶段的动态监督,而Action Expert则可根据部署算力单独缩放规模。最终,SimWAM在NAVSIM上取得91.5 PDMS,同时推理开销低,并展现出良好的可扩展性和零样本(zero-shot)泛化能力。
动机
现有WAM通过联合建模未来视频和驾驶动作,将视频生成模型中包含的时序动态先验引入轨迹规划。相比单纯依赖专家轨迹监督的方法,这一范式能够显式建模交通场景的未来演变,但同时也引入了新的依赖关系:轨迹预测往往需要以未来场景或其特征为条件,因此未来视频生成必须在测试时持续参与规划过程。这使得高开销的视频生成被纳入实时推理链路,动作预测与未来场景预测保持紧密耦合。尽管现有方法充分发挥了视频模型的动态建模能力,却在测试阶段背上了显式未来视频生成的高昂成本。
另一方面,现有WAM对Action Expert的训练仍然主要依赖专家轨迹的模仿学习。未来视频预测虽然能提供更丰富的交通动态信息,但并未改变轨迹学习以模仿专家行为为主的核心目标。因此,如何在保留视频动态先验的同时摆脱测试时未来场景预测的依赖,并进一步突破单纯轨迹模仿对驾驶策略的限制,是SimWAM着力解决的核心问题。
方法

2.1 视频-动作联合训练:将视频动态先验转化为规划能力
SimWAM借助联合流匹配,同步训练Video Expert与轻量级Action Expert,同时学习未来视频预测与轨迹生成。未来视频预测提供动态监督,使视频生成模型习得的时序先验能够进一步服务于Action Expert的轨迹预测。
2.2 强化学习:从动态建模迈向策略优化
在视频-动作联合训练之后,Action Expert仍主要依赖专家轨迹进行模仿学习,难以直接优化整体驾驶质量。SimWAM将确定性的流ODE转换为可探索的SDE,并结合GRPO基于组合驾驶奖励直接优化轨迹策略,使模型得以在多种合理的驾驶行为间进行探索与策略更新,不再局限于对专家轨迹的简单复制。
2.3 直接轨迹推理与模型可扩展性
SimWAM通过简洁的信息隔离,限制Action Expert对未来帧表示的依赖,使其在推理时无需显式预测未来帧即可直接输出轨迹。同时,Video Expert与Action Expert保持相互独立的模型结构,更强的Video Expert或带有更多驾驶先验的视频生成模型可提供更丰富的动作先验,而Action Expert则可根据部署需求单独调整参数规模。
实验结果
3.1 NAVSIM主结果:91.5 PDMS与低推理延迟
在NAVSIM navtest上,SimWAM取得91.5 PDMS,在现有端到端规划方法中达到最优水平。具体而言,相比基于VLM的规划器SGDrive提升0.4 PDMS,相比显式引入未来图像预测的ExploreVLA提升1.1 PDMS;在相同的单摄像头设置下,SimWAM分别超过“图像-动作”范式的DriveLaW和DriveWAM达2.4和1.4 PDMS。在与世界模型相关的规划器中,SimWAM同时取得了最高的DAC和EP分数,并在NC和TTC指标上保持有竞争力的表现。值得注意的是,SimWAM在推理阶段无需显式预测未来帧,却获得了更优的规划性能。结合图1中明显更低的推理时延,这表明训练时的未来视频建模能够有效增强Action Expert对交通动态的表征与规划能力,而无需将未来场景生成引入推理过程,从而在规划性能和推理效率之间实现了更优的平衡。

3.2 视频联合训练与强化学习的互补性
训练阶段的消融实验清晰验证了SimWAM两阶段训练的有效性。仅使用Action Expert时,模型得分为86.6 PDMS;加入Video Expert进行联合训练后,PDMS显著跃升至90.3,同时NC、DAC、EP和TTC各项指标均有提升。这说明未来视频预测所提供的交通动态监督能有效改善Action Expert对场景演化的建模能力,且收益不局限于单一规划指标。进一步引入强化学习后,PDMS提升至91.5,其中DAC和EP分别达到98.7和86.4。上述实验表明,视频联合训练能够成功将交通动态先验融入Action Expert,而强化学习则在此基础上进一步优化整体规划性能。两阶段训练呈现出明显的互补效应,相较仅用Action Expert的基线,PDMS累计提高了4.9个百分点,同时保持了无需显式未来帧预测的直接轨迹生成。
表2:训练阶段消融实验
3.3 强化学习探索方式的消融
为了剖析强化学习中的探索机制,论文对比了随机噪声与SDE两种采样策略。随机扰动虽能增加轨迹多样性并提升前进效率,但会损害安全相关指标;相比之下,SDE在保留原始流边缘分布的同时引入随机探索,产生的候选轨迹既具多样性又维持良好的可行性,最终取得更高的91.5 PDMS。这表明,强化学习的关键不在于简单增加轨迹随机性,而在于构造与生成过程一致且具备可计算似然的结构化探索机制,从而为GRPO提供更可靠的策略优化基础。
表 3:不同强化学习探索方式的比较。
3.4 Video Expert与Action Expert的独立扩展能力
SimWAM在不改变Action Expert及轨迹学习目标的前提下,可直接替换不同的Video Expert。Wan2.1-1.3B、Wan2.2-5B分别取得90.2和90.3 PDMS,而在驾驶视频上预训练的Cosmos-Predict2.5进一步达到90.4 PDMS,并取得更优的EP和TTC。这些结果一方面说明SimWAM不依赖于特定的视频生成模型,另一方面也表明Video Expert所提供的动态先验质量直接影响规划性能。更重要的是,SimWAM为Video Expert与Action Expert提供了相互独立的扩展维度:前者可随着视频生成模型的发展不断强化训练阶段的动态先验,后者则可根据部署算力灵活调整规模。
表 4:不同 Video Expert 的性能比较。
3.5 零样本跨数据集泛化
为了进一步验证从视频生成模型习得的动作先验是否具备跨数据集迁移能力,本文将仅在NAVSIM上训练的SimWAM直接应用于nuScenes评测。如表6所示,SimWAM取得了0.04%的平均碰撞率,在表中所有零样本方法中为最低,同时保持了0.96米的平均L2误差。值得注意的是,L2误差更侧重于与目标数据集专家轨迹的几何一致性,而碰撞率则更直接反映模型对交通交互与安全边界的建模能力。因此,在数据分布存在明显差异的情况下仍能维持极低的碰撞率,说明SimWAM通过世界-动作联合训练所获得的交通动态先验具有一定的跨数据集可迁移性,并非仅是对NAVSIM轨迹分布的过度拟合。
表5:nuScenes上的zero-shot泛化实验
3.6 可视化结果
下图展示了SimWAM在NAVSIM测试阶段的可视化样例。经过强化学习后,Action Expert在交叉路口和狭窄道路等场景中能更充分地沿着目标方向行进,同时保持在可行驶区域内并与周围车辆保持安全间距。这表明强化学习进一步提升了直接轨迹策略的整体驾驶品质。

总结
SimWAM的核心在于通过视频-动作联合训练,将未来视频预测所提供的交通动态先验注入Action Expert,并使其在部署时无需显式预测未来帧即可直接完成规划。在此基础上,SimWAM进一步借助强化学习直接优化Action Expert,将轨迹学习从专家模仿拓展至面向驾驶奖励的策略优化。该设计同时保留了良好的灵活性与可扩展性:Video Expert可替换为更强大或更具驾驶先验的视频生成模型,以提供更高质量的动态先验;Action Expert则可根据部署预算灵活缩放。最终,SimWAM在NAVSIM上达到91.5 PDMS,并在推理效率、模型扩展和零样本泛化方面均表现优异。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。