点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
太长不看版:SimWAM 只把视频生成当训练信号,用隔离注意力保证动作头永远看不到未来帧,部署时整条视频分支可删除;单前视相机在 NAVSIM 达到 91.5 PDMS,并零样本迁移到 nuScenes。
导读
WAM 通过把视频动力学先验迁移给动作预测,改善端到端自动驾驶;但现有方法推理时需要昂贵的未来生成。作者提出 SimWAM,一个简单有效、仅把视频生成作为训练信号的 WAM。
SimWAM 通过联合流匹配共同训练预训练视频专家和轻量动作专家。隔离注意力掩码让动作预测与未来帧无关,因此训练后可删除视频分支,只留下直接预测轨迹的独立规划器。
两个专家不共享参数,只通过统一注意力接口交互,因此可以替换视频骨干,也可独立扩展动作专家,而无需修改目标或推理流程。作者还用强化学习优化组合驾驶奖励,超越纯轨迹模仿。
SimWAM 在 NAVSIM 达到 91.5 PDMS,以明显更低延迟超过最先进 WAM 规划器,并零样本迁移到 nuScenes。它由此成为一条简单而扎实的基线,可直接吸收视频生成进步,同时保持高效驾驶。
▲ 图 1:NAVSIM 上 PDMS—延迟对比。SimWAM 获得最高 PDMS,同时显著低于其他世界模型规划器的延迟。
效果展示
▲ 图 3:强化学习动态,星号表示模仿学习检查点;只在困难子集训练始终优于使用全部 navtrain 场景。
▲ 图 4:两个 navtest 场景中模仿版与强化版对比;红圈处显示 RL 版在保持可行驶区域内时前进更远。
引言
端到端自动驾驶用统一网络把原始传感器观察直接映射到规划轨迹。联合优化消除了手工接口,也减少传统感知—预测—规划流水线中的误差传播。尽管近期端到端规划器持续提高精度,它们本质上仍主要是模仿策略:复制日志轨迹中的行为,只隐式捕获交通语义、用户意图和场景动力学。
VLA 通过把预训练视觉—语言模型适配到驾驶来处理语义限制。语义知识和高层推理改善场景理解,把轨迹生成连接到用户意图。许多驾驶 VLA 还在预测轨迹前生成显式理由,提高复杂和指令条件场景中的可解释性。近期方法引入未来场景生成或潜在推理以加强时空理解,但这些组件与动作预测仍松散耦合,常需要额外训练阶段或串行推理;运动和时间演变仍只被间接建模,因此需要更显式地处理世界动力学。
世界模型通过显式建模环境如何随运动演变来满足这一需求。DreamZero、LingBot-VA 等 WAM 用预训练视频生成骨干联合预测未来观察和动作;这一范式近期也进入自动驾驶。DriveLaW、DriveWAM 联合训练视频预测器与规划器,让预期场景动力学指导轨迹生成。然而,现有驾驶 WAM 常采用“先想象、再行动”流水线,规划器依赖生成的未来帧输出轨迹;昂贵视频合成因此进入实时规划闭环,显著增加推理延迟,如 Figure 1 所示。
关键在于,有效世界—动作学习并不需要显式合成未来。Fast-WAM 显示,视频联合训练对动作预测的帮助主要来自训练时表征学习,而非测试时未来想象。基于这一洞见,作者提出 SimWAM,一个朴素而有效的 WAM,把视频生成作为训练信号,同时在推理时保留直接轨迹预测。SimWAM 用流匹配联合训练预训练视频专家和轻量动作专家;简单隔离注意力掩码阻止动作专家访问未来帧,因此训练后可移除完整视频分支。所得动作 DiT 保留交通动力学先验,部署时不需要辅助运动模块或视频生成。这种解耦还让视频专家可替换,更先进视频生成器能改善先验,却无需改变动作头或推理流程。此外,作者把确定性流 ODE 重写为随机 SDE,并用 GRPO 强化动作专家,实现多样机动探索与组合驾驶奖励的直接优化。本文不声称算法本身优越,而是建立一条简单扎实的 WAM 基线,用于探索通用视频模型在自动驾驶中的潜力。
SimWAM 的优势有三点:1)不使用辅助运动模块,便把预训练视频生成器的交通动力学先验迁移给规划器;2)隔离注意力让动作专家与未来帧独立,可移除视频专家,实现高效推理和直接奖励优化;3)解耦架构无需修改动作专家或推理流程,即可接入更先进视频生成器。
NAVSIM 实验验证这一简单设计。SimWAM 达到 91.5 PDMS,同时推理延迟显著低于基于世界模型的最先进规划器。它还支持不同预训练视频生成器,并无需微调零样本迁移到 nuScenes,说明架构具有扩展性和跨域泛化。作者希望 SimWAM 成为自动驾驶高效 WAM 的强实用基线。

主要贡献
原文没有独立编号列表,但明确概括三点优势:高效迁移视频交通动力学先验;隔离未来帧并删除部署视频分支;视频/动作专家解耦、可独立替换与扩展。论文还加入 GRPO 直接优化组合驾驶奖励。
方法
SimWAM 的设计像“训练时带教、上路后独立驾驶”:视频世界模型在训练阶段展示未来动力学,动作专家可以借它学习,但隔离掩码禁止动作直接偷看未来答案。等规律被内化后,整套视频生成分支被删除;所以世界模型提供的是课程与教师信号,而不是推理时必须携带的计算包袱。
训练时,预训练视频 DiT 对未来视频潜变量做流匹配,轻量动作 DiT 对轨迹潜变量做流匹配。统一注意力接口允许当前观察信息在两分支间交互,但隔离掩码严格禁止动作词元读取未来帧词元;因此动作头必须把训练中迁移到的动力学规律内化,而不能推理依赖视频结果。
▲ 图 2:SimWAM。视频与动作 DiT 经统一接口联合学习未来动力学和轨迹,掩码限制动作词元只看当前观察;推理与 RL 只保留动作 DiT。
训练结束后完全删除视频专家。动作流 ODE 可直接生成确定轨迹;强化阶段将其改为带噪 SDE 进行探索,用 GRPO 根据碰撞、可行驶区域、舒适性、进度等组合驾驶奖励更新独立动作专家。视频骨干和动作专家不共享参数,因此可分别替换或扩展。
实验结果
NAVSIM navtest 比较相机/LiDAR 规划器,SimWAM 仅用单前视相机达到 91.5 PDMS。相对其他 WAM,它避免测试视频生成,延迟显著更低。零样本直接在 nuScenes 开环规划评估,无需微调仍具有竞争力。
组件分析检验视频联合训练、隔离掩码与 RL;另比较不同掩码、视频骨干、动作头规模、探索采样器、未来视频目标、输入分辨率与采样步。结果说明,训练时世界建模是增益来源,但部署时显式未来并非必要;动作专家扩大可独立提升,视频专家也可替换而不改推理。
▲ 表 1:NAVSIM navtest 最先进规划器对比,C/L 分别表示相机/LiDAR。
▲ 表 2:核心组件分析。
总结 & 未来工作
本文提出 SimWAM,一个面向端到端自动驾驶的简单、有效且灵活的 WAM。它通过联合流匹配,把预训练视频专家的交通动力学先验迁移给轻量动作专家。隔离注意力掩码让动作预测与未来帧解耦,训练后可以删除视频分支,直接规划轨迹。该设计还让视频骨干可替换、两个专家可独立扩展,既可使用更强视频先验而不增加部署成本,也能让动作专家适应不同效率需求。强化学习进一步让独立规划器在模仿之外对齐驾驶质量。SimWAM 仅用单前视相机便在 NAVSIM 达到 91.5 PDMS,以高效直接推理运行,并零样本迁移到 nuScenes。结果说明,训练阶段的世界建模无需昂贵测试时想象,也能支持强实时规划。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。