云计算百科
云计算领域专业知识百科平台

SV-WAM:用于端到端自动驾驶的高效环视世界-动作模型

26年9月来自自动化所、重庆长安科技、中国民用航空大学、北航和桂电的论文“SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving”。

论文核心解决自动驾驶世界模型的矛盾:环视多相机输入带来安全收益,但推理时生成多视角未来视频会带来巨大计算开销;现有方案为降延迟只能使用单前视相机,在变道、汇入、转弯等场景存在盲区风险。其核心范式是:未来视频只做训练监督信号,推理阶段完全舍弃视频生成分支,保留完整 6 相机环视输入做动作规划。

如图 1 所示在单个 NVIDIA H20 GPU 上进行效率性能概述(预处理输入到轨迹的延迟)。尽管使用六个摄像头的输入,SV-WAM 仍以最低的延迟达到最佳的 NAVSIMv2 EPDMS 性能。
请添加图片描述


如图 2 所示采用环视规划的动机。例如,在没有信号灯的交叉路口,仅依靠正面视角进行规划的人员可能缺乏足够的侧向信息,从而在复杂的交通环境中做出不安全的决策。

请添加图片描述

一、算法整体框架

整体由输入 Token 化、环视世界‑动作模型、可微分可行驶区域正则、仅动作高效推理四大模块构成。

如图3所示SV-WAM概述。在训练过程中,SV-WAM基于六-视图历史观测数据,联合对未来动作和未来视频潜变量进行去噪。以动作为中心的因果掩码阻止动作tokens对未来视频tokens的关注,而可行驶区域合规性正则化器则促进符合道路规范的规划。在推理阶段,移除未来视频分支,从而能够利用完整的六-视图上下文进行高效的纯动作规划。
请添加图片描述

1. 输入 Tokenization(输入编码)

环视视频编码:6 路相机图像按宽度拼接成一张大图;使用冻结的 3D‑Causal VAE 得到视频隐变量,拆分为历史参考隐变量(推理一直使用)、未来视频隐变量(仅训练阶段使用);再转为视频 token。

状态与动作编码:自车历史状态(8 维向量:驾驶指令、速度、加速度)通过 MLP 映射为状态 token;未来动作序列(每步自车相对增量(Delta x,Delta y,Delta psi)通过 MLP 编码为动作 token。

2. 环视世界‑动作模型(核心)

骨干网络基于 Wan2.2‑5B Diffusion‑Transformer(DiT),采用Flow‑Matching 流匹配联合去噪未来动作、未来视频隐变量。

  • 动作中心因果掩码(Action‑Centered Causal Mask,核心创新)
  • 训练阶段:token 序列 = 状态 token + 历史观测视频 token + 噪声动作 token + 噪声未来视频 token。
    掩码规则:动作 token 不能看到未来视频 token;未来视频 token 可以看到动作 token;状态、历史观测作为条件前缀互相可见。
    概率分解:p_theta(A_0, Z_0fut | Omega) = p_theta(A_0 | Omega) p _theta (Z_0fut | Omega,A_0)。
    效果:未来视频隐变量的联合训练依然更新共享主干参数,把场景动力学知识注入模型;但是动作预测不依赖未来视频 token,推理时可以直接删掉未来视频分支,不需要生成未来视频就输出轨迹。

    如图 4所示以动作为中心的因果掩码。动作token倾向于关注自我状态和参考视频token,但无法关注未来视频token;而未来视频token可以关注动作token。这种不对称依赖性支持未来视频的协同训练,而无需在推理阶段将动作预测依赖于未来视频token。
    请添加图片描述

  • 流匹配联合损失 L_fm。同时优化动作分支速度场、未来视频隐变量速度场;视频分支只在训练起作用。

  • 可行驶区域合规正则器(L_dac)(训练时附加损失,推理无开销)

  • 解决流匹配只模仿轨迹,不约束车辆不能越出可行驶区域的问题。
    将预测动作序列送入 LQR 跟踪器 + 运动学自行车模型,滚动仿真得到自车位姿;
    提取车辆四个角点,在自车坐标系符号距离场 SDF 做双线性插值;
    使用 softplus 平滑 margin 惩罚 + log‑mean‑exp 聚合(对高风险越界给予更大权重);
    总损失:L = L_fm + lambda_dac L_dac。
    全部在 PyTorch 中实现可微分,梯度可以回传到动作预测网络,推理无任何额外计算开销。

  • 推理阶段:仅动作高效推理
  • 直接丢弃未来视频 token 与视频解码分支,输入序列仅保留状态 token + 历史环视视频 token + 噪声动作 token;
    对条件前缀(历史观测、状态)做 KV 缓存复用,仅对动作 token 做流匹配去噪;仅需要 2 步去噪即可输出轨迹;
    单 H20 GPU 上,预处理输入到轨迹输出延迟341.6±2.1ms,远低于 Epona、DriveLaW、PWM 等世界模型基线。

    二、核心观点与主要结论

    世界模型的收益主要来自训练阶段的未来视频监督,而不是推理时显式生成未来视频。 不需要在推理阶段 “想象未来画面”,通过联合训练把场景动力学知识嵌入主干参数,推理只输出动作就可以获得世界模型带来的规划收益,兼顾环视输入与低延迟。

  • 6 相机环视输入对安全关键驾驶动作至关重要。 单前视相机在变道、转弯、无信号路口会丢失侧后方障碍物;消融实验:C×1→C×3→C×6,EPDMS 持续上涨;注意力可视化证明动作 token 会重点关注左前、后向相机来处理换道交互。
  • 可微分可行驶区域正则能显著提升边界安全。 该正则将 DAC(可行驶区域合规)指标大幅提升,降低车辆压边界、驶出道路风险,推理零开销。
  • 优秀跨数据集零样本迁移能力。 仅在 NAVSIMv2 训练,直接零样本评估 nuScenes:平均 L2 误差 0.89m,平均碰撞率 0.16%,优于很多在 nuScenes 上微调的基线。
  • 实验主要结果
    NAVSIMv2 闭环:C×6 输入 EPDMS 达到91.0,SOTA;
    消融:未来视频共训练、DAC 正则、最终微调三个组件共同贡献性能;带因果掩码时仅 2 步推理即可达到最优,更多去噪步骤不会提升性能。
  • 三、论文指出的局限与现存问题

  • 模型参数量大,车载部署压力大
  • 主干是 5B 参数 DiT,算力受限的车载硬件很难直接部署;未来方向:知识蒸馏、剪枝、量化做轻量化版本。

  • 依然存在典型失效场景
  • 歧义几何拓扑:二选一的左转分叉路口,模型会选错路径;
    恶劣感知退化:大雨天气,图像模糊,信号灯识别失效;
    交互决策保守问题:绿灯亮起后加速过于保守,被后车追尾;
    说明模型对复杂交互推理、不确定性处理仍有不足。

  • 评估局限
  • 主要依赖仿真基准 NAVSIMv2、nuScenes 开环评估,没有实车闭环测试;
    零样本迁移主要在仿真 / 数据集上验证,真实世界泛化仍待验证;
    可行驶区域正则依赖可行驶区域地图输入;地图出错会带来副作用。

  • 范式本身固有的短板(WAM 共性)
  • 推理不再输出未来视频,无法直观看到模型 “想象” 的未来场景,可解释性下降;故障排查难度高于显式生成未来帧的世界模型;
    性能高度依赖训练视频数据的分布;训练数据没有覆盖的极端工况,泛化能力下降。

    四、论文的 3 点主要贡献总结

    提出 SV‑WAM,设计动作中心因果掩码,实现 6 相机环视输入,训练时联合动作‑未来视频隐变量去噪,推理移除视频分支,实现低延迟规划。
    提出可微分可行驶区域合规正则,训练阶段约束车辆轮廓不能越界,提升规划安全性,推理无计算开销。
    在 NAVSIMv2 闭环、nuScenes 零样本上取得 SOTA,验证 “训练时做未来视频监督,推理不生成视频” 这条路线的有效性。

    五、与同类工作对比理解

    传统 WAM(Epona、DriveLaW):推理也要生成未来视频,计算重,为速度只能用单前视; Fast‑WAM/GigaWorld‑Policy:推理丢弃视频分支,但没有做多环视自动驾驶场景; SV‑WAM:把这套高效 WAM 范式拓展到6 相机环视自动驾驶场景,并且增加可行驶区域安全正则,面向真实自动驾驶安全需求。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » SV-WAM:用于端到端自动驾驶的高效环视世界-动作模型
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!