L O A D I N G

DiMA:自动驾驶“偷师”大模型,效率与安全双丰收!

由 Greyson 发布

文献速读

一、基本信息

  • 标题:Distilling Multi-modal Large Language Models for Autonomous Driving
  • 作者:Deepti Hegde, Rajeev Yasarla, Hong Cai, Shizhong Han, Apratim Bhattacharyya, Shweta Mahajan, Litian Liu, Risheek Garrepalli, Vishal M. Patel, Fatih Porikli
  • 关键词:DiMA, 自动驾驶, 多模态大语言模型, 知识蒸馏, 长尾场景
  • doi:文本中未涉及相关内容

二、文章概述

本文提出DiMA框架,旨在通过知识蒸馏将多模态大语言模型(MLLM)的世界知识融入视觉规划器,以提升自动驾驶系统在长尾场景下的鲁棒性,同时保持视觉规划器的高效性。DiMA通过联合训练策略,使共享的场景编码器学习结构化、语义接地且与规划目标对齐的表示,MLLM在推理时可选,实现高效规划。实验表明,DiMA在nuScenes数据集上降低了37%的轨迹误差和80%的碰撞率,尤其在长尾场景表现优异。

三、研究背景

传统端到端自动驾驶系统虽高效,但在长尾导航和感知场景中表现不佳,因训练数据有限。基于大语言模型(LLM)的规划器虽能利用世界知识提升泛化性,但测试时计算成本高,且视觉与语言域的桥梁构建复杂,现有图像 tokenization 策略依赖冻结编码器生成非结构化嵌入,缺乏场景组件显式建模。因此,需解决如何在保留视觉规划器效率的同时,利用LLM知识,并构建结构化、可更新的场景表示以应对复杂规划任务。

四、研究思路

  • 提出研究问题:如何在保留视觉规划器效率的同时,利用MLLM的世界知识提升自动驾驶系统在长尾场景的鲁棒性?
  • 构建研究框架:设计DiMA框架,包含视觉规划器(场景编码器+规划Transformer)和MLLM(适配器层+LLM+任务解码器头),共享场景编码器作为可训练tokenizer。
  • 选择研究方法:采用联合训练策略,MLLM通过视觉问答、轨迹估计、掩码重建等代理任务学习,视觉规划器同时训练轨迹估计并从MLLM蒸馏特征,优化多任务损失函数。
  • 分析数据:在nuScenes数据集上,使用标准化评估和VAD评估,对比不同模型在全验证集、目标子集及长尾场景的轨迹误差和碰撞率。
  • 得出结论:DiMA通过知识蒸馏和结构化表示学习,在保持效率的同时提升了长尾场景性能,优于现有视觉和MLLM规划器。

五、研究结果

  • DiMA使视觉规划器的L2轨迹误差降低37%,碰撞率降低80%,长尾场景轨迹误差降低44%。
  • 在nuScenes规划基准上达到SOTA性能,全验证集平均轨迹误差0.46m,目标子集0.64m,长尾场景1.05m。
  • MLLM分支支持视觉问答,DiMA-Dual混合推理模式进一步提升性能,零样本3点转弯场景碰撞率为0。
  • 场景编码器联合训练使BEAM表示更鲁棒,代理任务(掩码重建、未来预测等)有效增强特征语义接地性。

六、研究结论、不足与展望

  • 研究结论:DiMA通过蒸馏MLLM知识到视觉规划器,实现了高效且鲁棒的端到端自动驾驶。联合训练策略使场景编码器学习结构化、语义对齐的BEAM表示,在长尾场景表现优异,MLLM推理时可选,兼顾效率与泛化性,为解决自动驾驶长尾问题提供新范式。
  • 研究的创新性:1. 提出DiMA框架,首次将MLLM知识蒸馏至视觉规划器,实现效率与鲁棒性平衡;2. 设计BEAM结构化表示及联合训练策略,显式建模场景组件并动态更新特征;3. 提出掩码重建、场景编辑等代理任务,增强表示语义接地性。
  • 研究的不足之处:1. 依赖nuScenes数据集,真实复杂交通场景泛化性待验证;2. 场景编辑任务中新增/移除代理的规则算法可能限制多样性;3. MLLM分支推理时计算成本仍较高,未完全解决实时性问题。
  • 研究展望:1. 扩展至更多传感器模态(如激光雷达)及多智能体交互场景;2. 探索动态场景编辑生成方法,提升代理任务多样性;3. 优化MLLM轻量化技术,实现端侧实时推理;4. 结合强化学习进一步提升复杂环境下的决策能力。

自动驾驶模型痛点

自动驾驶最怕啥?“长尾巴(long tail)”极端场景(如突发超车、三点掉头)!传统视觉模型容易“懵圈”,而依赖大语言模型(LLM)又像背着“超级计算机”上路,算力根本扛不住!

“long-tail” scenarios.
指那些 极少发生、非常罕见但又非常危险、复杂、不可预测的场景。如:突然掉落异物、行人从车后突然跑出...
因为在统计分布中,大量常见场景是“头部”,而这些罕见但危险的情况位于概率分布的“尾部”,数量少但影响巨大。

long-tail scenarios = 低频但高风险的罕见复杂场景。

想象一下:高速公路上突然有车辆违规切入、狭窄巷道中需要连续三点掉头、暴雨天气下行人突然横穿马路……这些发生概率低但危险性极高的“长尾场景”(Long-tail scenarios),正是自动驾驶系统最致命的短板。

传统视觉模型(如纯摄像头+神经网络架构)依赖海量标注数据训练,但这类极端场景在真实世界中出现频率极低,导致模型“没见过、学不会”。例如:

  • 突发超车:当旁车道车辆无视安全距离强行并线时,传统模型可能因缺乏类似训练样本而反应迟缓,引发碰撞风险(图1左)。

突发超车场景中,传统模型轨迹预测误差大(红色为预测轨迹,绿色为真实安全轨迹);

  • 三点掉头:在狭窄街道中,自动驾驶需连续倒车、转向调整车身,传统模型易因空间感知误差导致轨迹偏移(图1右)。

​ 三点掉头场景中,传统模型易发生碰撞(红色框为碰撞风险区域)。

核心问题:传统视觉模型的“经验主义”难以应对未见过的场景,泛化能力受限。

DiMA技术来了

“聪明但笨重”的解决方案

👉 核心思路:让视觉模型“拜师”多模态大语言模型(MLLM)!通过知识蒸馏+联合训练,把LLM的“世界知识”灌输给轻量级视觉规划器,推理时甚至不用LLM,效率拉满!
👉 关键操作:设计三大“替身任务”(掩码重建、未来预测、场景编辑),让视觉编码器学会LLM的结构化语义表示,既懂“看路”又懂“推理”。

为突破数据局限,研究者尝试引入大语言模型(LLM)作为“大脑”。LLM通过互联网文本学习了海量世界知识(如“雨天路滑需减速”“路口应礼让行人”),理论上能通过推理应对罕见场景。例如:

  • TOKEN模型(2024)将场景信息转化为文本提示,让LLM直接输出驾驶决策;
  • DriveLM(2023)通过视觉问答(VQA)让LLM理解场景语义(如“前方施工区域是否需要绕行”)。

但痛点来了:LLM推理需消耗巨大算力。以GPT-4为例,单次轨迹预测需调用数十亿参数,相当于“背着超级计算机上路”,实时性和硬件成本根本无法满足车载系统需求(图2)。

鱼与熊掌如何兼得?

为解决“泛化能力”与“效率”的矛盾,DiMA(Distilling Multi-modal Large Language Models for Autonomous Driving) 框架应运而生(2025,Qualcomm AI Research & Johns Hopkins University)。其核心思路是:用LLM的“智慧”赋能视觉模型,同时抛弃LLM的“笨重”

知识蒸馏

DiMA通过三大“代理任务”(Surrogate Tasks)将LLM的世界知识“蒸馏”到视觉模型中:

  • 掩码重建:随机遮挡部分场景信息(如BEV鸟瞰图中的一块区域),让模型通过LLM推理补全,强化场景理解;

  • 未来预测:让LLM预测未来2秒的场景变化(如其他车辆的轨迹),指导视觉模型学习长期规划;

  • 场景编辑:人工修改场景(如添加一辆突然出现的卡车),让LLM回答“ ego车应如何避让”,并将推理逻辑注入视觉模型(图3)。

效果炸裂!

训练时,LLM作为“老师”提供知识;推理时,仅保留轻量化视觉模型(如VAD-Tiny),LLM完全“下岗”。这使得DiMA在nuScenes数据集上实现:

  • 轨迹误差降低37%,碰撞率降低80%;

  • 长尾场景(如三点掉头)误差降低44%,且推理耗时仅59ms(与传统视觉模型相当)。

普通场景:视觉规划器L2轨迹误差降37%,碰撞率大减80%!
长尾巴场景:轨迹误差减少44%,零样本“三点掉头”也能稳稳拿捏!
效率碾压:推理时扔掉LLM,保持视觉模型的速度,却达到SOTA性能(nuScenes规划基准第一)!

未来

DiMA的突破证明:自动驾驶无需在“聪明”与“高效”间二选一。通过知识蒸馏,视觉模型既能保留轻量化优势,又能“继承”LLM的世界知识。未来,随着多模态融合技术的发展,我们或许能看到:

  • 更小的模型:通过稀疏激活、模型压缩进一步降低硬件门槛;
  • 更强的鲁棒性:结合强化学习,让模型在虚拟场景中“预演”极端情况,提前积累“经验”。

自动驾驶的终极目标,是让AI像人类司机一样“见多识广”且“反应敏捷”——而DiMA正是这条路上的关键一步!


扫描二维码,在手机上阅读
收藏

0条评论

发表评论


验证码