
自动驾驶模型通常把看懂场景、回答问题和生成路线分给不同系统,接口越多,信息在模块间损失的机会也越多。阿里云9月10日介绍并开放Qwen-Drive-1.0:它以Qwen3.5-4B为共享视觉语言底座,在不改基础模型架构的情况下外挂BEV感知头与规划专家,试图用同一套表示完成3D感知、驾驶问答和未来轨迹生成。
Qwen-Drive保留预训练VLM本体:问答直接由它处理;外部BEV感知头同时执行3D目标检测、语义占用预测和鸟瞰地图分割;规划专家读取同一表示,通过流匹配输出车辆未来五秒、10Hz采样的轨迹。感知头被刻意保持简单,更像一支探针,用来判断共享表示里是否真的保留了可解释的三维结构,而不是追求单项感知榜单冠军。
训练采用分阶段方案:先统一多个公开驾驶数据集的标签与轨迹格式,再把驾驶监督和通用视觉语言数据混合,减少领域训练造成的灾难性遗忘。规划部分提供SFT与RL两个专家;RL版本在带推理的规划模式下运行,奖励同时考虑NAVSIM、Waymo端到端指标和位移项。模型包中主VLM约9.1GB,两个规划专家各约2.1GB,感知头约0.5GB,模块边界清晰。
在伪闭环NAVSIM v1.1测试中,RL规划专家的PDMS为90.7,六次采样后按真实答案挑选最佳轨迹的上界为91.4;在Waymo开放数据集端到端测试上,RFS为7.91。驾驶问答方面,SFT模型在官方列出的多项空间、因果与安全问题测试中优于Qwen3.5-4B底座,同时在通用视觉语言测试上大体保持原有水平。
这些数字需要连同边界阅读。best-of-6使用真实答案挑选轨迹,只能代表上界,实际车辆无法预先知道哪条样本最好;不同方法的训练数据和评测协议也不完全一致。在AlpaSim闭环的at-fault分数上,RL版本为0.37,低于官方表中Alpamayo-1.5的0.45,说明统一模型并非各项都领先。论文和模型卡没有给出真实道路里程、接管率、长尾天气表现或功能安全认证。
这次发布不只给出一张成绩表。仓库包含四个规划示例、六帧感知数据、场景文件格式、各基准的预测与评分脚本,以及从VQA到规划、感知的推理入口。研究者可以固定同一底座,单独替换感知头、规划专家或训练数据,观察一个任务的改动是否伤害另一个任务,也能检查所谓三维能力究竟来自共享表示还是专用模块。
对自动驾驶团队,更实际的验证顺序是先复现公开结果,再用自有场景建立分层评测:问答看空间与因果理解,感知看对象、占用和地图一致性,规划看碰撞、舒适、交通规则与进度。最后还要加入传感器故障、夜间、遮挡、施工和罕见参与者,并记录模型何时应该拒绝规划或交给安全系统。
Qwen-Drive最值得关注的不是把三个任务写进同一张架构图,而是用一个体量可控、代码和权重可查的模型验证跨任务共享是否成立。若问答能解释场景、BEV头能暴露三维结构、规划专家又能沿同一表示行动,研发就有机会减少重复主干和接口漂移,并把语言理解带进驾驶决策。
但“统一”不能变成单点失效。感知、推理和规划共享表示,也意味着错误可能跨任务传播。真实部署仍需独立的安全约束、冗余感知、规则检查、人工定义的停止条件和封闭场地验证。现在更准确的定位,是一套可复现、可拆解、可复测的研究基础模型,而不是已经跨过量产门槛的自动驾驶系统。
