一个4B模型管三件事,Qwen-Drive把感知、问答和规划合成一套

2026年09月11日 由 ATYUN编辑部 发表 924 0
自动驾驶研究车在城市路口同时进行三维感知和轨迹规划的原创示意图
原创示意图:Qwen-Drive尝试让同一套视觉语言表示同时服务驾驶场景理解、三维感知与轨迹规划。

自动驾驶模型通常把看懂场景、回答问题和生成路线分给不同系统,接口越多,信息在模块间损失的机会也越多。阿里云9月10日介绍并开放Qwen-Drive-1.0:它以Qwen3.5-4B为共享视觉语言底座,在不改基础模型架构的情况下外挂BEV感知头与规划专家,试图用同一套表示完成3D感知、驾驶问答和未来轨迹生成。

一套底座:4B视觉语言模型在三个任务间共享表示,不为每项能力另训一套主干。
两个外挂:BEV头输出可检查的3D结构,规划专家用流匹配生成未来轨迹。
完整开放:权重、推理代码、示例数据和评测脚本均已公开,采用Apache 2.0许可。

不改4B主干,把驾驶能力接在共享表示上

Qwen-Drive保留预训练VLM本体:问答直接由它处理;外部BEV感知头同时执行3D目标检测、语义占用预测和鸟瞰地图分割;规划专家读取同一表示,通过流匹配输出车辆未来五秒、10Hz采样的轨迹。感知头被刻意保持简单,更像一支探针,用来判断共享表示里是否真的保留了可解释的三维结构,而不是追求单项感知榜单冠军。

训练采用分阶段方案:先统一多个公开驾驶数据集的标签与轨迹格式,再把驾驶监督和通用视觉语言数据混合,减少领域训练造成的灾难性遗忘。规划部分提供SFT与RL两个专家;RL版本在带推理的规划模式下运行,奖励同时考虑NAVSIM、Waymo端到端指标和位移项。模型包中主VLM约9.1GB,两个规划专家各约2.1GB,感知头约0.5GB,模块边界清晰。

公开结果证明“能合并”,还没有证明“能上路”

在伪闭环NAVSIM v1.1测试中,RL规划专家的PDMS为90.7,六次采样后按真实答案挑选最佳轨迹的上界为91.4;在Waymo开放数据集端到端测试上,RFS为7.91。驾驶问答方面,SFT模型在官方列出的多项空间、因果与安全问题测试中优于Qwen3.5-4B底座,同时在通用视觉语言测试上大体保持原有水平。

这些数字需要连同边界阅读。best-of-6使用真实答案挑选轨迹,只能代表上界,实际车辆无法预先知道哪条样本最好;不同方法的训练数据和评测协议也不完全一致。在AlpaSim闭环的at-fault分数上,RL版本为0.37,低于官方表中Alpamayo-1.5的0.45,说明统一模型并非各项都领先。论文和模型卡没有给出真实道路里程、接管率、长尾天气表现或功能安全认证。

开源的真正价值,是让三条链路能被同场复测

这次发布不只给出一张成绩表。仓库包含四个规划示例、六帧感知数据、场景文件格式、各基准的预测与评分脚本,以及从VQA到规划、感知的推理入口。研究者可以固定同一底座,单独替换感知头、规划专家或训练数据,观察一个任务的改动是否伤害另一个任务,也能检查所谓三维能力究竟来自共享表示还是专用模块。

对自动驾驶团队,更实际的验证顺序是先复现公开结果,再用自有场景建立分层评测:问答看空间与因果理解,感知看对象、占用和地图一致性,规划看碰撞、舒适、交通规则与进度。最后还要加入传感器故障、夜间、遮挡、施工和罕见参与者,并记录模型何时应该拒绝规划或交给安全系统。

小编判断:统一表示是方向,独立安全链仍不可省

Qwen-Drive最值得关注的不是把三个任务写进同一张架构图,而是用一个体量可控、代码和权重可查的模型验证跨任务共享是否成立。若问答能解释场景、BEV头能暴露三维结构、规划专家又能沿同一表示行动,研发就有机会减少重复主干和接口漂移,并把语言理解带进驾驶决策。

但“统一”不能变成单点失效。感知、推理和规划共享表示,也意味着错误可能跨任务传播。真实部署仍需独立的安全约束、冗余感知、规则检查、人工定义的停止条件和封闭场地验证。现在更准确的定位,是一套可复现、可拆解、可复测的研究基础模型,而不是已经跨过量产门槛的自动驾驶系统。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消