
智能驾驶模型正在从“看见这一帧”转向“理解接下来会发生什么”。小鹏第二代VLA完成首次重大升级,参数规模增至此前3.5倍,X-Foresight开始预测未来6秒的交通变化。新能力将随XOS 6.3.0在G9L首发,同时通过Master Agent把驾驶、底盘、车身和座舱放入同一条自然语言协调链路。它不是宣布量产车已经达到L4,而是把Robotaxi积累的一部分经验下放到量产系统。
传统感知系统擅长回答“车、人、车道现在在哪里”,但真实驾驶更依赖对象之间的时间关系:前车是否准备切入,自行车是否会横穿,旁车减速是否意味着路口存在遮挡。新版VLA引入4D时序理解,把连续画面、车辆状态和环境变化放在同一模型里。X-Foresight给出的6秒窗口,意在让系统更早形成可执行判断,而不是等风险进入制动距离后再响应。
预测更远也会积累误差。一个对象的意图判断偏差,可能在数秒后放大成错误路径,因此系统不能只展示“预测了多久”,还要衡量不同场景下的校准度、置信度和纠错速度。参数提升3.5倍提供了更大表达空间,却不自动等于安全性同比增长。城市道路中的长尾、天气、遮挡和区域差异,仍需要持续数据闭环与道路验证。
小鹏把新版推理描述为流式自回归范式,并采用MoT混合架构。与一次性读取整段场景再输出动作不同,流式链路需要不断接收新观察、更新内部状态并生成下一步控制。对驾驶系统,这种结构的价值在于减少“感知完成后再规划”的分段延迟,让环境理解、未来预测和动作生成能够随时间连续修正。
连续链路也提高了工程门槛。模型输出必须与车辆控制周期对齐,推理抖动、传感器时间戳和执行器反馈都可能破坏时序。量产部署需要同时观察端到端延迟、最坏时延、资源占用和降级策略;当模型置信不足或硬件异常时,系统能否快速回到明确可验证的安全策略,比平均体验更关键。
参数增长还会直接触及车端算力、能耗与热管理。若更大的模型必须依赖更激进的量化、稀疏激活或任务分流,真实能力取决于整套软硬件协同,而不是训练端参数总量。不同车型的芯片与传感器配置是否获得相同体验,也需要在版本推送后分别验证。量产评测还应公开版本与硬件差异。
另一个变化来自Master Agent。它把负责物理动作的VLA与负责语言、场景理解的VLM结合,用户可以用自然语言表达目标,由系统协调驾驶、底盘、车身和座舱。例如一个出行意图可能同时涉及路线、车内环境与车辆姿态,不再要求用户逐项打开菜单。这使智能座舱从“执行单个指令”向“理解目标并编排多个域”靠近。
跨域调度必须有硬边界。语言模型可以解释模糊需求,却不能绕过驾驶安全、车辆状态和权限规则。每个动作需要明确前置条件、冲突优先级和确认机制,涉及行驶控制的决定还应保持可追踪。否则,越自然的交互反而越容易掩盖系统究竟调用了什么。
小鹏称把部分Robotaxi的L4经验带入量产车,这更适合理解为训练方法、场景库和工程经验的迁移,而不是车辆自动获得L4能力。首发落在G9L和XOS 6.3.0后,真正值得跟踪的是复杂切入、遮挡、弱势交通参与者和跨域指令的表现,以及人工接管、误触发和降级数据。
这次升级的行业价值,在于把“时间”明确放到量产智能驾驶模型的中心,并把座舱Agent与车辆控制域连接起来。参数和预测窗口提供了方向,但验证仍要回到可测指标:场景覆盖、校准误差、最坏时延、接管率和故障恢复。只有这些数据经得起长期道路运行,未来6秒才会从发布会数字变成稳定体验。
