当自动驾驶学会“读空气”:VLA 模型如何跨越中欧物理世界的鸿沟
社区讨论 · 政策

当自动驾驶学会“读空气”:VLA 模型如何跨越中欧物理世界的鸿沟

格物格物7月19日2026/07/19 56 浏览

如果把自动驾驶比作一个在异国他乡与人交流的陌生人,它需要掌握的不只是语言(交通规则),更需要理解当地的文化习惯(驾驶行为)和潜台词(道路潜规则)。今天,绝大多数自动驾驶系统还是“死记硬背”的留学生——换了城市就手足无措,更别说跨洲。小鹏昨天发布的第二代VLA模型,试图用“世界模型+VLA”这对孪生体,让汽车学会“读空气”。从信息论的角度,这是一个关于如何压缩跨域数据分布差异、并在隐空间建立因果结构的工程挑战。

短期看:从“打补丁”到“学语法”

目前业界解决跨域适配的主流方案仍然是“补丁式”的:在中国训练一套模型,到欧洲重新采集数据、微调、甚至替换部分感知模块。这种做法的本质是假设两个域的数据分布是独立的,因此需要独立维护多个模型副本。从信息论视角看,这等于放弃了跨域共享的冗余信息,导致每增加一个地区,模型复杂度线性增长。

小鹏第二代VLA的核心贡献在于:它把“世界模型”作为VLA的隐空间先验。具体来说,VLA(Vision-Language-Action)模型本身是一个多模态 Transformer,但它的泛化能力受限于训练数据中见过的场景组合。而世界模型通过预测下一帧的视觉状态、并对环境动态进行因果建模,为VLA提供了“物理常识”——比如“红灯必须停”是全局不变的,但“红灯亮起后3秒内是否允许右转”是地区相关的。世界模型能自动区分哪些是因果约束(不可违反),哪些是统计关联(可以迁移)。

小鹏方案的简化架构:
1. 视觉编码器 → 场景 token
2. 语言指令 → 指令 token
3. 世界模型 → 预测未来状态,提供环境动态的先验分布
4. VLA 融合 → 根据当前 token 和未来预测,输出动作序列
5. 动作执行 → 控制信号

关键差异:世界模型不直接输出动作,而是提供“如果……那么……”的因果推断。

短期来看,这套方案首先需要解决的是“同一套模型打通”的可行性验证。小鹏声称已实现中国与欧洲的同一套模型,这意味着在训练阶段,模型必须同时学习到中欧场景的共享特征(如车道线、行人意图)和差异化特征(如环岛规则、限速标识形状)。技术上,这要求世界模型具备足够的容量来编码多个域的分布,同时保证动作输出的确定性。一个潜在风险是:如果世界模型过度拟合某个域(比如中国复杂的非机动车流),在欧洲稀疏道路上可能产生过于保守的预测,导致变道犹豫。

长期看:VLA + 世界模型 = 通用自动驾驶的“操作系统”

从更长的技术路线看,小鹏的目标是让VLA成为自动驾驶的“通用推理引擎”,而世界模型则扮演“物理模拟器”的角色。这实际上是向具身智能的范式靠拢——机器人(汽车)需要理解物理世界的不变性,才能在陌生环境中零样本适应。

对比其他主流方案:

方案 核心思路 跨域泛化能力 代表工作
模块化(Waymo) 感知-预测-规划分离,各模块独立优化 弱,需重新采集地图和规则
端到端(Tesla) 单网络从像素到控制,隐式建模 中等,依赖数据多样性
VLA+世界模型(小鹏) 显式物理先验,分离因果与统计 强,理论上可迁移到任何规则域

小鹏这项工作在学术上最接近的参考是 DeepMind 的 Gato 和斯坦福的 VIMA,但后者更多是通用机器人操控,而小鹏将其落地到驾驶这一更高风险、更动态的场景。从信息论的角度,世界模型相当于一个“压缩-解压”的瓶颈:它迫使模型丢弃与物理规律无关的统计噪声(比如某个城市的特定路牌颜色),只保留跨域不变的因果结构。2024年 MIT 有一篇论文《Causal World Models》证明了这种结构能使零样本迁移的样本效率提升一个数量级。

长期看,如果小鹏在2027年实现向海外用户交付,那么这套框架必须解决两个关键挑战:

1. 世界模型的长尾鲁棒性:欧洲的乡村道路、冰雪天气、古城区狭窄街道,这些场景的数据稀疏,世界模型能否在缺乏训练样本的情况下给出合理的预测?

2. 法规与伦理的编码:不同国家的交通法规差异不仅是视觉上的,还有逻辑上的(比如德国的“Rechtsfahrgebot”右侧行驶义务)。如何将显式规则嵌入世界模型的因果图,而不是依赖隐式学习?

我的判断是:小鹏的第二代VLA走得比业界想象得更激进。它放弃了“用数据堆砌所有

原文链接:https://www.ithome.com/0/978/655.htm

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧