World Model & VLA 论文综述 (2018–2026)
本文转载自 song2yu.github.io,版权归原作者所有。点击查看 原文链接。
World Model & Vision-Language-Action 论文综述 (2018–2026)
整理日期:2026-03-29
收录论文:79+
来源:ArXiv · HuggingFace
覆盖范围:2018–2026
领域概述
VLA 主线
以预训练语言/视觉大模型为骨干,直接从多模态观测预测机器人动作。强调零样本泛化、语言指令跟随与多任务通用性。代表作:RT-2、OpenVLA、π0、Gemini Robotics。
World Model 主线
建模环境状态转移动态,为规划、强化学习和数据增强提供"内部仿真器"。可大幅减少真实机器人交互成本。代表作:DreamerV3、Genie、PlayWorld。
深度融合趋势
2025-2026年的核心趋势:World Model 作为 RL 训练环境为 VLA 后训练,潜在空间 CoT 替代文本 CoT,VLA 策略与 WM 迭代协同改进。
经典奠基论文(2018–2024)
- 2018 World Models (Ha & Schmidhuber):首次提出"世界模型"概念——VAE 感知 + MDN-RNN 记忆 + 控制器,在梦境中训练 Agent。
- 2019 DreamerV1 (RSSM):引入循环状态空间模型,在潜在空间想象中进行 model-based RL。
- 2020 DreamerV2:引入离散潜在变量,Atari 上首次达人类水平的 model-based RL。
- 2022-04 SayCan (Google):用 LLM 规划 + 价值函数评估可执行性,奠定"语言模型用于机器人"范式。
- 2022-09 RT-1 (Google):大规模机器人 Transformer,130k episode,验证数据规模对泛化的决定性作用。
- 2023-01 DreamerV3 (DeepMind):统一超参在 7 类基准全部 SOTA。
- 2023-03 PaLM-E (Google):562B 具身多模态大模型。
- 2023-07 RT-2 (DeepMind)
VLA 命名起源:"Vision-Language-Action"概念正式提出。 - 2024-02 Genie (DeepMind):从无标注视频自监督训练可交互世界模型。
- 2024-06 OpenVLA (Stanford/Berkeley):开源 7B VLA,成为标准基线。
- 2024-10 π0 (Physical Intelligence):通用机器人 VLA,Flow Matching 连续动作。
2025 年新经典工作(节选)
- GR00T N1 (NVIDIA):开源人形机器人基础模型,双系统(快/慢)架构。
- Gemini Robotics (DeepMind):基于 Gemini 2.0 的机器人基础模型。
- V-JEPA 2 (Meta):自监督视频模型,机器人操作规划超越 GPT-4o。
- CoT-VLA:视觉链式思维,先预测未来图像再生成动作。
- π0.5 (PI):开放世界通用 VLA,高级 VLM 推理 + π0 灵巧控制。
- DreamVLA:融合世界知识的 VLA,视频扩散生成未来想象帧作辅助训练信号。
WM + VLA 深度融合(2025–2026 最热方向)
核心范式:用真实数据训练世界模型 → 在世界模型中进行 RL 后训练 VLA → 无需大量真实机器人交互。代表:WoVR、VLAW、RISE、AtomVLA、World2Act、DreamVLA。
趋势分析
- WM 成为 VLA 后训练标配:WoVR / VLAW / RISE / AtomVLA 密集爆发。
- 潜在空间 CoT 替代文本 CoT:Chain of World、LaST-VLA、DynVLA、CoT-VLA。
- 3D / 空间感知注入:GST-VLA、FutureVLA 将深度/高斯结构引入 token。
- 自动驾驶 VLA 热潮:DynVLA、StyleVLA、EvoDriveVLA、SAMoE-VLA。
- 推理效率优化:DepthCache、WorldCache、Planning in 8 Tokens、FAST tokenizer。
- 神经科学 / 符号融合:SaiVLA 三部件架构、NS-VLA、GR00T N1 双系统。
- 通用基础模型竞争:π0 / π0.5、Gemini Robotics、GR00T N1。
- 视频数据 × 机器人学习:Genie、EnerVerse、V-JEPA 2。
关键方法对比
| 方法类型 | 代表工作 | 核心思路 | 主要优势 |
|---|---|---|---|
| 端到端 VLA | RT-2, OpenVLA, π0 | 预训练 VLM + 动作预测头 | 强泛化、语言指令跟随 |
| 经典 WM (RSSM) | DreamerV1/2/3 | 潜在空间状态转移 + 潜在空间 RL | 样本效率高、无需稠密奖励 |
| 生成式 WM | Genie, DIAMOND, EnerVerse | 扩散/生成式视频 + 动作条件化 | 逼真渲染、可交互仿真 |
| WM for RL | WoVR, VLAW, GigaBrain | 世界模型仿真 → RL 训练 VLA | 无需大量真实机器人交互 |
| 潜在动态 CoT | Chain of World, DynVLA | 预测潜在动态 → 条件化动作 | 减少语义-感知鸿沟 |
| 空间增强 VLA | GST-VLA, FutureVLA | 几何/深度结构注入 token | 提升 3D 操作精度 |
| 持续学习 VLA | Simple Recipe, DexHiL | RL 微调 / 人机协同后训练 | 适应新任务无灾难遗忘 |
| 层级规划 WM | MetaWorld-X, H-WM | 高层语义规划 + 低层运动执行 | 长程任务分解与执行 |
| 通用基础模型 | π0, GR00T N1, Gemini Robotics | 大规模多形态预训练 | 跨平台泛化、零样本迁移 |
注:本综述共收录 79+ 篇论文(含 VLA、World Model、WM+VLA 融合、自动驾驶/导航 World Model、LingBot 系列等完整列表与对比表),完整内容请见 原文链接。
物界前沿