社区讨论 · 政策

World Model & VLA 论文综述 (2018–2026)

叶炳良叶炳良7月7日2026/07/07 229 浏览

本文转载自 song2yu.github.io,版权归原作者所有。点击查看 原文链接。


World Model & Vision-Language-Action 论文综述 (2018–2026)

:date: 整理日期:2026-03-29 :page_facing_up: 收录论文:79+ :magnifying_glass_tilted_left: 来源:ArXiv · HuggingFace :one_o_clock: 覆盖范围:2018–2026

领域概述

:robot: VLA 主线

以预训练语言/视觉大模型为骨干,直接从多模态观测预测机器人动作。强调零样本泛化、语言指令跟随与多任务通用性。代表作:RT-2、OpenVLA、π0、Gemini Robotics。

:globe_showing_europe_africa: World Model 主线

建模环境状态转移动态,为规划、强化学习和数据增强提供"内部仿真器"。可大幅减少真实机器人交互成本。代表作:DreamerV3、Genie、PlayWorld。

:link: 深度融合趋势

2025-2026年的核心趋势:World Model 作为 RL 训练环境为 VLA 后训练,潜在空间 CoT 替代文本 CoT,VLA 策略与 WM 迭代协同改进。

经典奠基论文(2018–2024)

  • 2018 World Models (Ha & Schmidhuber):首次提出"世界模型"概念——VAE 感知 + MDN-RNN 记忆 + 控制器,在梦境中训练 Agent。
  • 2019 DreamerV1 (RSSM):引入循环状态空间模型,在潜在空间想象中进行 model-based RL。
  • 2020 DreamerV2:引入离散潜在变量,Atari 上首次达人类水平的 model-based RL。
  • 2022-04 SayCan (Google):用 LLM 规划 + 价值函数评估可执行性,奠定"语言模型用于机器人"范式。
  • 2022-09 RT-1 (Google):大规模机器人 Transformer,130k episode,验证数据规模对泛化的决定性作用。
  • 2023-01 DreamerV3 (DeepMind):统一超参在 7 类基准全部 SOTA。
  • 2023-03 PaLM-E (Google):562B 具身多模态大模型。
  • 2023-07 RT-2 (DeepMind) :star: VLA 命名起源:"Vision-Language-Action"概念正式提出。
  • 2024-02 Genie (DeepMind):从无标注视频自监督训练可交互世界模型。
  • 2024-06 OpenVLA (Stanford/Berkeley):开源 7B VLA,成为标准基线。
  • 2024-10 π0 (Physical Intelligence):通用机器人 VLA,Flow Matching 连续动作。

2025 年新经典工作(节选)

  • GR00T N1 (NVIDIA):开源人形机器人基础模型,双系统(快/慢)架构。
  • Gemini Robotics (DeepMind):基于 Gemini 2.0 的机器人基础模型。
  • V-JEPA 2 (Meta):自监督视频模型,机器人操作规划超越 GPT-4o。
  • CoT-VLA:视觉链式思维,先预测未来图像再生成动作。
  • π0.5 (PI):开放世界通用 VLA,高级 VLM 推理 + π0 灵巧控制。
  • DreamVLA:融合世界知识的 VLA,视频扩散生成未来想象帧作辅助训练信号。

:fire: WM + VLA 深度融合(2025–2026 最热方向)

核心范式:用真实数据训练世界模型 → 在世界模型中进行 RL 后训练 VLA → 无需大量真实机器人交互。代表:WoVR、VLAW、RISE、AtomVLA、World2Act、DreamVLA。

趋势分析

  • WM 成为 VLA 后训练标配:WoVR / VLAW / RISE / AtomVLA 密集爆发。
  • 潜在空间 CoT 替代文本 CoT:Chain of World、LaST-VLA、DynVLA、CoT-VLA。
  • 3D / 空间感知注入:GST-VLA、FutureVLA 将深度/高斯结构引入 token。
  • 自动驾驶 VLA 热潮:DynVLA、StyleVLA、EvoDriveVLA、SAMoE-VLA。
  • 推理效率优化:DepthCache、WorldCache、Planning in 8 Tokens、FAST tokenizer。
  • 神经科学 / 符号融合:SaiVLA 三部件架构、NS-VLA、GR00T N1 双系统。
  • 通用基础模型竞争:π0 / π0.5、Gemini Robotics、GR00T N1。
  • 视频数据 × 机器人学习:Genie、EnerVerse、V-JEPA 2。

关键方法对比

方法类型 代表工作 核心思路 主要优势
端到端 VLA RT-2, OpenVLA, π0 预训练 VLM + 动作预测头 强泛化、语言指令跟随
经典 WM (RSSM) DreamerV1/2/3 潜在空间状态转移 + 潜在空间 RL 样本效率高、无需稠密奖励
生成式 WM Genie, DIAMOND, EnerVerse 扩散/生成式视频 + 动作条件化 逼真渲染、可交互仿真
WM for RL WoVR, VLAW, GigaBrain 世界模型仿真 → RL 训练 VLA 无需大量真实机器人交互
潜在动态 CoT Chain of World, DynVLA 预测潜在动态 → 条件化动作 减少语义-感知鸿沟
空间增强 VLA GST-VLA, FutureVLA 几何/深度结构注入 token 提升 3D 操作精度
持续学习 VLA Simple Recipe, DexHiL RL 微调 / 人机协同后训练 适应新任务无灾难遗忘
层级规划 WM MetaWorld-X, H-WM 高层语义规划 + 低层运动执行 长程任务分解与执行
通用基础模型 π0, GR00T N1, Gemini Robotics 大规模多形态预训练 跨平台泛化、零样本迁移

注:本综述共收录 79+ 篇论文(含 VLA、World Model、WM+VLA 融合、自动驾驶/导航 World Model、LingBot 系列等完整列表与对比表),完整内容请见 原文链接。

3 条回复

?
Ctrl + Enter 快速回复
独立潘
独立潘7月29日(已编辑)

DreamerV3的收敛慢其实在真实机器人上挺明显,我自己写了个小工具跑过几轮,感觉潜在空间CoT这块确实缺开源实现。GrootV1和RoboFlamingo的论文里也提过类似思路,但没看到完整代码库

老范
老范7月13日(已编辑)

潜在空间CoT这个方向我在做电驱控制时也关注过,目前开源实现较少,但π0的论文里提到了类似思路,可以看看他们的thinking token设计。

墨墨
墨墨7月8日(已编辑)

这个综述整理得挺全。DreamerV3那篇我复现过,统一超参确实省事,但实际拿来做真实机器人交互时收敛速度还是差强人意。想问下深度融合趋势里提到的潜在空间CoT替代文本CoT,具体有看到哪些开源实现或代码库支持吗