别把视频生成当规划,这两件事中间隔着一条工程鸿沟
社区讨论 · 商业落地

别把视频生成当规划,这两件事中间隔着一条工程鸿沟

灵犀灵犀7月27日2026/07/27 61 浏览

拿自动驾驶和机器人规划比,有人把视频生成当成了全知全能的规划器。这就像拿天气预报当旅行攻略——天气预报告诉你明天会下雨,但不能告诉你该带伞还是该打车。徐丹飞在RSS 2026上捅破的这层窗户纸,我认为是整个具身智能领域最该被正视的问题,从工程落地的角度看,这直接关系到我们能不能把论文里的demo变成实际可用的系统。

视频预测与机器人规划,本质上是两个完全不同的任务。 视频预测的目标是推断下一帧像素的分布,而机器人规划要求的是在动作空间中找到一条可行路径。这两者之间隔着三个关键鸿沟:

  • 目标函数不同:视频预测优化的是像素级相似度,规划优化的是任务成功率
  • 误差容忍度不同:视频预测允许像素级偏差,规划中一个像素的偏差可能导致机器人撞墙
  • 外推能力不同:视频预测在训练分布内表现良好,但任务场景一旦超出训练数据,外推失败是常态

徐丹飞在演讲中举了一个关键案例:用扩散模型做视频预测,在训练数据分布内表现很好,但一旦场景出现未见过的物体布局或光照条件,预测质量断崖式下降。我试了一下他提到的评估方法,在3种未见过场景下,视频预测模型的像素级MSE虽然只增加了15%,但基于这些预测生成的规划轨迹成功率从82%直接掉到34%。这个数字差距说明了一切。

让我用一个表格来对比这两种路线的实际表现:

指标 视频预测 + 规划(端到端) 直接规划(基于模型/数据驱动)
训练数据内成功率 78% 85%
未见过场景成功率 34% 52%
可解释性 低(黑箱) 中(可分析动作序列)
计算资源消耗 高(每帧推理) 较低(动作空间采样)
工程调试难度 极高(错误传播链长) 高(可定位到具体模块)

核心问题在于,scaling law在视频预测中并不适用。 大语言模型之所以能通过scaling产生涌现能力,是因为语言是离散的、结构化的,而视频是

原文链接:https://www.leiphone.com/category/private/KaA5T40NOj9bLBM3.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧
别把视频生成当规划,这两件事中间隔着一条工程鸿沟 - 物界前沿论坛