社区讨论 · 政策

世界模型分级,像极了自动驾驶那场事先张扬的争吵

硅谷回来的硅谷回来的8月24日2026/08/24 86 浏览

自动驾驶当年搞L0到L5分级的时候,行业吵了整整三年。有人说分级是忽悠投资人,有人说没有分级大家连话都聊不到一块去。结果呢,分级成了行业通用的坐标系,大家嘴上骂着,身体都很诚实。这次生数科技在WRC上提出通用世界模型五级发展路线,我第一反应就是这个。先别管每一级画得准不准,至少有人敢把“世界模型”这四个被用烂了的字,切成能对齐的台阶了。

我的结论放前面:这个五级路线图本身不是重点,重点是它把行业从“拼演示”逼向了“拼落地路径”。而真正决定生死的,不在第五级,在第二级到第三级之间那条谁都不愿意细说的沟。

先说第一级到第二级。视频生成、环境模拟,这些本质上是“把未来画出来”。生数做视频生成出身,从文生视频往世界模型上走,这个路线有天然的台阶。Motubrain把环境理解、状态预测和动作轨迹生成统一进同一个模型,从“视觉推演”迈向“物理决策”,这一步我信。 convertion视频生成模型已经证明了自己能学会物理世界的表象,水面波纹、布料褶皱、光影变化,这些像素级的规律被网络记住了。但记住表象和推演因果,中间隔着一条很远的路。世界模型真正的价值,就像无界动力现场说的那句话,不在于把未来画出来,而在于推演行动后果。画得再真,如果推演是错的,那机器人就是拿着一个精美的错误剧本在物理世界里乱撞。

所以第二级到第三级,就是从“预测下一个画面”到“预测动作带来的后果”。这一跳,视频生成那条路上的老本行帮不上太多忙了。我自己做过硬件,知道这里面的坑在哪。画面预测错了,大不了生成一段奇怪的视频,人类看一眼就删了。但动作预测错了,机械臂在真实产线上砸下去,那就是工伤和设备损失。我上个月写过一篇世界模型六小龙的争吵,当时觉得大家吵的是技术路线,现在看了生数这个分级,回头想,那篇稿子里最核心的公司其实都在做同一件事:把预测能力变成决策能力。只是有人从视频走,有人从机器人的动作轨迹走,有人从强化学习的奖励信号走。

大晓机器人那个“理解—推演—执行—反思”的闭环,本质上也是在补这一段。执行失败后自主定位问题、调整策略,这个能力比会炒菜、会端咖啡的demo稀缺得多。但是我也得泼盆冷水,展台上那个预测画面先于机械臂实际动作发生的演示,我看了资料里写的细节,确实漂亮。可demo是demo,产线是产线。从能预测,到能决策,再到能在真实环境里持续决策而不错,这中间隔着的不是算法问题,是数据闭环和场景工程问题。团队执行力在这里比模型创新重要得多。

从创业视角看,这就有意思了。五级路线作为技术框架没问题,但商业模式上,每一级对应的市场和付费意愿完全不一样。第一级的视频生成,市场已经卷成红海,按分钟按条收费,毛利在往下走。第五级的通用具身智能,那是五年甚至十年后的红利,现在讲这个故事只能拿去融资,不能拿来开工资。真正难的是中间这段:模型比第一级聪明,但还没到第五级那么通用,这时候谁愿意付钱,付多少钱,这才是要命的问题。

我前几年在硅谷见了太多这样的团队,模型做得很漂亮,发布会开得很热闹,回头一看没有客户。这次WRC上经济观察网那篇观察说得挺准,机器人行业的马拉松,第二个五公里比的是场景。世界模型也一样。技术分级是学术叙事,但落到创业公司,每一级都得对应一个能收钱的具体场景。生数能把路线图画出来,说明团队想清楚了方向。但想清楚方向不等于走得到,中间那条第二级到第三级的沟,需要拿真实场景里的脏数据、真实的客户投诉、真实的部署事故一点点填平。我这边测下来,这类模型在结构化的环境里表现尚可,一旦环境变量一多,掉链子的频率还是让人睡不踏实。

还有个容易被忽略的点。生数这次发布的路线图里,数据、架构、算力三大要素,架构排在中间。但架构层面的统一,图像、视频、语言、动作进同一个模型,这在学术上是很顺的故事,工程上却是巨大的妥协。打个比方,一个公司里既要写代码的人懂供应链,又要供应链的人懂销售,听起来全能,实际上每个人的专业深度都可能被稀释。统一架构能成,但代价是每一块都不如专用模型强。这个代价在实验室里看不出来,在客户现场会被无限放大。我自己受过的教训是,通用性是个听起来很美、用起来很贵的词。

往后看两三年,我觉得世界模型会从现在的“五级路线图”这种学术叙事,快速收敛成几个具体的商业故事。谁能把第二级到第三级之间的路,在一个垂直场景里走通,拿到真实客户的复购合同,谁就有资格谈第四级。真正的分水岭不是参数量,也不是demo的流畅度,是数据闭环的深度。这个判断不一定对,但我拿我过去做硬件的经验担保,方向大概率没错。

最后说一句,生数这个路线图,比大多数停留在“我们有个很厉害的世界模型”的公司强,至少把话说明白了。但说明白只是第一步,后面每一步都是硬仗。

2 条回复

?
Ctrl + Enter 快速回复
一鸣
一鸣8月24日

生成视频那部分我倒是真折腾了一阵子,像素级规律确实学得不错,但一到要它做决策就露馅了……第二到第三级那条沟,感觉比L2到L3还深。

阿杰
阿杰8月24日

第二到第三级那条沟真是说得太到位了,我最近跑AI也是这感觉,表象学得比谁都像,一推因果就现原形……