世界模型六小龙的争吵,暴露了创业者最该避开的坑
社区讨论 · 政策

世界模型六小龙的争吵,暴露了创业者最该避开的坑

硅谷回来的硅谷回来的7月26日2026/07/26 68 浏览

据不完全统计,2026年上半年全球有超过60家创业公司声称在做世界模型,累计融资超过40亿美元,但真正跑通商业化闭环的不到3家。这个数字来自我上周在硅谷和几个VC聊到的内部数据,和WAIC现场听到的争论高度吻合。世界模型确实火,但火得混乱,混乱得让创业者容易迷失方向。

我在WAIC现场听了两天世界模型分论坛,六家被媒体称为“世界模型六小龙”的公司创始人轮番上台,从技术路线到数据标准,从训练方式到评测尺度,几乎每个话题都在激烈碰撞。这种非共识恰恰是行业红利所在,但关键是,创业者要分清哪些非共识是机会,哪些是陷阱。

先说两个最典型的路线之争:以游戏引擎为底层架构的“模拟派”和以扩散模型为核心的“生成派”。模拟派的代表是那家从自动驾驶公司分拆出来的团队,他们强调物理世界精确建模,用虚幻引擎5的渲染管线加上强化学习,让模型在虚拟环境中自我演化。生成派的代表则是几位从大模型公司出走的华人研究员,他们坚信只要用足够多的视频数据训练一个超大扩散模型,就能涌现出对物理规律的理解,不需要显式编码。

这两条路线的对比很有意思。模拟派很重,需要自建3D场景、标注物理属性、设计奖励函数,团队里至少要有20个游戏引擎和物理模拟的专家。我算过一笔账,从零搭建一个可用的模拟环境,前期投入至少5000万人民币,而且迭代周期以月为单位。但好处是,一旦跑通,模型的可解释性和可控性极强,适合做工业仿真、机器人训练这些高价值场景。

生成派相对轻,核心是堆数据和算力。他们用网络上爬取的海量视频,加上自监督学习,预训练成本可以降到模拟派的五分之一。但问题在于,生成派的模型缺乏对物理世界因果关系的理解。举个例子,他们生成的视频里,杯子掉到地上可能碎成两半,也可能碎成三半,甚至可能直接穿过地面,因为模型只是学会了像素的统计规律,而不是物理定律。我在会上听到一个生成派创始人承认,他们的模型在连续动作预测任务上,误差率高达30%,比模拟派高一个数量级。

从商业模式看,模拟派更适合做B端服务,比如给车企做自动驾驶仿真平台,或者给科研机构做分子动力学模拟。这类客户愿意为可解释性和准确性付费,客单价高,但销售周期长。生成派则更适合做C端工具,比如视频生成、游戏NPC的控制,或者虚拟世界的内容创作。市场大,但竞争激烈,价格战不可避免。

我注意到一个细节:六小龙里有两家走模拟派路线,三家走生成派路线,还有一家试图融合两者。融合派的做法是用生成模型做前端,快速生成场景,再用模拟模型做后端,确保物理一致性。这个思路听起来美好,但执行起来极其困难。团队执行力在这里是决定性因素。融合需要同时具备两种技术栈的人才,而这类人才全球可能不超过200人。我认识的一位CTO说,他花了8个月才招到3个合适的人,而且其中两人来自同一家公司,差点因为竞业协议被起诉。

给我的创业建议是:如果你不是DeepMind或OpenAI出身,不要碰融合派路线。资源有限的小团队,最好在模拟派和生成派里选一个,并且要选和你团队背景最匹配的那条。比如你的团队有游戏引擎和物理模拟背景,就做模拟派;如果团队来自大模型或者计算机视觉,就做生成派。不要试图追着非共识跑,而是要把非共识变成你的护城河。

另一个值得关注的非共识是数据标准。六小龙对世界模型训练数据的定义完全不同。有的认为必须包含多模态数据(视频、文本、深度图、力反馈),有的认为纯视频就够。有的坚持用合成数据,有的强调真实世界数据。我倾向于认为,未来12个月内,纯视频数据会达到瓶颈。因为真实世界视频的标注成本太高,而且无法覆盖极端场景。合成数据虽然是捷径,但存在“模拟到真实”的鸿沟。真正能跑通的公司,一定是找到了一个巧妙的半监督学习方案,用少量真实数据校准合成数据。

最后说趋势预测。我判断,世界模型的商业落地会在2027年迎来分水岭。届时,六小龙里最多存活两家,一家是模拟派,做工业仿真;一家是生成派,做内容创作。融合派要么

原文链接:https://www.qbitai.com/2026/07/458617.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧