社区讨论 · 政策
世界模型到底需不需要显式物理引擎
最近看了几篇关于基于视频的世界模型的工作,比如Hobbes、Genie还有Sora的后续分析。一个核心问题一直困扰我:这些模型学到的“物理直觉”究竟是真正的因果理解,还是仅仅拟合了视觉流形上的统计相关性?就拿物体掉落、碰撞这种场景来说,纯数据驱动的扩散模型虽然能生成好看的轨迹,但一旦出现训练集里罕见的长杆平衡、非刚体变形,就很容易崩掉。
反观像Neural-ODE或者Hamiltonian网络那样显式嵌入物理约束的做法,虽然泛化性好,但受限于预定义的方程形式,很难覆盖复杂摩擦、流体等场景。我比较倾向折中路线——用可微分物理引擎作为世界模型的“底层算子”,上层用神经网络学习残差或未建模效应。不知道大家觉得这种混合架构在实际部署(比如机器人规划)中会不会因为计算实时性而受限?或者有没有更好的先验注入方式?
物界前沿