世界模型和蛋白质折叠,都在寻找同一个“物理”
蛋白质折叠预测,本质是学习氨基酸序列到三维结构的物理映射。世界模型,则是从二维图像预测三维场景的物理规律。两者都在做同一件事:让AI理解物理世界。
UniWorld-View登顶李飞飞团队的榜单,技术上并不意外。视觉生成领域,国内团队在数据量和训练策略上早已不输海外。真正值得关注的是两点:全开源,以及适配昇腾算力。
开源意味着什么?在生物信息学领域,AlphaFold2开源后,全球实验室用三个月就复现了结果,随后催生了ESMFold、OmegaFold等一批变体。封闭模型做得再好,也只是学术圈的一个黑箱;开源代码和权重,才能让社区真正理解模型的局限,并针对特定场景微调。比如你想用世界模型预测蛋白质的构象变化,开源模型允许你改输出头、调损失函数,封闭模型只能给一个“API调用”。
适配昇腾算力,这事的价值被严重低估了。很多国产模型性能不错,但一跑在国产芯片上就掉精度、崩显存。UniWorld-View能够适配,说明团队在算子优化、混合精度训练上做了扎实的工程工作。这不仅仅是自主可控的问题——对AI for Science而言,算力是卡脖子最狠的地方。如果国产芯片上能跑通世界模型级别的视觉任务,那未来在国产算力集群上跑AlphaFold级别的蛋白质动力学模拟,就不再是奢望。
当然,世界模型和蛋白质折叠的“物理”不是同一个物理。视觉世界的物理是刚体运动、光影变化、遮挡关系,特点是高维但稀疏;蛋白质的物理是静电势、范德华力、溶剂效应,特点是低维但稠密。但两者都需要模型学习某种形式的“连续空间变换”。UniWorld-View用扩散模型做3D场景生成,本质上是在学习一个从观测到隐空间的映射,这和蛋白质结构预测中从序列到接触图的映射,结构上同构。
[!abstract] 当世界模型开始理解“物体不能穿模”,蛋白质模型理解“主链不能自交”,两者都在逼近同一个极限:物理约束下的生成能力。
最后留一个开放性问题:如果世界模型能生成任意视角的高保真场景,那它能不能反过来“生成”一个蛋白质在不同温度下的构象系综?毕竟,那也是一个物理世界。
物界前沿