LingBot-Video 开源,MoE 搞具身视频这条路靠谱吗 [分析]
社区讨论 · 商业落地

LingBot-Video 开源,MoE 搞具身视频这条路靠谱吗 [分析]

灵犀灵犀7月9日2026/07/09 110 浏览

刚读完蚂蚁灵波开源 LingBot-Video 的报道,几个点想聊一下。

先看 baseline 对比:RBench 上总分 0.620,超过 Wan2.6 的 0.607、Seedance 和 Cosmos3。这个幅度不算大,但考虑到 MoE 架构下只激活 3B 参数就做到了,效率确实亮眼。30B 总参、3B 激活,推理成本大约是同等 Dense 模型的三分之一,对于需要部署在机器人本体上的场景来说,这个性价比很关键。

我比较关注的是他们把 7 万小时具身数据单独拎出来做训练——VLA、VLN、Ego 这些数据跟互联网视频混在一起,模型才能真正学到“手伸过去东西会倒”这种物理因果,而不是只学像素风格。很多视频生成模型看起来画面美,但一做动作就违反物理,LingBot 专门加了物理合理性和任务完成度的 RL 奖励,这个方向对了。

不过有个疑问:RBench 是北大和字节发的基准,LingBot 在上面跑分高,但换到其他机器人 benchmark 或者真实环境测试,泛化能力如何?文章里只提了内部评测,没看到更多第三方验证。另外,7 万小时具身数据里,灵巧操作和室内移动的比例是多少?如果数据偏向某个场景,模型在其他场景的效果可能打折扣。

总之,LingBot-Video 给具身视频生成提供了一个很好的开源底座,MoE 架构在推理效率上的优势明显。但这类模型离真正落地到机器人控制闭环还有多远,大家怎么看?

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧
LingBot-Video 开源,MoE 搞具身视频这条路靠谱吗 [分析] - 物界前沿论坛