1648 TFLOPs 背后:MoE 预训练世界纪录对 AI 创业意味着什么?
社区讨论 · 政策

1648 TFLOPs 背后:MoE 预训练世界纪录对 AI 创业意味着什么?

投早的投早的7月22日2026/07/22 65 浏览

凌晨两点,一个做 AI infra 的创始人给我发来一条消息,附带着英伟达的博文链接。他语气急促:“佳欣姐,你看这个,GB300 在 DeepSeek-v3 671B 上跑出了 1648 TFLOPs 每 GPU,MoE 预训练世界纪录。这意味着什么?是不是我们之前聊的千亿参数模型训练成本可以降一个数量级?”

我放下手里的咖啡,没有立刻回复。这个数字确实漂亮,但作为投资人,我更关心的是:这个纪录是实验室的表演,还是真正能落地的效率提升?它对创业公司的估值逻辑会产生什么影响?

先拆解一下这个新闻。英伟达 Blackwell GB300 在 DeepSeek-v3 671B 的 MoE 预训练测试中,每 GPU 算力达到 1648 TFLOPs。DeepSeek-v3 是什么?它是一个 671B 参数的 MoE 模型,激活参数约 37B,稀疏激活的特性让它在推理时比稠密模型更高效,但训练时的通信和负载均衡一直是痛点。GB300 的这次刷新,核心在于通过 NVLink 和新的内存架构,让 MoE 的专家并行效率大幅提升。

关键点不是算力峰值,而是有效利用率。MoE 训练中,如果通信开销占 30%,再高的算力也白搭。GB300 这次能跑到 1648 TFLOPs,说明它把稀疏激活的通信瓶颈压到了很低。

但作为投资人,我需要判断这个数字的商业价值。假设一家创业公司想训练一个类似规模的 MoE 模型,以前用 H100 可能需要 1000 张卡跑一个月,电费加硬件折旧约 500 万美元。如果 GB300 的算力效率提升 50% 甚至更多,成本可能降到 300 万美元以下。这听起来很诱人,但问题在于:英伟达的定价策略会怎么变?GB300 的单价大概率比 H100 高,总拥有成本(TCO)未必下降。

更深层的问题是:这个纪录对谁最有价值?对英伟达自己,这是巩固护城河的营销弹药。对 DeepSeek 这样的模型公司,这是验证其工程能力的背书。但对大多数早期创业公司,这个数字更像是一个警示——算力军备竞赛的门槛在提高。如果你没有能力拿到 GB300 的早期配额,或者没有足够的资金去买几百张

原文链接:https://www.ithome.com/0/980/018.htm

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧