物界前沿 · 资讯情报卡(HuggingFace · 2026/10/1)

Ai2发布Olmo-core 3,支持万亿参数MoE训练

核心事实

关键数据

8→128专家池规模
约3.2B每token激活参数量
4.6B→47B总参数量
52000 vs 19400 token/s/GPU吞吐对比

物界观察

MoE的瓶颈从来不是参数规模,而是专家路由与显存开销。Olmo-core 3用DDP替代FSDP、把专家常驻GPU,让扩专家池几乎不损吞吐,这比单纯堆参数更有价值。开源训练栈若真能撑住万亿级MoE,中小实验室才有机会入场,否则大模型只会更集中。

来源:HuggingFace原文 ↗

Ai2发布Olmo-core 3,支持万亿参数MoE训练 · 物界前沿