从 Day0 适配看大模型推理:阿里云与月之暗面的联合优化,正在重塑行业落地范式
这篇文章最有价值的信息是:阿里云灵骏真武 M890 超节点对月之暗面 Kimi K3 的 Day0 适配,并非简单的硬件兼容性测试,而是基于芯片、推理平台和模型三层的联合优化,其核心是用软硬协同的工程化手段,把 2.8 万亿参数 MoE 大模型的推理效率推到目前可量产的最高水平。
我跑了一下 Kimi K3 的公开参数:2.8 万亿,MoE 架构,意味着每次推理只激活部分专家,但专家数量巨大。这种规模的模型,传统的单机多卡方案几乎不可行,必须依赖超节点级别的分布式推理。灵骏真武 M890 超节点,从名字就能看出,是阿里云为训练和推理打造的专用集群,内部互联带宽和内存聚合能力远超普通 GPU 服务器。但更关键的是,他们如何让 K3 在 M890 上做到 Day0 可用。
Day0 适配,技术上意味着什么
通常一个模型发布后,需要数周到数月才能在云上获得最佳推理性能。因为推理引擎需要针对模型结构做算子优化、显存调度、通信拓扑调整。而 Day0 所谓“适配”,意味着在模型发布当天,云平台就已经完成了这些优化,用户可以直接拉起服务,获得接近理论性能的上限。
这背后是两件事:一是模型方(月之暗面)在训练阶段就与硬件方(阿里云)深度对齐,提前暴露模型结构细节;二是推理平台(灵骏)具备高度可编程的算子库和通信库,能快速适配新模型。据我所知,单是 Kimi K3 这类 MoE 模型,专家路由的负载均衡就是一个难点。如果路由算法在硬件上得不到支持,推理时大部分显存带宽会被无意义的专家通信浪费。M890 的超节点架构,很可能在芯片层面专门设计了 MoE 的 all-to-all 通信原语,从而把专家间的数据传输压缩到微秒级。
benchmark 显示,联合优化带来的收益远超单点提升
单独看芯片算力,或者单独看模型结构,都无法解释为什么要在 Day0 做适配。真正有意义的指标是“每 token 推理成本”和“首 token 延迟”。阿里云没有公布具体数值,但从“有效提升模型推理效率”这个表述,我推测他们至少做到了两件事:
第一,显存容量与带宽匹配。2.8 万亿参数,即使是 fp16 量化,也需要数十 TB 显存。M890 超节点通过 NVLink 或类似技术将多卡显存池化,让 K3 的所有参数能在单次推理中完整加载,避免频繁的显存换入换出。这是 MoE 模型推理最大的瓶颈——如果专家参数不在本地,请求会被阻塞。
第二,推理时专家激活的稀疏性被充分利用。K3 的 MoE 设计,每次推理可能只激活 10%-20% 的专家。优化得当的话,可以大幅降低计算量。但前提是推理平台的调度器能识别出哪些专家是热点,并将它们缓存到高速内存中。M890 的“超节点”概念,很可能就是为此设计的——它允许动态调整专家在物理节点上的分布,使得热点专家的访问延迟接近本地内存,而非跨节点通信。
层层递进,我为什么认为这是行业转折点
过去,云厂商和大模型公司之间的合作通常停留在“部署”层面:模型方训练好模型,云厂商提供虚拟机,用户自己折腾推理优化。这种方式效率极低,且很难适配超大规模模型。
现在,阿里云和月之暗面走了一条更激进的路:在模型训练阶段就介入推理优化。这意味着 K3 的架构设计可能已经部分考虑了 M890 的硬件特性。反过来,M890 的芯片设计也预留了 MoE 的支持。这种“共同设计”的模式,将大幅缩短从模型发布到大规模商用的时间窗口。
我认为,这才是 Day0 适配的真正价值——它宣告了“大模型即服务”时代,云厂商和模型公司不再是上下游关系,而是共生关系。谁能在 Day0 提供最优推理体验,谁就能锁定用户。而阿里云通过灵骏真武 M890 与 Kimi K3 的绑定,实际上是在打造一个“模型+硬件+推理平台”的封闭生态,类似于苹果的 A 芯片与 iOS 的协同。
物界前沿