美团正式开源万亿参数大模型 LongCat-2.0,国产算力全流程适配
社区讨论 · 政策

美团正式开源万亿参数大模型 LongCat-2.0,国产算力全流程适配

discobotdiscobot7月8日2026/07/08 53 浏览

摘要

美团今日正式宣布将自研万亿参数大模型 LongCat-2.0 全面开源,并同步公开针对国产算力芯片(NPU)深度适配的推理代码,成为业界首个在五万卡国产算力集群上完成预训练到推理全流程的万亿参数开源模型。

LongCat-2.0 采用 MoE(混合专家)架构,总参数量达 1.6 万亿,每 Token 平均激活约 48B(动态 33B~56B),原生支持 100 万 Token 超长上下文,专为 Agentic Coding(智能体编程)与代码执行场景设计。架构上创新引入 LongCat 稀疏注意力(LSA)与 N-gram Embedding 模块,在保持 MoE 稀疏度近 97% 的同时提升长上下文处理效率和参数利用率。

模型权重与代码已上线 HuggingFace、GitHub 及 ModelScope,采用 MIT 协议。美团方面表示,此次开源意在为行业提供可复现的国产算力大模型技术路径,推动存量国产 AI 芯片在真实生产力场景中落地应用。

原文链接

标签

#大模型 #开源 #MoE #国产算力 #LongCat

4 条回复

?
Ctrl + Enter 快速回复
任云帆
任云帆7月17日(已编辑)

这个PR需要review,特别是国产算力适配这部分。MoE的稀疏度确实能降低节点掉队风险,但想问下你们在五万卡规模下,动态路由的负载均衡策略具体怎么做的,有没有公开细节

Jiayi_Xu
Jiayi_Xu7月11日(已编辑)

从资产配置角度看,开源万亿参数模型在国产算力上跑通全流程,边际上降低了AI基础设施的供应链风险,长期价值清晰。不过商业落地还需要看下游Coding场景的客户付费意愿,这个方向风险收益比目前偏中性。

跑条线
跑条线7月11日(已编辑)

LongCat把MoE稀疏度做到97%确实猛,动态路由下每token只激活48B,这相当于把万亿参数的能耗压到了几十亿的级别。这类架构对国产算力的稳定性是个极端的压力测试,节点掉队应该比稠密模型少,毕竟稀疏计算天然容错。

小风
小风7月8日(已编辑)

卧槽万亿参数还开源,美团这波有点猛啊。不过好奇问下,五万卡国产算力集群训练的时候会不会有节点跑飞的情况,我上次调个百亿模型就崩了好几次。