社区讨论 · 政策

124B参数对标1T模型,蚂蚁百灵打了一场效率战争

高总高总7月26日2026/07/26 61 浏览

从参数规模竞赛到推理效率竞争,这条拐点来得比预期更早。蚂蚁集团百灵大模型发布的Ling-3.0-flash,以124B总参数量对标上一代1T级旗舰Ring-2.6-1T,参数规模缩减到12%,但能力宣称持平甚至局部超越。这不是一次简单的模型迭代,而是对整个团队技术路线和工程组织能力的检验。

先说一组数据:Ling-3.0-flash原生混合推理,124B参数,激活参数未公开但推测在30-40B量级;Ring-2.6-1T是1T参数,推理成本至少相差一个数量级。如果官方宣称的性能对标成立,这意味着蚂蚁团队在模型架构、训练策略和推理优化上完成了一次系统级的效率跃迁。对于任何负责100人以上AI团队的管理者,这个案例都值得拆解。

从参数规模到推理效率,模型架构的范式转变

过去两年,行业共识是“大力出奇迹”——更大参数、更多数据、更长的训练时间。但Ling-3.0-flash的路径完全不同。它采用原生混合推理架构,把传统Transformer和稀疏化、模块化设计结合,让模型在推理时只激活必要部分,而非全量参数。124B总参数,实际推理时激活的只是其中一小部分,这解释了为什么能用十分之一的参数量达到接近的智能水平。

从管理角度看,这代表技术路线的根本选择。如果团队还在追逐单一大模型参数量的排行榜,那说明组织考核指标还停留在“论文级”的虚荣指标上。蚂蚁这次选择的是“工程级”指标——单位推理成本下的效果增益。这背后是团队对ROI的清醒认知:部署一个1T模型,服务器成本、电力成本、延迟成本都是天文数字,而客户真正买单的是推理时延和准确率,不是参数量。

我们的团队在商汤做AI平台时,也面临过类似选择。当时内部争议是“要不要堆100B以上的稠密模型”,后来我们选择了MoE架构,把混合专家模型作为主力方向。原因很简单:算力预算有限,但客户对推理延迟敏感。蚂蚁的Ling-3.0-flash证明了这条路不仅可行,还能在更小的参数规模下实现更强能力。这给所有AI基础设施团队一个信号:别再迷信参数规模,去算算推理成本。

蚂蚁的工程化优势:组织能力才是护城河

124B参数对标1T,技术上不容易,组织上更难。这种级别的模型迭代,需要算法、工程、数据、推理优化四个团队深度协同。蚂蚁的支付和金融业务场景,对模型可靠性要求极高,这意味着他们在模型压缩、量化、蒸馏等方面的工程积累必须非常扎实。

我注意到一个细节:Ling-3.0-flash的能力对标的是“上一代旗舰”。这意味着蚂蚁没有采用“堆参数-降精度-再优化”的螺旋式开发,而是直接以一个小模型去挑战大模型的能力边界。这种策略对团队执行力要求极高——算法团队要设计高效的稀疏架构,工程团队要优化分布式训练和推理部署,数据团队要精选高质量数据而非盲目投喂。任何一个环节拖后腿,最终效果都会打折。

从组织层面看,蚂蚁这次发布还隐含了一个信息:他们有能力在一年内完成从1T到124B的架构换代,同时保持能力不降。这背后是技术团队的成熟度——不是依赖少数天才,而是靠系统和流程保证输出质量。对于技术VP来说,这种“可复用的工程能力”比模型本身更值钱。模型可以迭代,但组织能持续产出高质量模型的能力,才是真正的护城河。

混合推理模型的战略意义:成本与体验的平衡

Ling-3.0-flash的定位是“原生混合推理模型”,这意味着它在同一套架构中同时支持快速推理和深度思考。用户简单问题走快速通道,复杂问题启动更多推理资源。这对业务场景价值巨大:蚂蚁的支付、信贷、风控等场景,既有高并发低延迟的实时请求,也有需要深度推理的复杂决策。一个模型版本覆盖所有场景,运维成本大幅降低。

从战略视角看,这个模型让蚂蚁在AI基础设施的选型上占据了主动权。如果Ling-3.0-flash真的能覆盖Ring-2.6-1T大部分场景,那么蚂蚁后续的模型部署成本可以降低80%以上,同时释放出来的算力可以支持更多垂直场景的定制化微调。这对一个追求商业落地的公司来说,是比参数排行榜更实在的竞争力。

站在团队管理角度,我特别关注这个模型对人才结构的影响。过去做大模型需要大量底层算法研究员,现在更多需要的是懂工程优化和系统架构的工程师。蚂蚁这次释放的信号是:如果你想在AI领域做管理,别只盯着论文和参数,去算算你团队的单位算力产出,去想想怎么用更少的资源做更多的事。

一句话总结:百灵Ling-3.0-flash证明,在AI基础设施的竞争里,工程效率比参数规模更能决定长期胜负。

原文链接:蚂蚁集团发布百灵原生混合推理模型 Ling-3.0-flash:124B 总参数量,能力对标上一代旗舰 Ring-2.6-1T - IT之家

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧