
蚂蚁百灵这步棋,比DeepSeek更狠
上周五深夜,一位在阿里云做架构的朋友给我发来一张截图,说团队内部对Ling-3.0-Flash的讨论炸了锅。124B参数,激活5.1B,推理成本骤降70%。我问他,这不就是MoE的变种吗?他说,不是,这是原生混合推理,不是路由门控那一套。
我打开数据,用SWOT框架拆了一下。
S(优势):单次计算激活5.1B,相当于用GPT-2的算力跑出接近GPT-4的推理能力。对标海外,Mistral的Mixtral 8x22B激活约39B,Ling-3.0-Flash的激活量只有它的13%。效率提升不是渐进式,是断崖式。
W(劣势):124B全量参数在训练阶段依然需要海量算力。蚂蚁百灵没有公开训练成本,但按行业经验,这个规模至少需要数千张H100跑几周。中小团队无法复现,生态依赖度可能变成短板。
O(机会):混合推理模型天然适合长文本、多轮对话和复杂推理。蚂蚁的支付、信贷、保险场景里,用户咨询动辄上千字上下文,Ling-3.0-Flash的推理速度能直接改善用户体验。更重要的是,小激活模型可以部署在端侧,蚂蚁的IoT设备、线下POS机都能跑,这比云端API更贴近用户触点。
T(威胁):DeepSeek的MoE架构已经跑通,推理成本压到每百万token 0.5元。Ling-3.0-Flash虽然效率更高,但蚂蚁缺少to C的流量入口,不像字节有豆包,腾讯有混元。没有场景喂数据,模型的持续迭代和用户反馈闭环就卡住了。
对比两个路线:DeepSeek的MoE靠路由门控做稀疏计算,蚂蚁的混合推理是模型原生做任务分解——推理时自动判断用快思考还是慢思考,类似人类大脑的System 1和System 2。这个思路不新鲜,Google的Gemini 2.0也提过,但蚂蚁拿出了产品落地。
我关注的是算力经济学。模型总参数124B,激活5.1B,这意味着推理时的内存带宽需求降低,延迟可以压缩到单卡可处理。如果蚂蚁能把这个模型塞进一台手机,那才是真正的杀手锏。对标海外,苹果的端侧模型AIML只有3B参数,Ling-3.0-Flash的激活量是5.1B,但苹果有A18芯片,蚂蚁有谁?
最后问一个问题:蚂蚁百灵这个模型,是打算卖API还是做产品?如果是前者,面对已经卷到每万token几分钱的公有云市场,它的差异化优势在于长文本和复杂推理,但这一块客户群太窄。如果是后者,蚂蚁需要造一个自己的“豆包”或者“文心一言”,用模型能力反哺支付宝的搜索和客服。但支付宝的DAU已经触顶,用户打开它不是为了聊天。
蚂蚁百灵的策略很清晰:用技术绕过传统大模型的算力瓶颈,但出路不在技术,在场景。没有场景,再好的模型也是空中楼阁。
直接收住,不总结。
原文链接:https://www.qbitai.com/2026/07/461149.html
物界前沿