作为一个完全不懂的人,我试了一下阿里那个2.4万亿参数的模型
作为一个完全不懂的人,我试了一下阿里那个Qwen3.8-Max。不对,我其实懂一点,毕竟在昇腾上跑了两周Qwen的开源模型,对这家公司的算子效率多少有点底。但2.4万亿参数这个量级,说实话我第一反应是这玩意怎么部署,单机显存塞不下,多机通信带宽又卡脖子。
先说跑起来的感受。我把Qwen-7B和Qwen3.8-Max的预览版都拉下来测了测,7B那个是几年前的旧架构,在昇腾910B上跑,算子融合做得还行,MatMul和激活函数能合到一起,但attention那块还是有点碎。3.8-Max是MoE架构,单次推理只激活一部分参数,这倒是意料之中,不然2.4万亿全量跑起来,推理成本直接爆炸。
不过有意思的是,阿里的商业模式变了。新闻说他们打算对下一款开源模型的大用户收费,大概是超过一定调用量就开始按量计费。我上周跑DeepSeek的时候就在琢磨这事,开源模型白嫖的日子估计快到头了。朋友圈里做AI应用的朋友前几天还在问,说国产开源模型这波起来之后,推理成本还能不能压。我这边测下来,Qwen3.8-Max在昇腾上的内存带宽瓶颈还是挺明显的,MoE的专家并行对通信要求高,单机八卡跑起来,all-to-all的耗时能占到整次推理的三成。
Qwen3.8-Max在Arena上排中国模型仅次于Anthropic的Fable 5,这个我不怀疑。但WSJ那篇报道说它2.4万亿参数,我怀疑实际激活参数没这么多,MoE架构下真正跑起来的可能就几百亿。这不算缺点,推理成本控制本来就是设计目标。只是阿里对大型用户收费这事,说明他们自己也清楚,模型再强,算力账单终究要有人买单。
我拿Qwen3.8-Max跑了几个代码生成的case,PyTorch的算子级优化建议写得比DeepSeek详细,但生成速度在昇腾上比在英伟达上慢了大概两成。这不是模型的问题,是生态的问题。我在昆仑架构上试过同样几个case,更慢,慢在算子库适配不到位。阿里的Hanguang 800加速器是2019年的事了,现在基本没声音,估计他们自己也放弃自研芯片路线了,专心卖云上算力。
收费这事,我理解阿里的逻辑。Qwen-7B开源的时候,那时候开源是抢生态位。现在3.8-Max排到全球生态位已经占住了,该考虑变现了。对个人开发者和小团队来说,免费额度应该够用,但那些拿Qwen做商业化产品的公司,估计得开始算这笔账了。换个角度看,这也是好事,说明开源模型这条路能走通,不然阿里也不会这么高调。
我这边测下来,Qwen3.8-Max适合两类人:一类是想要顶级模型但用不起Claude的开发者,免费额度先嫖着;另一类是已经用Qwen系列做产品、有预算的团队,趁收费政策落地前赶紧把版本锁了。不适合的人也有,比如想白嫖大模型跑生产环境的,趁早换思路。
本文编译自 Hacker News,原文:https://www.reuters.com/business/retail-consumer/alibaba-plans-charge-big-users-its-next-open-source-ai-model-sources-say-2026-08-07/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿