Token暴增的真相:英伟达的护城河,是AI厂商的利润黑洞
这篇文章最有价值的信息是:Token调用量暴增千倍,但绝大部分利润被英伟达的硬件和生态锁死,而不是大模型厂商或云服务商。作为每天和模型部署、推理优化打交道的工程师,我试着从落地角度拆解这个困局。
先看数据。豆包一家日均180万亿Token,全国日均超140万亿,两年内从零到千倍增长。这数字让投资人兴奋,让媒体高潮,但真正跑过生产环境的都知道:每一笔Token调用背后,都是真金白银的GPU算力成本。我们团队在部署一个7B模型时,每百万Token的推理成本大约0.2-0.5美元(取决于batch size和量化方案),而市面上大模型API的定价已经卷到0.02-0.05元/千Token。这意味着什么?推理成本远高于售价,厂商每卖一单都在亏钱。
为什么利润困在英伟达?因为当前整个AI基础设施的底座是英伟达的CUDA生态和H100/B200系列GPU。训练阶段,一张H100的采购成本约3-4万美元,一个千卡集群就是几千万美元。推理阶段,虽然可以用更便宜的A100甚至T4,但为了支撑高并发和低延迟,仍然需要大量英伟达GPU。更关键的是,替代方案在工程落地时处处是坑。AMD的MI300X理论性能不错,但ROCm生态的兼容性、算子库的成熟度、以及主流框架(PyTorch、TensorRT)的优化程度,都远不如英伟达。我们团队试过在MI300X上跑LLaMA推理,同样的量化策略,吞吐量比H100低30%,而且偶尔出现不明原因的coredump。自研芯片(如寒武纪、华为昇腾)在特定场景有优势,但通用性、开发者工具链、社区支持都差一个量级。切换到非英伟达硬件,意味着要重新编写算子、适配框架、调试性能,这些隐性成本足够让大多数团队望而却步。
那有没有出路?从工程视角看,有几个方向值得关注。
第一,推理优化。这是目前最务实的路径。通过模型量化(INT4/INT8)、剪枝、蒸馏、KV cache优化、动态batch等手段,可以把推理成本降到原来的十分之一甚至更低。但问题在于,这些优化技术高度依赖英伟达的TensorRT和CUDA核心库,本质还是在英伟达的围城里跳舞。厂商一边优化,一边给英伟达的生态贡献案例,帮助英伟达完善软件栈,形成更强的锁定。
第二,硬件多元化。谷歌的TPU、亚马逊的Trainium、微软的Maia都试图摆脱英伟达,但这些芯片只服务于自家云服务,不会开放给第三方购买。对于独立大模型公司和中小企业来说,唯一的现实选择是租用云厂商的英伟达GPU,或者买二手A100。而云厂商(AWS、Azure、GCP)也在赚英伟达的差价:他们以批发价采购GPU,再以按需价格出租,毛利率高达30-50%。所以利润其实在英伟达和云厂商之间分配,模型厂商只是搬砖的。
第三,模型架构变革。当Transformer的推理成本高到离谱时,Mamba、RWKV等线性注意力机制开始被关注。这些架构在长序列推理上能大幅降低计算量,但训练不稳定、堆叠效果差、社区生态弱,短期内无法替代Transformer。而且,即便换了架构,硬件优化依然绕不开英伟达。
最后揭晓我的观点:Token暴增是假象,利润困在英伟达是现实,而且这个困局在未来2-3年内无解。 原因在于,英伟达的护城河不仅是硬件,更是CUDA生态、TensorRT、NeMo等全套软件工具链,以及围绕这些工具链形成的开发者习惯。任何试图突破的厂商,都需要同时解决硬件、软件、生态三个问题,这几乎是不可完成的任务。对于AI应用公司来说,唯一能做的就是在推理成本上精细化管理,同时期待模型压缩技术和硬件进步能带来成本下降曲线。
但有一个更根本的问题值得思考:当Token成本趋近于零时,AI应用的价值链会如何重构? 如果推理不再昂贵,那么模型本身的价值会贬值,数据和场景的价值会凸显。届时,英伟达的垄断地位是否会被边缘化?这个问题,留给评论区讨论。
物界前沿