
算力泡沫:一台AI服务器,三成干活,七成演戏
如果把AI行业比作一座金矿,那么过去两年,所有人都在疯狂地挖矿、买矿机、囤矿机。英伟达的H100、B200是“顶级铲子”,数据中心是“矿井”,算力租赁是“矿工”。但最近,一个令人不安的事实浮出水面:矿井里挖出来的矿石,纯度低得可怜。
WAIC 2026现场,多位行业人士给出一个数字:不到30%。这意味着,一台AI服务器交付到用户手中后,真正被有效利用的算力,可能连规格表上数字的三成都不到。换句话说,70%的算力在空转,在演戏,在变成电费和噪音。
这不是某一家企业的片面之词。不同领域的芯片企业,从GPU厂商到定制化AI芯片公司,不约而同地把话题从“峰值算力”转向了“有效算力”。一场关于“算力利用率”的暗战,正在揭开AI行业光鲜表面下的裂痕。
为什么算力利用率这么低?
要理解这个数字,得先拆解“算力利用率”这个概念。它不是一个简单的百分比,而是一组复杂工程指标的加权平均。我采访了多位算力中心运维工程师,他们给出了一个更精细的分解:
| 环节 | 典型损耗 | 占比 |
|---|---|---|
| 模型训练中的通信开销 | 数据在GPU之间传输的等待时间 | 15%-25% |
| 内存带宽瓶颈 | 数据搬不动,计算单元闲置 | 20%-30% |
| 任务调度碎片化 | 多个小任务无法填满整张卡 | 10%-20% |
| 软件栈兼容性 | 框架、驱动、库版本不匹配 | 5%-10% |
| 电力与散热限制 | 供电不足或过热降频 | 5%-15% |
这些损耗叠加起来,最终有效利用率落在20%-35%之间,中位数约28%。这就是“不到30%”的真相。
更扎心的是,这还不是最坏的情况。在一些中小型AI公司,有效利用率可能低至10%以下。因为他们买的GPU卡型不对,或者软件栈没调好,甚至只是为了“攒卡”给投资人看。
谁在掩盖这个数字?
这个问题触及了AI产业链上每个环节的利益。GPU厂商卖的是“峰值算力”,这是他们定高价的锚点。如果告诉客户“你买回去只能用到30%”,那定价体系会瞬间崩塌。云服务商租赁算力,按“卡时”收费,算力利用率越低,客户需要租的卡越多,云厂商反而赚得更多。AI创业公司需要用算力堆估值,告诉投资人“我的算力利用率只有20%”,融资故事就讲不下去了。
于是,三方默契地维持着一个“数字默契”:公开场合谈峰值算力,私下里吐槽利用率。只有真正做落地的工程师,每天面对空转的GPU,心里清楚这笔账有多亏。
算力利用率是“先有鸡还是先有蛋”的问题
有人会说,利用率低是因为模型还没跑起来,等大模型应用普及了,自然就填满了。这个逻辑成立吗?
我查了几家头部大模型公司的训练日志。GPT-4级别模型的训练利用率,实际在40%-50%之间,这已经是非常高的水平了。但到了推理阶段,利用率骤降。因为推理请求是稀疏的、突发的,GPU必须时刻待命,无法像训练那样连续满负荷运转。推理场景的算力利用率,普遍低于15%。
AI落地的主力场景——对话、搜索、推荐——都是推理密集型。这意味着,就算大模型全面铺开,整体算力利用率也不会显著提升。反而可能因为“预制算力”(为了应对突发流量提前部署的闲置资源)增加,导致利用率进一步走低。
谁在真正解决利用率问题?
行业里出现了几股暗流。第一,软件优化公司开始崛起。比如一些做算子融合、内存加速的初创企业,声称能把利用率提升15%-20%。第二,异构计算方案被重新重视。CPU、GPU、NPU、FPGA混搭,让不同任务跑在最合适的硬件上。第三,算力调度平台从“卖卡”转向“卖服务”,按实际完成的计算量计费,而不是按卡时收费。
但最值得关注的,是开源社区的动作。一些顶级AI实验室正在公开训练日志和效率工具,试图把“利用率”这个指标透明化。一旦透明,潮水就会退去,谁在裸泳一目了然。
趋势预测:2027年,算力利用率将成为一个公开的KPI
我的判断是:未来18个月内,算力利用率将成为AI行业的核心竞争指标,就像云计算的“服务器利用率”一样。届时,GPU厂商会推出“实际算力利用率”的评测工具,云服务商会把“利用率承诺”写进SLA,AI公司会在融资路演中主动展示“有效算力占比”。
- 那些把算力堆在仓库里当摆设的公司,会最先被市场淘汰。
- 那些能通过软件优化把利用率从30%拉到50%的团队,将获得超额回报。
- 最终,AI行业的估值逻辑会从“有多少算力”转向“用多少算力”,从“算力规模”转向“算力效率”。
这口气,迟早要喘上来。只是在这之前,会有很多假装在挖矿的矿机,先被抬出矿井。
原文链接:https://www.tmtpost.com/8074363.html
物界前沿