社区讨论 · 政策

算力过剩是个伪命题

飞控少年飞控少年7月11日2026/07/11 94 浏览

核心判断:算力过剩不是总量问题,而是结构错配和调度效率的问题。Meta卖算力、Anthropic买算力,这两件事放在一起看,恰恰说明算力市场正在经历一场“去泡沫化”的筛选。

从工程视角来看,算力从来不是“够不够用”的二元问题。做嵌入式系统这么多年,我见过太多“算力过剩”的争论——比如有人说手机芯片性能过剩,可放到无人机飞控上,IMU数据融合的实时性要求一上来,CPU利用率分分钟飙到90%以上。所谓的“过剩”,只是你还没找到那个对延迟敏感、对吞吐量有硬约束的应用场景。

Meta出售“多余AI算力”这件事,如果只看表面,确实容易得出“算力开始过剩”的结论。但拉长时间轴看,Meta在2022年就大规模采购了H100,当时正值大模型军备竞赛初期,各家都在疯狂囤货。现在Meta想卖,更多是资产配置优化——有的卡利用率低,有的卡被新架构替代,不如变现。这和当年比特币矿机买卖的逻辑一样,矿工不是不需要算力,而是算力折旧太快,需要不断换新设备。

而Anthropic签下190亿美元、20年的数据中心租约,才是真正的信号。这笔钱不是买显卡,是买长期稳定的算力供给,附带整栋数据中心的基础设施。20年租约意味着什么?意味着对方认为未来20年,算力需求只会增长,不会萎缩。如果算力真的过剩,他们完全可以去现货市场低价租用,没必要锁死20年现金流。

两个事件放在一起,更合理的解释是:算力市场正在从“野蛮囤货”转向“精细化运营”。Meta卖的是“冗余资产”,Anthropic买的是“确定性产能”。这就像工厂里,有人把闲置的数控机床卖掉,有人却花大价钱签下长期供电合同——侧重点完全不同。

作为飞控工程师,我习惯把问题拆解成“实时性要求”和“平均吞吐量”。AI训练和推理对算力的需求结构差异极大。训练需要的是大规模并行计算,对延迟不敏感,但要求高吞吐;推理尤其是边缘推理,对延迟敏感,对算力密度和功耗有严格约束。Meta卖掉的算力,很可能是针对训练场景的通用GPU,而Anthropic需要的是能支撑推理集群的稳定算力池。这两者根本不是同一类东西。

还有一个容易被忽略的细节:算力本身的利用率。现在的GPU集群,尤其是分布式训练场景,实际算力利用率并不高。我见过一些团队,用8000卡集群训练模型,但通信开销占掉40%的时间,算力利用率只有60%。如果算力真的过剩,应该先优化调度算法,提高利用率,而不是直接卖卡。Meta选择卖卡,恰恰说明他们觉得“优化调度”的成本比“卖卡换现金”更高,或者他们内部有更急迫的现金流需求。

从工程可行性角度,算力过剩这个命题本身就很难成立。因为芯片制程和架构的进步速度,目前还跟不上模型参数和推理负载的增长速度。GPT-4的参数规模是1.8万亿,GPT-5可能更大。哪怕算力每年翻倍,也未必能追上模型规模的增长。更不用说自动驾驶、机器人、工业AI这些场景,对实时算力的需求是无限的。

所以我的建议是:别被“算力过剩”这种宏观叙事带偏。如果你在做AI基础设施相关的工作,多关注算力分布的微观结构——哪些场景需要低延迟、哪些场景需要高吞吐、哪些场景对功耗敏感。把算力当成一种资源调度问题,而不是总量库存问题。真正该焦虑的,不是算力太多,而是你的算力有没有被用在正确的地方。


原文链接:算力过剩是个伪命题-钛媒体官方网站

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧