当AI推理的“秒”被拆成毫秒,算力霸权开始松动
社区讨论 · 政策

当AI推理的“秒”被拆成毫秒,算力霸权开始松动

龙记龙记7月24日2026/07/24 87 浏览

你有没有想过,为什么AI聊天机器人回答问题时总会有那么一瞬间的“卡顿”?那种看似自然的停顿,背后其实是算力与延迟之间的一场持久战。当业界还在为GPU集群的算力军备竞赛焦头烂额时,AMD和Cerebras却悄悄把目光投向了另一个战场:低时延。我的结论很简单:这条新闻不是一次普通的合作,它可能正在改写AI推理的底层逻辑——从“算得够快”转向“算得够省、够即时”。

先看事实。在Advancing AI 2026活动上,AMD宣布与Cerebras联手,打造面向超低延迟AI推理的联合解决方案。官方新闻稿提到,每瓦每秒Token吞吐量提升了5倍。这个数字乍看像参数堆砌,但如果你拆开来看,它指向的是AI推理领域一个长期被忽视的痛点:功耗和延迟的跷跷板。

[!quote] 根据官方新闻稿,该方案主要针对超低延迟AI推理场景,将整合AMD的CPU与Cerebras的晶圆级芯片(WSE-3)。

Cerebras是什么?它是一家做“晶圆级引擎”的另类芯片公司,把一整块晶圆做成一个巨型芯片,专为AI训练和推理设计。而AMD的CPU和GPU组合,在数据中心里早已是主流。这次合作,本质上是用Cerebras的“大内存+高带宽”架构,去补足AMD在推理延迟上的短板。

为什么延迟这么重要?因为AI推理正在从“批处理”走向“在线服务”。想想自动驾驶、实时翻译、金融交易这些场景,哪怕多一毫秒的延迟,都可能造成事故或损失。而传统GPU推理有个硬伤:显存带宽有限,模型参数需要频繁在内存和计算单元之间搬运,导致延迟和功耗双高。Cerebras的WSE-3直接把整个模型塞进片上SRAM,省去了数据搬运的环节,延迟自然大幅下降。

但更值得关注的,是“每瓦每秒Token吞吐”这个指标。它把功耗和性能绑在一起评估,意味着在同样的电量下,这套方案能处理更多推理请求。现在数据中心最大的成本不是硬件,而是电费。NVidia的H100、B200虽然算力惊人,但功耗也惊人,从350W到700W甚至更高。而Cerebras的WSE-3单芯片功耗在15kW级别,但它的吞吐量远超同功耗的多GPU集群。如果5倍提升属实,那么对于超级数据中心来说,这意味着在同样电费预算下,可以服务更多用户,或者降低每用户成本。

从行业趋势来看,AMD这一招有点“曲线救国”的味道。它很清楚,在训练领域,NVidia的CUDA生态和算力霸权几乎不可撼动。但在推理领域,尤其是低时延场景,格局尚未定形。Cerebras的架构天然适合推理时延敏感型任务,比如LLM的实时生成、图像生成等。AMD通过整合自己的CPU和Cerebras的WSE,实际上是在构建一个异构计算方案:CPU负责控制流和预处理,WSE负责密集计算,两者通过高速互联(比如Infinity Fabric)通信。这有点像当年苹果用M系列芯片的“统一内存”理念,把CPU和GPU在物理上更紧密地耦合。

但问题也来了。这种方案是否足够通用?Cerebras的芯片庞大而昂贵,只适合特定的大规模推理场景,比如大模型的服务端部署。对于中小型模型或边缘设备,它可能并不适用。而且,NVidia也在推出自己的低时延推理方案,比如TensorRT-LLM,配合Grace Hopper超级芯片,同样在优化延迟和功耗。所以,这场竞赛的胜负远未确定。

[!tip] 一个关键变量:软件生态。AMD有ROCm,Cerebras有自己的CSL(Cerebras Software Language),两者如何协同?如果开发者需要额外学习一套新的编程模型,采纳门槛就会很高。

写到这里,我想到一个更本质的问题:我们真的需要所有AI推理都做到“超低延迟”吗?对于聊天机器人,几百毫秒的延迟用户可能感知不到;但对于自动驾驶,10毫秒的延迟就是生死之差。AMD和Cerebras押注的,显然是后者——那些对延迟极度敏感、且愿意为“即时性”支付溢价的应用。这可能是AI从“实验室玩具”走向“工业基础设施”的关键一步。

最后,我想留一个开放性问题:当算力不再只是“每秒浮点运算次数”的军备竞赛,而是“每瓦每秒有效Token”的精细较量,传统的芯片巨头们是否要

原文链接:https://www.ithome.com/0/981/112.htm

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧