晶圆级芯片的翻身仗:OpenAI的200亿美元赌注
我注意到一个有意思的细节。Cerebras这家公司,几年前还在被半导体圈内当作“技术怪胎”来讨论——一整张晶圆不做切割,直接当一块芯片用,听起来像极了硅谷工程师喝多了之后的脑洞。但今年,OpenAI签了一份合同,把这家公司的产能几乎买断了三年。合同金额?外界估算超过200亿美元。
200亿美元是什么概念?相当于AMD一年多的研发投入。一家做“怪胎”芯片的公司,突然成了AI算力大战里的关键角色。这背后,不只是技术路线的胜利,更是整个AI基础设施逻辑的转变。
“晶圆级芯片的关键不是单个晶体管的尺寸,而是互联带宽。当模型大到需要数千张GPU互联时,通信瓶颈比计算瓶颈更致命。”——一位芯片架构师在行业会议上这么说。
一张晶圆就是一块芯片
传统芯片制造,是把一块晶圆切成几十到几百颗小芯片,每颗只有指甲盖大。然后把这些小芯片封装、再拼成系统。但Cerebras的做法很极端:不切。直接拿一整块直径300毫米的硅片,做出一颗超级芯片。这颗芯片面积超过46000平方毫米,是普通GPU的五十倍以上。
好处显而易见。芯片内部互联的速度,比芯片之间通过电路板传输快几个数量级。当AI模型大到需要几千张GPU互联时,数据在卡与卡之间“绕路”的时间,比计算本身还长。Cerebras的晶圆级芯片,相当于把整个数据中心的计算节点,全部塞进了一颗芯片里。内部带宽是传统方案的几百倍,延迟也低到几乎可以忽略。
但代价也是巨大的。一块晶圆上哪怕有一个微小缺陷,整颗芯片就会报废。早期良率低得吓人,Cerebras花了好几年才把缺陷容忍技术做到实用。几年前,它还在靠小众的科研客户和军方订单过活。谁能想到,它会成为OpenAI的“救命稻草”。
OpenAI为何押注
OpenAI面临的核心问题,不是算力不够,而是算力太慢。训练GPT-5这样的模型,需要上万张GPU并行。但GPU互联的瓶颈,导致大量时间浪费在等待数据同步上。据说,OpenAI的工程师曾经抱怨,某些训练任务中,GPU有超过一半的时间在“空转”——等数据从其他卡传过来。
Cerebras的晶圆级芯片,虽然单颗算力不如H100,但它的互联优势让大规模并行训练的效率大幅提升。更关键的是,它不需要像英伟达那样用昂贵的NVLink和InfiniBand网络来连接。Cerebras的方案,一块晶圆就是一台超级计算机,省去了大量网络设备和能耗。
OpenAI这200亿美元,买的不是现有算力,而是未来三年内,能在不依赖英伟达的情况下,快速扩展训练规模的能力。 英伟达的GPU产能已经被全球抢光,排队等货要一年以上。而Cerebras的晶圆级芯片,用的是台积电较成熟的工艺节点,产能相对宽松。对OpenAI来说,这是“多一条腿走路”的战略选择。
另外,Cerebras的芯片在推理任务上也有独特优势。大模型推理时,需要把整个模型参数加载到芯片上。普通GPU显存有限,不得不把模型切分到多张卡上,再次遇到通信瓶颈。而晶圆级芯片的片上存储容量惊人,可以一次性装下千亿参数模型,推理延迟极低。这对OpenAI的实时应用(比如ChatGPT响应速度)来说,是实实在在的竞争力。
晶圆级芯片的隐忧与未来
不过,这条技术路线并没有想象中那么完美。Cerebras的芯片每颗功耗高达15千瓦,是普通GPU的几十倍。散热方案极其复杂,需要定制液冷系统。而且,一旦芯片出现故障,整个系统要停机更换——不像传统集群,坏一张卡可以随时替换。
但更大的限制在于,晶圆级芯片的商业模式高度依赖单一客户。OpenAI一旦转向自研芯片,或者未来模型架构变化,Cerebras可能面临订单断崖。所以,Cerebras真正的挑战,不是技术,而是如何把OpenAI的赌注,变成整个行业的共识。
目前来看,趋势已经明朗。除了Cerebras,特斯拉也在研究晶圆级芯片,用于自动驾驶训练。国内也有创业公司在尝试类似路线。晶圆级芯片从“怪胎”变成了“备选方案”,甚至可能成为“标配”。
我的判断是:未来三年,晶圆级芯片将占据AI训练推理芯片市场至少10%的份额。它不会取代英伟达,但会彻底改变“算力=GPU”的单一叙事。当一家公司愿意为一块芯片付出200亿美元,说明这个行业,正在变天。
物界前沿