
自研芯片:大模型公司的成本困局与路线分歧
从原理上讲,大模型公司集体“造芯”并非偶然。我们不妨先理解一个简单概念:大模型推理的算力消耗是训练阶段的数百倍,而且每天24小时持续发生。当Claude展现出惊人的长文本理解能力时,其背后的计算需求已经逼近传统CPU-GPU架构的经济性边界。据估算,维持Claude等前沿模型千万级日活用户的推理,每天仅芯片折旧成本便可能高达数十万美元。这种持续失血的财务模型,迫使Anthropic不得不向供应链上游突围。
目前行业呈现出两条截然不同的自研路线。一条以Anthropic为代表,选择与三星这样的传统半导体巨头接洽,在现有成熟工艺上做定制化设计(ASIC方向)。另一条以OpenAI、Google为代表,押注全自研架构(如OpenAI的“Triton”芯片,Google的TPU),试图从底层体系结构上重构计算模式。两条路线背后,是对“芯片与算法融合深度”的不同判断。
我们先看Anthropic的选择。与三星合作意味着可以利用其先进的3纳米制程和成熟的封装技术,在HBM内存集成、数据传输带宽等关键指标上快速达到可用水平。但缺点是:三星的芯片设计团队必须深度理解Claude的算子特性和长上下文推理模式,这种跨组织的知识迁移成本极高。从学术研究角度看,这类似于在一个预训练好的模型上做微调——你可以快速获得性能提升,但无法触及根本性的效率瓶颈。
而OpenAI的路线更像是从零开始设计全新网络架构。他们正在开发的芯片据传采用了“近内存计算”和“可重构数据流”等激进技术,试图让计算单元与存储单元之间的物理距离缩短到极限。这种设计一旦成功,能把Transformer推理中占比极大的注意力计算(attention)的能耗降低一个数量级。但代价是研发周期至少3-5年,且短期内无法有效支撑现有模型迭代。
[!quote] 据估算,维持Claude等前沿模型千万级日活用户的推理,每天仅芯片折旧成本便可能高达数十万美元。
这段引用背后揭示了一个残酷事实:即便Anthropic的策略相对保守,它也必须面对时间窗口的压力。三星的定制化芯片从设计到流片通常需要18-24个月,而在此期间,Claude的日活用户数可能再翻十倍。折旧成本将不是数十万,而是数百万美元一天。这种指数级增长的算力成本,已经超出了任何通过优化模型参数或蒸馏可以解决的问题范畴。
我注意到一个有趣的现象:在计算机视觉领域,类似的自研芯片浪潮其实早在2015年就已出现。当时Mobileye、华为海思等公司为视觉识别专门设计神经网络处理器(NPU),但最终绝大多数方案在通用性上败给了GPU。今天的区别在于:大语言模型的计算模式相对统一(以Transformer为基础),这让定制化芯片的回报预测更具确定性。你可以把TPU类比为视觉领域的ISP(图像信号处理器),而通用GPU则类似CPU。当算法收敛时,专用芯片的性价比优势不可逆转。
从实验设计角度思考,Anthropic与三星的合作可以看作一个“对照实验”。对照组是依赖现有GPU(如H100或B200)进行推理的OpenAI,实验组是采用定制化芯片的Anthropic。衡量指标包括:每token能耗、单位算力成本、推理延迟等。如果实验组能在同等模型能力下将成本降低40%以上,那么整个行业的芯片策略将被迫转向。
回到核心判断:大模型公司集体造芯的本质,不是技术竞赛,而是成本结构倒逼的战略调整。我倾向于将这两条路线总结为“渐进式定制”与“激进式重构”的对比。Anthropic的选择更像一种防御性举措——在现有供应链中寻求最优解,避免被单一供应商(如NVIDIA)锁喉。而OpenAI的路线则是进攻性布局——试图通过芯片创新重新定义算法与硬件的接口,从而建立远超对手的效率优势。
需要注意的是,这两条路线并非互斥。Anthropic在接洽三星的同时,也可能在内部孵化更激进的芯片设计团队。但现实约束在于,一家以AI安全为使命的公司,能否同时支撑两个高强度的硬件研发项目?从组织管理角度看,这相当于让一个计算机视觉实验室同时做目标检测和语义分割——资源分散可能导致两者都做不精。
最后,我给出一个核心观点:在这场芯片自研竞赛中,胜出的关键不在于谁先流片成功,而在于谁的芯片设计能更早地与其模型算法达成“共生迭代”。Anthropic与三星的谈判,本质上是在寻找一个可以接受定制化需求的合作伙伴;而OpenAI的独立研发,则是试图把算法演进的主导权完全攥在自己手中。两种策略都有其合理性,但最终决定行业走向的,是那个能最快把“芯片折旧成本”从数十万美元降到数千美元的方案。
原文链接:https://www.tmtpost.com/8064257.html
物界前沿