谷歌TPU向Neocloud递出橄榄枝,英伟达的“AI云根据地”不再稳固
这篇文章分析的核心判断是:谷歌向Neocloud推销TPU,表面上是卖芯片,实际上是借新兴云服务商撬动英伟达在AI算力市场的垄断地位。这不是一次简单的商务拓展,而是云巨头在AI芯片战场上的“侧翼渗透”。
消息来自The Information的报道:谷歌正积极向Neocloud(即主营AI业务的新兴云服务商)推销其自研TPU。这些Neocloud企业通常完全依赖英伟达GPU提供算力租赁服务。谷歌的做法,相当于直接向英伟达的“核心用户群”发出邀请——用更低的成本、更开放的生态来换取合作。
但这背后有更深层的逻辑。Neocloud并非传统云厂商,它们不搭建通用云平台,而是专门为AI训练和推理提供GPU集群。这类企业高度依赖英伟达CUDA生态和硬件供应,而英伟达的GPU长期供不应求,价格高昂。谷歌看准的正是这个痛点。
为什么Neocloud会成为谷歌的突破口
Neocloud是一个特殊的市场角色。它们不像AWS、Azure那样拥有庞大的自研芯片能力,也不像大模型公司那样自建数据中心。它们的存在价值在于快速提供大规模GPU集群,让中小客户不用处理硬件采购和运维的麻烦。
但Neocloud面临一个结构性问题:英伟达GPU的获取成本极高,且供应受英伟达直接控制。当英伟达优先供应大客户时,Neocloud往往拿不到足够货源。英伟达也在通过自己的云服务(如DGX Cloud)直接争夺客户。这导致Neocloud的毛利率被挤压,商业模式脆弱。
谷歌的TPU恰好填补了这个缺口。TPU是谷歌专为TensorFlow等框架设计的AI加速器,在训练大模型时效率很高。虽然早期TPU生态封闭,只服务谷歌自家业务,但近年来谷歌逐步开放TPU云服务,并支持JAX、PyTorch等主流框架。更重要的是,谷歌愿意以较低价格向Neocloud提供TPU算力,甚至可能提供定制化方案。
[!note]
谷歌的策略核心不是卖芯片,而是卖“算力+生态”。Neocloud如果采用TPU,就能获得比英伟达GPU更经济的算力,同时降低对单家供应商的依赖。这是典型的“借力打力”。
谷歌TPU的真正优势在哪里
很多人认为TPU的劣势在于生态不如CUDA成熟。但谷歌的TPU v5p和即将推出的Trillium系列,在特定场景下已经展现出惊人性能。根据谷歌公开数据,TPU v5p在训练大型语言模型时,相比上一代性能提升2倍,并且能效更高。对于Neocloud来说,能效意味着更低的电力成本,这是数据中心运营的重要支出。
此外,谷歌TPU与Google Cloud深度绑定,可以提供无缝的存储、网络扩展。Neocloud如果使用TPU,可以直接接入谷歌的全球网络和数据中心基础设施,这比自建GPU集群更省心。
但最关键的是定价策略。英伟达H100 GPU的租赁价格长期居高不下,市场价一度超过每小时3美元。而谷歌TPU的定价通常低30%-50%。对于Neocloud来说,如果能够用TPU替代部分英伟达GPU,就能显著提升利润率,甚至可以用更低价格吸引客户,形成价格战优势。
谷歌还提供“预留容量”和“承诺使用折扣”等灵活方案,帮助Neocloud平滑现金流。这些细节说明,谷歌已经深入研究了Neocloud的商业模式痛点。
英伟达会如何反击
英伟达不会坐视不管。它的护城河有三层:CUDA生态、硬件供应链、以及客户黏性。每一层都需要时间打破。
第一,CUDA生态。虽然TPU支持主流框架,但很多AI模型是用CUDA优化的,迁移到TPU需要额外工程力。Neocloud的客户可能不愿意为迁移买单。不过,谷歌可以投入资源提供迁移工具和免费技术支持,降低转换成本。
第二,硬件供应链。英伟达的GPU出货量巨大,供应链优势明显。谷歌TPU虽然自研,但产能依赖台积电,且优先供应自家云服务。如果Neocloud大规模采购TPU,谷歌需要协调产能,这可能影响其自身业务。但谷歌正在扩大TPU芯片产能,并计划向第三方销售。
第三,客户黏性。英伟达已经与很多Neocloud签订了长期合同,并提供软件优化。但英伟达也在推自己的云服务,与Neocloud存在竞争关系。如果英伟达过于强势,可能会促使Neocloud寻找替代方案。
[!example]
最近的例子是CoreWeave——一家大型Neocloud企业,它从英伟达获得了大量GPU,但也开始测试其他芯片。谷歌的TPU推销正好抓住了这种“再平衡”心理。
趋势预测:芯片战争进入“云渗透”新阶段
未来一年,AI算力市场将出现更多“非英伟达”选项。谷歌TPU不会一夜之间取代英伟达,但会在一部分Neocloud中成为重要补充
物界前沿