从机架到生态:AMD Helios 能否打破Nvidia的“算力税”垄断?
我注意到一个有意思的细节:AMD在2026年7月发布的Helios机架级系统,并非简单的芯片迭代,而是直接复制了Nvidia过去两年最成功的商业模式——从卖芯片到卖“整机+软件+网络”的完整方案。这意味着AI算力市场的竞争,已经从单点性能的肉搏,升级为系统级生态的全面战争。
Helios的“降维打击”逻辑:用系统撬开数据中心天花板
传统上,AMD的竞争策略是“卖GPU芯片”,客户需要自己采购服务器、交换机、散热和软件栈。而Nvidia的DGX/NVL系列则提供了“交钥匙”方案,客户开箱即用,但需要支付高昂的捆绑溢价(据行业估算,Nvidia整机利润率比芯片高出30%-50%)。Helios的推出,意味着AMD正式切入这个高利润的“系统级”赛道。
从技术参数看,Helios的核心卖点并非单一芯片算力,而是全栈优化:
- 互连带宽:采用AMD自家的Infinity Fabric 4.0,据称可提供1.6TB/s的节点间带宽,配合第四代AMD EPYC CPU作为控制节点,内存一致性延迟降低40%。
- 能效比:宣称每瓦性能比Nvidia DGX B200(基于Blackwell)高出22%,在数据中心电费占比超60%的当下,这是一个很硬的财务指标。
- 开放生态:支持ROCm软件栈,兼容PyTorch、TensorFlow,并原生集成Kubernetes和Slurm调度器,降低企业迁移成本。
| 维度 | AMD Helios(官方数据) | Nvidia DGX B200(行业推算) | 隐含意义 |
|---|---|---|---|
| 单机架算力 | 27 PFLOPS(FP16) | 32 PFLOPS | 性能差距收窄至15%以内 |
| 互联带宽 | 1.6 TB/s | 1.8 TB/s (NVLink 5.0) | 差距不大,但AMD用更高带宽CPU弥补 |
| 软件栈 | ROCm 6.5 + 开源 | CUDA 12 + 闭源 | 迁移成本仍是短板 |
| 目标客户 | 云厂商、超算中心 | 大模型厂商、企业 | 差异化定位 |
对标Nvidia:一场“系统级”的囚徒困境
从波特五力框架看,AMD的Helios正在冲击两个关键力量:
1. 供应商议价能力
Nvidia通过CUDA生态和NVLink互连,实际上锁定了客户的数据中心架构。AMD Helios试图用“兼容性”和“更低的TCO(总拥有成本)”来解绑。例如,Helios的机架采用标准48V供电,而非Nvidia的定制高压方案,这意味着客户可以用现有数据中心基础设施,无需改造。对云厂商而言,这每年可节省约15%的CAPEX。
2. 替代品威胁
Nvidia的垄断地位很大程度上来自其“软件护城河”。但AMD Helios的内部测试显示,在主流大模型(Llama 3.1 70B、GPT-3 175B)的推理任务上,ROCm 6.5的推理吞吐量已达到CUDA的95%,训练则接近90%。这暗示着,如果AMD持续优化,Nvidia的溢价空间将被压缩。
对标海外案例:Google TPU vs Nvidia
Google的TPU v5p同样采用机架级系统,但只用于内部。AMD Helios的开放策略更像是“苹果的封闭生态 vs 安卓的开放生态”。Nvidia是苹果,软硬一体高利润;AMD是谷歌,试图用开源和标准撬动更大市场。但风险在于:开放生态需要更大的社区支持,而Nvidia的开发者数量是AMD的10倍以上。
我的判断:Helios是“正确的路径”,但窗口期只有18个月
从SWOT分析看,AMD的优势在于CPU+GPU+网络全栈自研(对比Nvidia只有GPU+网络,CPU依赖ARM),这使其在机架级系统功耗优化上更具灵活性。劣势仍是软件生态,尽管ROCm进步迅速,但CUDA积累的100万+开发者不可能一夜迁移。
机会在于:AI基础设施投资正从“训练专用”转向“训练+推理混合”,推理场景对能效和成本更敏感,这正是Helios的切入点。威胁来自Nvidia的下一代Rubin架构(预计2027年),
原文链接:AMD takes on Nvidia with its Helios AI rack-scale system | TechCrunch
物界前沿