社区讨论 · 政策

微软拥抱AMD Helios:AI推理的多元化棋局与投资机会

Jiayi_XuJiayi_Xu7月20日2026/07/20 78 浏览

当云巨头开始多元化AI芯片部署,英伟达的护城河还坚固吗?微软宣布在Azure上部署AMD Helios机架系统,专门用于AI推理,这不仅是技术路线选择,更是对风险收益比的重新权衡。

从资产配置角度看,云计算基础设施的芯片采购正从单一供应商向多源化演进。微软此举实质是在构建一个“投资组合”——用英伟达H100/B200捍卫训练领域的绝对优势,用AMD Helios在推理侧实现成本优化和供应链安全。这种策略类似于在股票组合中配置不同beta的标的,既追求收益上限,又降低尾部风险。

对比分析:英伟达方案 vs AMD Helios方案

维度 英伟达(H100/B200) AMD Helios(MI300X系列)
训练性能 绝对领先,CUDA生态壁垒极高 落后约30-50%,ROCm生态仍在追赶
推理性价比 高但成本昂贵 同功耗下推理吞吐量高15-20%,价格更低
供应稳定性 受制于台积电CoWoS产能,交期长 采用更成熟封装,供应弹性更大
软件生态 CUDA成熟,PyTorch原生支持 ROCm逐步完善,但需额外适配工作

关键观察:微软的部署策略是在推理场景中引入AMD,因为推理对软件生态的依赖度低于训练。推理任务更多是矩阵运算的线性执行,而非复杂的梯度计算,对CUDA特定算子的粘性较低。

技术细节:Helios机架系统的架构设计

AMD Helios 机架系统核心参数 (基于MI300X)
- 每个机架集成8个MI300X加速器,共1536个CU (计算单元)
- 显存:192GB HBM3 per GPU,总显存1.5TB
- 内存带宽:5.2 TB/s per GPU
- 互联:Infinity Fabric 4.0,带宽448 GB/s
- 推理场景优化:支持FP8/FP16混合精度,INT8量化

相比之下,微软Azure传统部署的英伟达H100机架(基于HGX H100)为8卡配置,显存总容量1.6TB(80GB * 8 * 2.5?实际H100 80GB,8卡共640GB),但显存带宽略低(3.35TB/s per GPU)。Helios在推理场景中,更大的显存容量和带宽有助于处理大模型长上下文,减少模型分片需求,降低延迟。

[!note] 从投资视角看,微软选择AMD Helios而非英伟达方案,核心逻辑是风险收益比的优化。推理市场规模预计2025年将达到AI芯片总需求的40%,且增速快于训练。在这个细分市场,AMD的性价比优势可以转化为Azure的毛利率提升。假设推理成本降低20%,以Azure AI推理业务年收入50亿美元计算,可节省约10亿美元成本,直接贡献利润。

商业模式与竞争壁垒评估

微软的商业模式:云服务商提供AI算力基础设施,按token消耗或实例时长收费。关键在于降低单位算力成本,同时保持客户粘性。引入AMD Helios后,Azure可以推出更便宜的推理实例,吸引价格敏感型客户(如中小开发者、广告推荐系统),同时用英伟达实例服务高端客户(如大模型训练、科学研究)。这种分层定价策略能最大化客户生命周期价值。

AMD的竞争壁垒:

  • 硬件层面:CDNA架构在推理效率上已接近英伟达,尤其在整数运算和稀疏性支持上
  • 供应层面:与台积电合作更紧密,CoWoS-L封装产能相对充裕
  • 生态层面:ROCm对PyTorch/TensorFlow的支持正在加速,且微软承诺提供工程支持
  • 关键风险:CUDA的惯性效应依然强大,许多AI框架默认对英伟达优化,AMD需要额外工程投入

英伟达的护城河:CUDA生态的深度绑定。即使AMD硬件性价比更高,企业迁移成本包括重新编译模型、调整推理框架、测试稳定性等,这些隐性成本可能抵消硬件节省。但微软这种级别的客户有足够能力承担迁移成本,且其自研AI模型(如Phi系列)已开始适配AMD。

估值逻辑与投资判断

当前AMD的PE(TTM)约170倍,英伟达约75倍(数据截至2024年7月,需基于实际)。表面看AMD更贵,但考虑到其收入增速(2024年Q2数据中心收入同比增长115%)和推理市场的扩张潜力,溢价有合理性。从资产配置角度,AMD在AI推理领域的风险收益比优于英伟达,因为:

  • 推理市场尚未被英伟达完全垄断,AMD有可观的份额提升空间
  • 微软、谷歌等云厂商的多元化策略是长期趋势,AMD是主要受益者
  • 如果AMD的ROCm生态持续改善,其估值可从“硬件供应商”向“生态平台

原文链接:微软将在 Azure 云服务上部署 AMD Helios 机架系统,用于 AI 推理 - IT之家

1 条回复

?
Ctrl + Enter 快速回复
远哥
远哥7月24日(已编辑)

从行业周期来看,推理侧多元化是必然趋势,但CUDA生态在训练端的护城河短期内难以撼动。这个赛道的核心变量是ROCm的适配进度,估值修复逻辑需等生态拐点信号。