系统之战:AMD的Helios机架,能否撬动Nvidia的AI铁幕
7月的一个下午,在AMD位于圣克拉拉的实验室里,一台黑色机架正在无声地运行。工程师们围在四周,注视着屏幕上跳动的数据流。这台名为Helios的机器,不是一颗芯片,而是一个完整的系统——从GPU、CPU到网络互联和液冷散热,全部由AMD自己整合。旁边的一位工程师低声说:“我们等了三年,就为了这一刻。”
这一幕,让我想起十年前Nvidia发布DGX-1时的场景。当时黄仁勋亲手将第一台机器交给OpenAI,而今天,AMD带着Helios闯入了同一个战场。更关键的是,微软已经签下了第一笔订单。作为全球最大的云计算买家之一,微软的选择,意味着这个市场终于不再只有Nvidia一个选项。
[!info] Helios的诞生,标志着AMD从“卖芯片”正式转向“卖系统”。据CNBC报道,Helios集成了AMD的Instinct MI400系列GPU、Zen 6架构的CPU,以及自家设计的Infinity Fabric互联技术,目标直指Nvidia的DGX系列。
短期看,Helios解决了AMD最头疼的“软硬一体”短板。 过去几年,AMD的Instinct GPU在纸面性能上并不输Nvidia,但在实际部署中,企业客户往往需要自己搞定网络、散热和软件栈。而Nvidia的DGX系统则提供了开箱即用的体验,加上CUDA生态的粘性,让AMD难以撬动大客户。现在,Helios的出现,让AMD有了一个完整的对标产品。微软的采购,更像是一个信号——如果Helios能在Azure中稳定运行,其他云厂商和大型企业很可能跟进。
但短期内的挑战同样明显。Helios的首次交付要到2026年下半年,而Nvidia的DGX Blackwell已经出货。更重要的是,CUDA的生态壁垒不是靠硬件就能打破的。AMD的ROCm软件栈虽然一直在追赶,但兼容性和开发者工具链的成熟度仍有差距。微软的采购,可能只是作为“第二供应商”的备份策略,而非真正替代。
长期看,真正的变局在于系统架构的竞争逻辑。 当AI训练集群从千卡扩展到万卡甚至十万卡规模时,瓶颈已经从单芯片性能转向了互联带宽、散热效率和能源管理。Nvidia的NVLink和InfiniBand网络一直是其护城河,而AMD的Infinity Fabric和以太网方案能否在超大规模集群中证明自己,是决定Helios命运的关键。
更值得关注的是,AMD正在复制当年在服务器CPU领域的路径——从单打独斗到平台化。2017年,AMD凭借EPYC处理器重返服务器市场,最初也是靠单个客户(如谷歌)切入,然后逐步蚕食Intel的份额。如今,AI加速器市场同样出现了类似的契机:Nvidia的供应紧张和定价权让客户感到不安,而AMD提供了另一种选择。
但这次不同。Nvidia不仅在硬件上领先,还构建了从芯片到系统到云服务的完整闭环。Helios的面世,意味着AMD必须投入巨资建立自己的系统集成能力,包括供应链、测试验证和全球服务团队。这需要时间,也需要耐心。微软的订单是一个好的开始,但能否从“备选”变成“主流”,取决于AMD能否在两年内让Helios的部署成本低于Nvidia,同时保持性能不落后。
我的预测是:未来18个月内,AI基础设施市场将出现“双系统”格局。 Nvidia的DGX系列仍将占据高端和主流市场,但AMD的Helios会在特定场景(如推理、性价比敏感型训练)中打开缺口。而真正决定胜负的,可能不是硬件本身,而是软件生态的开放程度——如果AMD能推动ROCm成为CUDA之外的第二个主流框架,那么Helios就有机会像当年的EPYC一样,从边缘杀入核心。
但这一切,取决于AMD能否在微软的机房里,让Helios稳定运行一整年。
原文链接:AMD launches Helios, its first rack AI system to rival Nvidia, adding Microsoft as newest buyer
物界前沿