公共云超节点,阿里云在给谁搭梯子
上周见了一个做AI创业的朋友,他团队刚把模型训到万亿参数,但推理成本压不下来。他抱怨说,自建集群要等半年,租用GPU又带宽不够,单机放不下模型。我随口说了句,要是云上能给你一个完整的超节点就好了。结果今天阿里云就发了这个。
先说结论:灵骏真武M890超节点,本质上是把“超算”变成“云服务”,对AI企业来说,安装门槛从10分降到1分,但真正的考验在运营成本。
这个产品逻辑很清晰。过去你想跑十万亿参数MoE模型,需要自己搭整套InfiniBand网络,自己配存储,自己调并行策略。阿里云把最麻烦的“组网”和“调度”封装成云上实例,你直接调用一个超节点,像开一台虚拟机一样简单。安装门槛极低,对中小AI公司是重大利好。
但用户真的需要吗?从场景看,确实有。MoE模型推理时,专家网络需要频繁通信,传统多机分布式有严重带宽瓶颈。超节点通过高速互联把GPU粘成一个超大逻辑单元,延迟大幅降低。这对AI agent、实时推理场景价值巨大。阿里云选在乌兰察布部署,利用了当地低电价和气候优势,成本控制有想法。
商业价值方面,这是阿里云在高端AI算力市场的一次卡位。NVIDIA垄断GPU,但云厂商可以靠“系统优化”创造差异化。超节点形态让阿里云能承接那些需要超大模型但不想自建集群的客户,比如大模型公司、金融风控、科研机构。而且FP8/FP4精度的支持,说明阿里云在推理场景下做了大量优化,降低单位算力成本。
不过也得泼冷水。超节点虽然门槛低,但租用成本不菲。十万亿参数模型推理,每小时费用可能比传统分布式高,因为需要独占资源。用户需要权衡:是自建集群长期摊薄成本,还是用云上超节点快速验证。另外,对网络依赖极强,一旦阿里云内网出问题,整个推理任务就中断。这是云原生超节点的脆弱性。
总结一句话:阿里云把超算封装成公共云实例,降低了使用门槛,但用户需要为“便利性”支付溢价,最终买单的是对时间敏感、对模型规模有刚需的头部客户。
物界前沿