当国产算力集群跑满作业,投资逻辑该重写了
全国产十万卡集群,上线首周就满载运行,日均15万作业,峰值超50万——这个数据放在半年甚至三个月前,我可能会认为是PR稿的过度修辞。但曙光8000的数据出自WAIC“镇馆之宝”评选,且是官方发布的运行数据,真实性有行业背书。问题来了:当一个全国产系统从“能用”变成“好用”,甚至“满载”,它对投资标的选择意味着什么?
先看技术底色。曙光8000的“全国产”不是组件级替换,而是从芯片、互联、框架到运维的全栈国产化。目前公开信息未披露具体芯片型号,但能支撑十万卡规模且满载运行,至少说明两点:一是互联协议收敛了大规模并行场景下的通信瓶颈,二是调度系统能处理日均50万作业的并发压力。这和当年“堆卡数、跑不满”的国产算力形成鲜明对比。
关键性能指标(基于公开数据推算)
- 集群规模:10万卡级(推测为曙光自研加速卡或基于国产GPU)
- 日均作业数:15万+
- 单日峰值作业数:50万+
- 上线首周满载率:接近100%
- 运营效率:初步达到商业化标准
这个数据放在全球对标:类似规模的英伟达DGX SuperPOD(比如微软的38万卡H100集群)在首周通常需要调优网络和作业调度,一般不会在投产第一周就达到满负荷。曙光8000能做到,说明前期的系统级预集成和测试周期足够长,或者底层架构设计对实际作业的适配度极高。这也意味着国产算力从“堆硬件”进入了“跑业务”阶段。
短期看(1-2年):国产算力服务的商业化窗口正在打开
投资逻辑的核心是“替代成本”和“运营效率”。曙光8000这类集群的商业模式,大概率是算力租赁或行业云服务,企业客户按作业量或时长付费。短期观察点有三个:
- 客户留存率:首批客户如果来源于政府、信创、科研机构,那么续约率可能较高,但商业化定价能力有限。如果能源、金融、制造业等市场化客户愿意买单,才算真正跑通。
- 单作业成本:对比AWS或阿里云上的英伟达A100/H100算力,国产集群的每FLOP成本是否具备竞争力。曙光8000满载运行,意味着单位折旧成本被摊薄,但电费和维护成本才是长期变量。
- 作业类型分布:如果15万日均作业中70%是推理、30%是训练,说明生态成熟度较高;如果全是稀疏化的推理任务,则对互联带宽的依赖度低,技术壁垒不如想象中高。
[!tip] 短期投资判断:关注曙光8000的客户构成和续约率。如果前三季度能实现商业化营收超预期(比如年化算力租赁收入10亿元以上),则国产算力板块的估值逻辑将从“政策预期”切换到“业绩兑现”,相关标的的PE倍数有望提升30-50%。
长期看(3-5年):壁垒不是卡数量,而是生态和迭代速度
10万卡集群的护城河,表面上是硬件产能和封装技术,长期看却是三个更难复制的因素:
- 软件栈的成熟度:国产芯片的CUDA兼容层(如曙光自研的编译器)是否支持主流框架(PyTorch、TensorFlow、MindSpore)的vLLM、DeepSpeed等优化工具。如果客户需要花2周移植代码才能跑通,那集群再大也难商业化。
- 运维和调度能力:50万作业/天的峰值,意味着调度系统需要处理毫秒级任务分配、故障自愈、能耗优化。这需要大量的真实运行数据来训练AI运维模型,不是靠砸钱就能快速追赶的。
- 供应链的自主可控:全国产意味着芯片、光模块、交换机、电源、冷却系统都需要国产供应商。目前国产光模块(如中际旭创)和液冷方案(如英维克)已经具备全球竞争力,但高速互联芯片(如SerDes)和高端FPGA是否也全国产?如果核心部件仍依赖进口,那“全国产”的含金量要打折扣。
[!abstract] 长期估值评估:曙光8000本质上是“算力基础设施”的资产化项目。如果它能持续稳定运行2年以上,且单作业成本每年下降10-15%,那么它的内部收益率(IRR)会超过大多数数据中心项目。届时,可将其类比为“AI时代的发电厂”,但退出路径较窄——要么卖给国资云平台,要么通过REITs上市。对于PE机构,更合适的退出方式是投资上游供应链(如国产光模块、液冷系统、分布式存储),而非直接持有集群本身。
一个值得警惕的细节
新闻中提到“日均处理作业数突破15万个”,但未说明作业类型和平均作业时长。如果作业以轻量级推理为主(比如一次图片分类),那15万作业的算力消耗可能仅相当于几十个训练任务。我们在评估时,需要看到更细粒度的业务指标,比如“平均单作业GPU卡时利用率”或“多任务并行度”。否则,表面满载可能掩盖了底层算力利用率不均衡的问题。
开放性问题
如果曙光8000在接下来6个月内,能跑通一个千亿参数大模型的完整训练(比如LLaMA-3-70B级别的全
物界前沿