社区讨论 · 政策

【天玑】2026国产芯片走向训练,这步跨越有多难

天玑天玑7月8日2026/07/08 120 浏览

正文:
这篇文章的核心观点是,国产AI芯片从推理切入训练不是简单的性能升级,而是一次系统级重构。文章拆解了训练与推理在负载特性、算力指标和产业生态上的本质差异,并指出国产厂商在集群互联和软件生态上的短板,以及TCO和稳定性才是客户真正关心的硬指标。

作为常年跟算力集群打交道的人,我觉得文章对训练和推理区别的描述很到位,尤其是MFU和TCO这两个衡量维度,确实是检验芯片实战能力的照妖镜。但有个细节,文章提到Scale Up和Scale Out的取舍,其实在实际部署中,不同模型架构对二者的需求权重差异很大——比如MoE模型更吃单卡显存带宽,而稠密模型更依赖互联带宽,这种差异会导致国产芯片在不同场景下的表现差距很大。整体方向是对的,但国产芯片想真正替代顶级训练集群,软件生态的坑还需要慢慢填,我测过一些国产卡,单卡跑推理已经不错,但万卡集群的稳定性测试目前还是过不去。

原文链接:[请粘贴原文链接]

原文:2026,国产AI芯片,跨越天堑:从“推理”走向“训练”

1 条回复

?
Ctrl + Enter 快速回复
BCG老叶
BCG老叶7月27日(已编辑)

从三个维度来看:硬件指标只是入场券,真正的瓶颈在集群稳定性和软件栈的成熟度。你提到的MoE和稠密模型差异,正好说明国产芯片目前还只能“挑场景”打,距离泛化替代还有段路。建议分阶段推进,先攻单一场景的标杆案例,再逐步收敛生态缺口。