当大模型推理的边际成本成为瓶颈,芯片设计哲学需要怎样的转向
大模型推理的计算特征与训练截然不同:自回归解码的每一步只生成一个token,且计算密度远低于训练阶段的矩阵乘法。这意味着推理芯片的瓶颈不在峰值算力(FLOPS),而在内存带宽、延迟与数据搬运效率。那么,面向推理优化的芯片,究竟应该选择怎样的架构路径?
2026世界人工智能大会上展出的百度昆仑芯M100,给出了一个值得仔细推敲的答案。央视报道中首次公开的实物,延续了昆仑芯自研的XPU架构理念,强调面向大模型推理进行针对性优化。这并非一款试图与NVIDIA H100/B200在训练场景正面竞争的GPU,而是一枚将设计重心放在推理效率上的专用芯片。从学术研究的角度,我们需要审视其设计选择的合理性。
大模型推理的瓶颈在哪里
以Transformer解码器为例,每一次自回归生成都涉及两个阶段:prefill(预填充,并行处理输入序列)和decode(逐token生成)。在decode阶段,batch size通常较小(受限于延迟要求),此时计算强度(compute intensity)极低,主要瓶颈是内存带宽——每次生成需要从HBM读取完整的KV Cache和模型权重,但只做一次矩阵向量乘法。据Kim et al. (2023) 在FlashAttention论文中的分析,对于7B模型,单次token生成的计算强度不足1 OPS/Byte,远低于A100的理论计算强度边界。这意味着即使芯片有极高的TFLOPS,带宽不足也会导致利用率极低。
现有GPU的通用计算架构在这种情况下并不高效。NVIDIA GPU依赖大量CUDA Core和Tensor Core,但decode阶段大部分核心处于闲置,因为数据搬运速度跟不上计算。这便是为什么vLLM、PagedAttention等系统优化技术试图通过动态批处理、内存管理来缓解瓶颈,但硬件层面的改进才是根本。
XPU架构的设计理念:数据流而非指令流
昆仑芯的XPU架构并非传统GPU的标量或SIMT模式,而是更接近数据流计算(dataflow architecture)——通过定制化的计算单元和专用的数据通路,减少指令调度开销,提升数据重用率。这种思路在AI芯片设计领域并非新鲜,但成功的商用案例不多。Google的TPU采用了脉动阵列(systolic array),本质也是数据流特化;Cerebras的晶圆级芯片则通过超大片上SRAM来减少DRAM访问。XPU的独特之处在于,它似乎试图在通用性和专用性之间寻求平衡——保留可编程性,但针对特定算子(如Transformer中的矩阵乘法、softmax、layernorm)提供了硬件加速。
从M100面向大模型推理优化的表述来看,很可能在以下方面做了针对性设计:
-
大幅提升内存带宽与HBM容量。推理时模型权重和KV Cache均需驻留,更大的片上缓存或HBM可以减少外部DRAM访问。据报道,M100可能采用HBM3e或更高规格,带宽达到TB/s级别。
-
支持稀疏化计算。大模型推理中,注意力层的稀疏性(如稀疏注意力)和权重剪枝(如2:4稀疏)可以显著降低计算量,但传统GPU对稀疏矩阵乘法的支持效率有限。XPU架构如果原生支持结构化稀疏,则能获得2x以上的加速比。
-
低精度计算与非线性算子融合。INT4/INT8推理已成为主流,M100很可能扩展了对低精度数据类型的原生支持,并将softmax、layernorm等非线性算子与矩阵运算融合,减少数据搬运。
对比baseline:与NVIDIA GPU及国内竞品的差异
我们不妨以NVIDIA H100作为基准。H100在训练场景的FLOPS高达989 TFLOPS(FP8),但推理时,其Transformer引擎虽然支持FP8,实际decode效率依然受带宽限制。H100的HBM带宽为3.35 TB/s,对于7B模型,理论最大吞吐约2000 tokens/s(假设权重和KV Cache带宽需求)。但实际上,受限于batch size和内存解压开销,实测往往低于1000 tokens/s。
国内竞品如华为昇腾910B,采用达芬奇架构,核心是3D Cube,同样强调矩阵运算。但昇腾更偏向训练和通用推理,对解码阶段的特殊优化(如KV Cache管理、低延迟交互)可能不如XPU架构灵活。
实验设计的核心检验点:延迟和吞吐的权衡
一篇分析芯片推理能力的论文,实验设计通常包含两个维度:延迟(首token生成时间、每token平均延迟)和吞吐(tokens per second),并在不同batch size下测量。M100作为推理专用芯片,其优势应在batch size=1(在线服务场景)时尤为明显,因为此时带宽利用率最高。如果M100在单batch下能够达到与H100相近的延迟,但功耗显著降低(例如低于200W vs H100的700W),那么其性价比优势不言而喻。
然而,数据集的偏差需要考虑。当前评测多使用标准benchmark(如MLPerf Inference),但实际部署中,输入长度分布
物界前沿