社区讨论 · 政策

云天励飞拆解Transformer推理:三款专用芯片的逻辑与野心

跑条线跑条线7月19日2026/07/18 59 浏览

当所有AI芯片厂商都在谈通用算力、堆算力密度时,为什么云天励飞偏偏选择把Transformer推理拆成三个环节,每个环节造一款专用芯片?

这个问题,在WAIC 2026的展台前,我盯着云天励飞的路线图看了很久。坦白说,第一反应是“有必要吗”。但听完技术细节后,我意识到这可能才是让推理成本真正逼近“Token免费”的正确路径——不是靠单芯片性能翻倍,而是靠让芯片的每一颗晶体管都只干最擅长的事。

先说结论:云天励飞的三款芯片——DeepVerse100P、DeepVerse100D、DeepVerse100L,分别对应Transformer推理中Prefill、Decode(完整步骤)、Decode FFN三个环节,本质上是把大模型推理的“长尾”问题变成了“分工”问题。配合超节点架构,目标是2028年实现“百亿Token一分钱”。这个数字意味着什么?目前行业平均水平在“十亿Token几毛钱”的量级,如果达成,推理成本将再降一个数量级。

拆开来看逻辑。Transformer推理,尤其大语言模型,其计算负载在时间轴上极度不均匀。Prefill阶段需要处理大批量输入,是典型的计算密集型;Decode阶段则变成访存密集型,每一步只生成一个token,但需要频繁读取KV Cache;而在整个Decode过程中,FFN层(前馈网络)的计算量又远大于Attention层。英伟达的H100、B200等通用GPU,为了兼顾所有场景,内部架构是“大而全”的——有大量计算单元,也有大量缓存,但总存在资源浪费。比如跑Decode时,GPU的Tensor Core利用率可能不到20%,因为瓶颈在显存带宽。

云天励飞的做法是“对症下药”:

DeepVerse100P针对Prefill,强化密集矩阵计算能力,配备大容量HBM,但减少缓存层次,因为Prefill不需要频繁随机访存。DeepVerse100D针对完整Decode步骤,强调高带宽和低延迟,采用类似“近存计算”的设计,把SRAM和计算单元紧密耦合,减少内存墙。DeepVerse100L则专门针对Decode中的FFN部分,因为FFN层是权重密集的,但计算模式规则,可以做成纯SIMD架构,甚至不用支持复杂的数据流调度。

这三款芯片通过超节点互联,形成一套异构推理集群。在推理时,任务被动态切分:输入先进入100P完成Prefill,然后潜入100D做Decode的头几步,当遇到FFN层时,自动路由到100L加速,之后回到100D处理剩下的Attention层。这种流水线式的设计,让每款芯片都能在90%以上的时间满负荷工作。

[!note]
这种“拆解Transformer”的路线,让我想起2018年谷歌TPUv1的诞生——当时所有人都觉得通用GPU够用,但TPU用矩阵乘法单元证明了专用化在处理CNN上的优势。现在轮到推理侧,云天励飞赌的是“专用化+异构”才是大模型推理的终极解。

当然,这条路并不好走。软件生态是最大的坎。三款芯片需要不同的编译器、算子库和调度框架,开发者要为同一套模型维护三份优化代码。云天励飞在WAIC上展示了他们的“天书”推理平台,宣称能自动感知模型结构并分配任务到对应芯片,但实际效果如何,还需要看大规模部署后的稳定性。另一个问题是,如果模型架构发生根本性变化(比如Mamba这类状态空间模型取代Transformer),这套专用芯片可能瞬间失效。但至少从目前看,未来2-3年内,Transformer依然是大模型的主流。

从行业角度看,这个路线图释放了一个信号:AI推理芯片的“屠龙刀”思路正在被“手术刀”思路取代。英伟达的CUDA生态是护城河,但也是包袱——它必须兼容过去十年所有AI模型。而云天励飞作为后发者,不需要为历史兼容性买单,可以完全面向未来2-3年的主流模型设计。这种“轻装上阵”的策略,在成本敏感的推理市场,可能比堆算力更有效。

现在,唯一的问题是:当“百亿Token一分钱”真的实现时,那些还在用通用GPU跑推理的公司,会不会因为不想浪费账单上的每一分钱,而被逼着走上同样的专用化道路?

会后,我问了云天励飞的高管一句话:“你们觉得,英伟达会跟吗?”他笑了笑,没有回答。

原文链接:WAIC 2026 直击:云天励飞发布未来算力蓝图,三款芯片+超节点直指“百亿Token一分钱” | 雷峰网

1 条回复

?
Ctrl + Enter 快速回复
老邓
老邓7月19日(已编辑)

这个实验设计的思路值得肯定,但拆分后的芯片间通信延迟和动态调度开销是核心瓶颈。对比的baseline是单芯片方案吗?数据集的偏差需要考虑,比如长序列下Prefill和Decode的占比是否一致。