社区讨论 · 政策

训练推理分家,是RL时代最贵的浪费

黄CFO黄CFO8月18日2026/08/18 268 浏览

做财务的人看技术新闻,条件反射是找成本项。我先讲个类比:一家公司有两笔预算,一笔研发、一笔营销,制度上互不挪用,结果两边年底都在抢着花钱,因为不花完明年额度就没了。今天多数做AI的公司部署训练和推理算力,就是这种分账逻辑。训练集群是训练集群,推理集群是推理集群,各买各的,各自排产,各算各的利用率。

这个账本到了强化学习阶段就开始不对劲了。刚看到雷锋网这篇讲九章智算云落地训推一致的文章,以GLM-5为例,把Generator、Environment和Trainer收进一套统一工作流,全局动态调度资源。从财务角度看,这事的本质就是把两本账合并成一笔池子,资产周转率上去了,单位有效算力成本下来了。

预训练阶段的算力消耗是线性的,训练一个模型,环网集群一次顶大半年,利用率能算得平。RL不一样。RL是生成、执行、训练三段循环:生成阶段疯狂跑推理,每出一个候选方案都在烧推理卡;执行阶段把代码丢进沙箱里验证,GLM-5那边基于RepoLaunch框架搭了一万多个可验证的SWE环境,覆盖Python、Java、Go等九种语言,这个环节吃算力吃得很凶,而且全在推理侧;训练阶段才轮到更新参数。三段需求的吞吐特征完全不同,叠在一起就是锯齿形的资源曲线。

传统做法里,三段的算力分属不同集群,那就意味着总有一段机器在空转。GPU可是三年折旧的重资产,空转就是减值。训练和推理分账管理,任何一个池子出现波峰波谷的错配,多余的部分都提不了收入,现金流层面就是纯损耗。

九章智算云这篇里有个说法我很认同:训推一致的要点是让两者共享一套能同时感知计算、数据、状态和工作流的统一基础设施。这句放在财务语境里,就是预算池打通的逻辑。钱不动,动的是资源配置权。训练跑完了,卡立刻切给大规模生成验证,不用等另一批采购到货。账本上固定资产总额没变,但产出变多了,资产周转率上来了。

我上周写过一篇聊腾讯GPU的帖子,当时说推理算力才是云厂商接下来的战场,别急着乐观。今天这个案例算是对那个判断的补充:推理算力是云厂商和模型厂商之间的生意,但模型厂商自己账本里头,RL阶段的推理消耗已经在无限逼近训练消耗。两者在物理资源上本来就分不开,硬拆两套去采购,是拿着资本开支在给组织架构表买单。

从财务角度看,训推一致的真正价值是把每一张卡的产出拉满。现阶段资本市场给AI公司的估值逻辑也在变,前两年是看你有多少卡,现在转向看你的卡跑出了什么。同一份模型能力的进步,有的团队烧掉两倍的算力才拿到,有的团队用一半的预算就够,这个差距会直接反映在接下来几轮融资的条款书里。

往后看,我的判断是,训推一体将成为RL时代的基础设施默认项。训练和推理的边界在RL阶段已经被冲垮了,继续按物理集群分账的厂商,单位模型进步成本会越背越重。算力市场的计费逻辑大概率会从按训练卡、推理卡分开计价,转向按有效训练产出计价。谁的单位有效算力成本低,谁就能在未来两年的资本开支竞赛里占优。 这笔账,早晚要合到一张表上。

2 条回复

?
Ctrl + Enter 快速回复
查真相
查真相8月18日

等等,动态调度听着美,但RL阶段推理波动那么大,训练任务不会被挤到?有没有实际跑过的数据啊,怕不是纸面账算得漂亮。

命名不规范

笑死,我们内部训推也是俩账本,RL一来全乱了。调度那边天天扯皮,最后干脆全塞一个池子里,你别说,周转率真上去了。