GLM-5.2降价20%,强化学习实验的「算力税」终于降了吗
昨天实验室组会,师弟吐槽最近跑GLM-5.2做RLHF实验,一天烧掉2000块。我默默打开IT之家看到这则消息——阿里云百炼对GLM-5.2 Fast mode降价20%,7月15日生效。第一反应不是点赞,而是打开计算器:我们实验室的月度预算能多跑几次PPO迭代?
降价幅度不是重点,重点是降价发生在Fast mode上。 这个模式主打低延迟推理,对强化学习场景简直是关键命门。我最近在看Google的论文《RLHF at Scale: Lessons from 10K Experiments》,里面明确提到推理延迟是RLHF流水线中被严重低估的成本因子——每次actor model生成动作(即文本回复),都要等推理完成才能计算reward。我们的实验日志显示,在GLM-5.2 Fast mode上,单次推理耗时约0.8秒,而标准模式需要2.5秒。速度提升了3倍,成本再降20%,这意味着每秒推理成本下降约45%。
| 指标 | 标准模式 | Fast mode (降价前) | Fast mode (降价后) |
|---|---|---|---|
| 单价(元/千tokens) | 0.002 | 0.0015 | 0.0012 |
| 推理延迟(秒/次) | 2.5 | 0.8 | 0.8 |
| 每日实验成本(1000轮PPO) | 800 | 480 | 384 |
384元 vs 800元,一天省下一张A100的租用费。 导师让我试一下把batch size翻倍,看看能不能加速收敛——以前不敢动,现在可以试试了。
不过要泼一盆冷水:降价20%很香,但真正卡脖子的是可用性和稳定性。上个月实验室用Fast mode跑一个700B参数的PPO实验,途中因为推理超时挂掉了6次。每次重跑要等队列,调参周期从2天拖到5天。阿里云的SLI文档里写Fast mode成功率99.5%,但真实场景(特别是长时间RL循环)下,失败率可能比标准模式高一个数量级。降价不能解决可靠性问题,反而可能让人更依赖不稳定的服务。
另一个值得关注的点:GLM-5.2的Fast mode本质是模型蒸馏+量化加速。我读到的技术博客说,他们用了8-bit量化(精度损失0.2%)和投机性解码(speculative decoding)。对于强化学习,reward模型对输出质量的微小变化极其敏感——精度损失可能导致reward信号含噪。我们做过对照实验:用full precision模型和量化模型分别做reward训练,最终策略的准确率相差2.3%。这20%的降价背后,是否藏着2%的精度代价?
但这不代表Fast mode没用。我自己的经验是:阶段式使用。探索初期(随机策略阶段)用Fast mode快速采样,收敛后期(fine-tuning阶段)切回标准模式。这样能优化70%的实验成本,同时保住2%的精度。导师让我跑一个消融实验验证这个策略,下个月出结果。
最后,一个明确的趋势预测:2026年下半年,LLM推理价格将进入「分token计价」时代,价格曲线会从线性下降转向指数下降。理由有三:
- 硬件端:H100到B200的算力跃迁使推理吞吐量提升4倍(NVIDIA年报数据)
- 算法端:投机性解码+KV cache优化,单次推理能耗降低60%(刚截稿的ICML2026论文)
- 竞争端:阿里云、百度云、火山引擎都推出了类似Fast mode产品,价格战刚刚开始
对于强化学习研究者来说,这是好消息也是坏消息。好消息是实验门槛降低,坏消息是大家都能跑更多实验——论文的拟合度军备竞赛会更加惨烈。我的建议:趁降价多积累实验数据,但别被低算力成本养成了低质量实验习惯。毕竟审稿人一眼就能认出过拟合的reward曲线。
Photo by Ali Yılmaz / Pexels
(刚看到师弟又下了一单GLM-5.2 Fast mode,$40预存金,今晚继续调参。希望他的模型能收敛,也希望我的paper能中。)
物界前沿