当实验室的API账单砍半,我看到了强化学习的下一个战场
社区讨论 · 赛道

当实验室的API账单砍半,我看到了强化学习的下一个战场

导师说对导师说对7月28日2026/07/28 62 浏览

上周五组会,导师突然甩出一张截图,是《华尔街日报》那篇关于硅谷企业停止在大模型上烧钱的报道。他面无表情地说:“从下个月开始,每个课题组的API调用预算砍掉一半。钟一鸣,你那个用GPT-4做reward model的强化学习方案,给我换成开源模型蒸馏后的版本,或者你自己想办法。” 我盯着屏幕,心里咯噔一下。实验室里那个号称“token自由”的狂欢时代,似乎一夜之间就要结束了。

过去两年,我们实验室的卷王们以“谁调用的API多”为荣。有人为了在对话数据集上刷出高一点reward,动辄用Claude 3.5生成几万条对比样本,月账单轻松过万美金。导师虽然肉疼,但为了出paper,也只能咬牙说“这是必要成本”。可现在,连硅谷巨头都开始“消费降级”,我们这些靠 grants 过日子的实验室,更得勒紧裤腰带。

短期看,这场“消费降级”是市场理性的必然回归,也是技术泡沫的良性挤出。

新闻里说,企业从“Token最大化”转向“省钱新信仰”,这其实和强化学习里的“exploration vs exploitation”困境如出一辙。过去两年,大家疯狂exploration,恨不得把整个互联网都喂进大模型,结果发现很多调用是无效的。比如很多企业用GPT-4做简单的分类任务,或者用超大模型生成重复的文案,边际收益早已递减。现在他们开始用小模型、蒸馏模型、甚至规则引擎来替代,这本质上是用更高效的策略来收敛。

从研究角度看,这恰恰是强化学习落地的机会。我的研究方向是“通过学习优化推理路径”,说白了就是让模型在推理时减少不必要的计算。比如用RL来训练一个“早退”机制:当模型对某个token的置信度足够高时,提前终止计算,而不是层层堆叠。过去产业界一味追求大模型,根本不在乎推理效率,我的论文被拒的理由经常是“方法过于工程化,缺乏理论深度”。现在好了,省钱成了刚需,这类方法反而有了用武之地。

但长期看,这种“消费降级”可能会倒逼基础模型架构的创新,甚至重塑强化学习与大模型的关系。

很多AI实验室开始研究“稀疏激活”和“混合专家模型”,本质上就是让模型在处理不同任务时只激活部分参数。这和强化学习中的“层级化强化学习”思路很像:把复杂任务分解成子任务,每个子任务由一个小模型负责,只有需要高层决策时才调用大模型。如果这种架构成为主流,那么强化学习就不再只是“调API”的附属品,而是成为训练这种“调度器”的核心技术。我最近在看一篇论文,作者用RL训练了一个门控网络,动态选择使用哪个规模的子模型,在保持95%以上性能的同时,将推理成本降低了70%。这类研究放在半年前可能无人问津,现在却成了香饽饽。

当然,也有值得警惕的一面。如果所有企业都只追求低成本,可能会抑制对超大模型的前沿探索。就像当年深度学习热的时候,大家拼命堆层数,后来发现ResNet的残差连接才是关键。现在的“消费降级”可能让一些funding流向应用层,而不是基础研究。但我觉得,真正的好东西会被筛选出来。那些依赖烧钱才能维持的“伪创新”,死了也就死了。真正有价值的,是用更少的算力解决更多的问题,这恰恰是强化学习最擅长的领域。

最后说一句。导师让我试一下用一个8B参数的开源模型,配合RL微调,来替代现在用GPT-4做的reward model。我隐隐觉得,这可能是好事。当实验室的API账单砍半,我们反而能更专注地思考:什么才是真正值得优化的目标函数。

大模型消费降级不是寒冬,而是从粗放增长转向精耕细作的必然拐点。

原文链接:https://www.tmtpost.com/8082154.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧