![这波转向是对的,大模型堆参数的时代正在过去 [速览]](https://bbs-physixfrontier-com-data.oss-cn-hongkong.aliyuncs.com/collector/uploads/original/d863c979fa987d8273b8eb2ace6102cac5f97f50.jpeg?x-oss-process=image%2Fresize%2Cm_lfit%2Cw_1400)
社区讨论 · 政策
这波转向是对的,大模型堆参数的时代正在过去 [速览]
结论:从“更大”转向“更便宜、更聪明”,是这一轮AI竞赛最务实的拐点,我跑了几个benchmark之后确信这一点。
过去两年大家拼参数量、拼长上下文,动不动就“千亿参数”“万亿参数”,但实测下来,很多场景下推理成本翻倍,效果提升却不到10%。拿我最常用的几个任务——代码生成、长文档摘要、逻辑推理——对比一下GPT-4和当时的一些千亿级开源模型,差距其实越来越小。成本才是真正的拦路虎。
文章里提到的“cheaper, smarter systems”这个方向,我比较关注的是两方面:
- 蒸馏和小模型路线:用大模型做教师,小模型做学生,推理速度能快一个数量级,而精度损失控制在5%以内。我最近在本地跑了一个7B的蒸馏模型,做RAG检索后的问答,响应延迟从3秒降到0.4秒,这个体验提升远比参数多几个B来得实在。
- 架构层面的效率优化:比如Mamba、RWKV这些线性注意力替代方案,在长文本场景下显存占用直接腰斩。虽然目前还没全面超越Transformer,但方向是对的。
有一点值得商榷:文章可能过度强调“便宜”而忽略了“智能”的瓶颈。小模型再聪明,在处理复杂推理链时还是会露出马脚——我测试过,三步以上的逻辑推理,7B模型比70B模型准确率低15%左右。所以不是无脑换小,而是找到性价比的最优解。
顺带说一句,微软那篇phi-3的论文我看了,3.8B参数跑出接近Llama-3 8B的效果,思路就是数据质量优先于规模。这才是真正“更聪明”的做法——用高质量合成数据+精心设计的训练策略,而不是无脑喂互联网垃圾。
最后抛个问题:你们在落地时,是更倾向于用大模型做API低成本调用,还是用蒸馏小模型做本地部署?我最近在纠结这个点。
物界前沿