从“最强模型”到“更少遗漏”:Claude Opus 5 背后的评估哲学转变
上周实验室的组会,一位研二学生兴冲冲地跑进来,说 Anthropic 的 Opus 5 在多个基准测试上超过了 GPT-4o 和 Gemini Ultra。他调出排行榜截图,问我:“老师,我们是不是该把论文里的基线模型换成 Opus 5?”我当时没有直接回答,而是让他先讲清楚 Opus 5 的“强”具体体现在哪些指标上。他翻了半天文档,只找到一句模糊的表述:“在复杂任务上更少遗漏步骤”。这个细节,恰恰是整件事最值得玩味的地方。
传统上,大模型发布时总是强调“最强”“首次超越人类”“多个基准第一名”。但 Anthropic 这次选择了截然不同的叙事:不再标榜绝对分数,而是强调“更少遗漏”。从学术角度看,这不仅是营销策略的调整,更暗含了评估体系的一次根本性转向。让我从三个层面拆解这个变化。
第一层:基准测试的“天花板”与“地板”
我们通常用 MMLU、BIG-Bench、HumanEval 等基准来比较模型。这些测试设计之初,假设模型能力是单维度的——知识越广、推理越深,分数就越高。但最近两年,主流模型在这些基准上的差距已经缩小到 1-2 个百分点,甚至低于测试本身的随机误差。例如,2024 年 Scialom 等人指出,MMLU 的 3 个标准差区间约为 1.5%,而 GPT-4o 和 Claude 3.5 的分数差往往小于这个值。换句话说,“最强”的宣称在统计意义上已经站不住脚。
更关键的是,这些基准测试的都是“地板”能力——模型能解决多困难的问题?但实际应用中,用户更关心“天花板”问题——模型是否会犯低级错误?是否会遗漏关键步骤?Opus 5 的“少遗漏”定位,恰恰是对这一痛点的回应。Anthropic 在技术报告中含蓄地承认,传统基准的分数已无法区分模型在长链条推理、多步依赖等场景下的稳定性。他们转而关注“failure rate”——在特定复杂任务上,模型完成所有步骤的概率。
第二层:从“得分”到“可靠性”的范式转移
这个概念需要先理解:在计算机视觉领域,我们很早就经历过类似转变。2012 年 AlexNet 在 ImageNet 上取得突破后,学界一度沉迷于刷 top-5 准确率。但到 2015 年,ResNet 将 top-5 错误率降到 3.5% 以下时,大家发现再提升 0.1% 已经毫无意义——因为人类标注者本身就有 5% 的不可靠性。于是,注意力转向了“鲁棒性”——在遮挡、光照变化、对抗攻击下,模型能否保持性能?这正是“得分”向“可靠性”的范式转移。
大模型领域正在复制这条路径。当所有顶尖模型在标准基准上都能达到 90% 以上时,区分度就来自那剩余的 10%——即“失败事例”。Anthropic 的“更少遗漏”本质上是在定义一种新的评估指标:任务完成率。例如,在需要 5 步推理的数学题上,Opus 5 可能每一步的准确率和其他模型一样都是 99%,但链式乘法下,它的最终成功率是 99%^5 ≈ 95%,而其他模型若是 98% 准确率,成功率就降到 90%。这 5 个百分点的差异,在学术论文中往往被忽略,但在实际部署中(比如自动生成代码或医疗报告)却是致命的。
[!tip] 可靠性评估的难点在于:它需要细粒度的过程记录,而非仅看最终结果。Anthropic 在技术报告中提到,他们设计了“step-wise verification”任务,这正是学术界一直在探索的“可解释性评估”的雏形。
第三层:Fable 5 的隐喻——我们是否需要另一个“最强”
回到标题中的问题:“还需要 Fable 5 吗?”这里的 Fable 5 可以理解为任何试图用“最强”叙事冲击市场的模型。从实验设计角度看,Anthropic 的举动实际上是在重构竞争规则——如果大家都不再关心 top-1 准确率,而是关心“在 1000 次运行中,有多少次能完整且正确地完成任务”,那么新模型发布的策略就会彻底改变。不再需要堆砌训练数据、扩大参数量,而是需要精心设计失败案例的
物界前沿