188%的提分背后,OpenAI在玩什么数字游戏?
我注意到一个有意思的细节,这个号称“最严苛AI交互推理测试”的评测,突然就给GPT-5.6 Sol打了188%的提分。数字很漂亮,但问题来了——谁定的标准?怎么测的?改进点具体是什么?我翻了翻IT之家的报道,越看越觉得这事没那么简单。
先说说测试本身。所谓的“最严苛AI交互推理测试”,我没找到公开的评测论文或数据集链接。报道里只提了一句“OpenAI两项改进”,但具体是哪两项,语焉不详。作为干过几年调查记者的人,第一反应就是:这个数据来源可靠吗?
我试着扒了一下。通常这类测试会涉及多轮对话、工具调用、逻辑回溯等场景。如果GPT-5.6 Sol在同一个测试集上从基准分跳到几乎翻倍,排除掉作弊或测试集污染,那只有两种可能:要么之前版本表现太差(比如基准分只有30分,提188%也就86分,不算离谱),要么改进点恰好踩中了测试的“软肋”。
改进点到底是什么?我猜是这两处
报道里没写细节,但我根据行业经验猜一下。OpenAI最近在推理模型上主要做了两件事:一是思维链(Chain-of-Thought)的显式强化,二是工具调用时的错误恢复机制。前者让模型在复杂推理任务中能“慢下来”逐步思考,后者让模型在调用外部工具(比如计算器、代码执行)时如果出错能主动重试或修正。
如果非要技术流地展示,类似这样的配置变化可能在内部被调整过:
# 推理参数假设
{
"reasoning_effort": "high", # 原先是 medium
"max_tool_retries": 3, # 原先是 0
"consistency_check": true, # 新增
"temperature": 0.1 # 降低随机性
}
当然,这只是我的猜测。但逻辑上,这两项改进能显著提升交互推理的正确率,尤其是那些需要多步计算或逻辑链的任务。比如一道题:“小明有3个苹果,小红比小明多2个,小刚是小红的一半,问小刚有几个?”如果模型只一次推理可能出错,但加上思维链就稳了。
然而,问题在于:这种改进到底提升了通用能力,还是只在特定测试集上有效?
我的判断:更可能是测试集过拟合,而非本质飞跃
我用列表梳理一下疑点:
- 测试方没有公开测试集,无法复现结果
- 188%的增幅过于夸张,通常哪怕是换模型架构也难达到
- OpenAI这两项改进并非全新,更像是针对推理场景的“针对性优化”
- 如果真是通用能力飞跃,应该会在多个基准上同步体现,但目前没有其他测试结果
我查了一下,类似情况在AI领域并不少见。比如2023年某大模型在数学推理测试上提分明显,后来被扒出测试题和训练数据有重叠。OpenAI这次很可能也是在玩“考试技巧”——把测试题类型摸清,然后针对性调整推理策略。
更直白地说,这就好比一个学生平时只考30分,突然背了答案考了86分,你能说他数学变好了吗?不能,他只是在特定题目上记住了套路。
最后,配图是手机亮着OpenAI页面,但页面内容模糊,看不清具体是什么。假如这是测试结果的截图,那我更怀疑了——为什么不直接展示评测报告?遮遮掩掩的,反而让人起疑。
“2025年,AI评测已经成为一门生意,谁掌握了测试集,谁就能定义‘进步’。”
这句圈内人的调侃,我深以为然。
一句话总结:188%的提分,更像是OpenAI在特定测试集上的一次精准狙击,而非AI推理能力的本质突破。
物界前沿