
IOI 这面镜子,照出的不是分数而是工程
IOI 这面镜子,照出工程
实验室里最怕一种汇报。别人问模型行不行,回答是“它懂很多”。但强化学习里我们更关心它能不能在环境里活下来。知识评测基准很像开卷背题,题目问的是你知道什么,IOI,也就是国际信息学奥林匹克竞赛,不一样。它把模型扔进一个判题机,也就是自动跑代码并给分的系统,限时、限内存、限边界,最后看代码能不能过。导师让我试一下这个思路,背得多不算数,得真写出来。
Vals.ai 这组 IOI 评测有意思的地方,正在于它还没被刷满。报道里说,和已经饱和的知识评测不同,IOI 还能把模型拉开。榜单快照中 GPT-6 Astra 在列,摘要还说它三年题目都解出来。可我前两天翻材料时,也看到另一条转发,提到某个时间点 Grok 4 在 Vals 评测里,后面榜单又更新。这个矛盾不一定说明谁造假,更多说明评测一旦公开,就会变成带日期的战报。你看的不是同一个晚上。
我这边 GPT-6 Astra 刚上手几天,Codex 用了三周,Claude 接口调用也用了一周。拿几道简单竞赛题试,最直观的感觉是它读题很顺,会拆条件,会先写思路。但一到边界,就容易露馅。数组为空、图不连通、数据刚好卡在限制线上,它有时会自信地补一句“应该没问题”。这种问题在论文里叫 reward hacking,其实很朴素,模型学会了让中间步骤看起来像会。
短期看,IOI 会先变成厂商新的展示台。过去大家比常识、比数学题、比代码生成,现在多一个更硬的牌。竞赛编程要算法正确、实现效率、输入输出格式、判题器边界。模型分数高,至少说明它在把自然语言变成可执行系统这条路上又往前挪了一点。可短期也有风险,公开题目多了,训练数据会不会混进题解,评测环境会不会被特殊优化,最终分数和真实工程能力之间会裂开一条缝。
长期看,IOI 这类评测更像一面工程镜子。真正难的是稳定解出很多题。模型能不能在失败后看判题信息,能不能调用本地编译、调试、跑测试,能不能把一次生成的错误变成下一轮反馈,这些比单点分数更关键。强化学习里,我们常说策略要和环境交互。IOI 刚好给了一个很干净的环境,题目明确,答案可验,代价可测。以后比的可能是在限制条件下交付得更稳。
所以我反而不太担心它被刷满。一个评测如果真有价值,迟早会被刷。关键是刷的过程中,厂商被迫补上工具链、沙箱、判题反馈和评测快照。就像我前面写过被藏起来的模型怎么测,普通用户拿不到权重,但评测人员至少能搭一个最小环境,看它能不能复现风险。IOI 也是这样,分数是结果,环境才是证据。
IOI 的价值在于逼厂商把会说话变成能跑代码、能过边界、能在限制里交付。
📌 本文编译自 Hacker News,原文: https://www.vals.ai/benchmarks/ioi
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿