物界前沿评测 · 2026-09-06
2026 年 9 月 6 日 · 星期日(第 039 期 · 预览版)
别人做评测,我们做评测的雷达。今日看点:AI 考卷「防作弊」大改版、ARC-AGI 双成绩争议、网安能力分级锁。
重点更新(双点评)
重点 1|AI 考试的「泄题防线」升级了:四成考题转进私有库,榜单还能信几分?
它能帮你干什么活:第三方评测机构 Artificial Analysis 9 月 5 日把智能指数升级到 v4.2 口径:一半考题人人可见,私有留出测试集的权重从约两成直接翻倍到四成,移除了已经「人人会做」的 GPQA Diamond 题库,换上周多智能体项目实测(AA-Briefcase)和 4592 页文档推理(GDP.pdf)这类新题型。新口径第一份成绩单:Claude Fable 5.1 以 57 分居首、GPT-6 Astra max 55 分第二,开源榜首是 Kimi K3 的 50 分。考题为什么藏起来?因为 AI 厂商开始「背题」——公开题库被训练数据覆盖后,高分说明不了泛化能力。
产品领域专家·阿哲说| 这是评测产品的一次「防作弊重构」:把分数从「谁刷公开题更狠」拉回「没见过的题你行不行」。私有库权重翻倍意味着外界无法复核前三名差距(57 比 55 只差 2 分),榜单从「公共考场」往「机构背书」滑——信它的程度取决于你信不信这家机构。选型时别只盯总分,看它敢不敢把错题明细放出来。
小编小禾说| 大白话:以前考试大家都能看真题,现在四成题藏起来了,说是怕 AI 背题——道理我懂,但分数更没法自己验算了。我的土办法不变:榜单当「入围名单」,当堂测试还是拿自己的活儿喂一遍。
(来源:chooseAI / Artificial Analysis(2026-09-05))
重点 2|同一个模型,两种考法差出 37 分:ARC-AGI-3 成绩争议把「谁来监考」摆上台面
它能帮你干什么活:基准分析机构 Vellum 拆解 OpenAI 公布的 GPT-6 Astra「ARC-AGI-3 得分 99.9%」发现:那是用 OpenAI 自家的 Responses API 测试框架跑的,还调了两项默认参数;换标准测试框架,同一个模型只有 62.7%,而人类平均是 48%。一条成绩两种版本,差 37 分。ARC-AGI 系列本是「测真聪明还是背答案」的金标准考题,现在连它的成绩单都取决于用谁的尺子量。
编程领域专家·老徐说| 我 8 月说过:出题范围和测试环境都是主办方定的,考卷天然偏向自家生态——这次更直接,厂商自测自带「考场优势」。测量框架开始左右结论,说明行业还没解决「第三方监考」问题。看基准成绩先问三件事:谁跑的、什么框架、参数调没调。三件有一件答不上,数字先打对折。
小编小禾说| 99.9% 和 62.7% 都是「真的」,只是尺子不一样——这事跟买体重秤一个道理,秤不准,减重全白搭。以后看到「碾压人类」的宣传,先找找有没有第三方用同一把尺复过秤。
(来源: Yingzheng / Vellum Benchmark Analysis(2026-09-05))
重点 3|「能找漏洞、不许写攻击」:三家大厂不约而同给最强网安能力上了分级锁
它能帮你干什么活:本周模型盘点披露:Anthropic 称 Claude Fable 5.1 的网络安全误报率比上代降 60%,可以帮你发现漏洞、但拒绝写利用程序,此类请求重定向到 Opus;谷歌同周发布 Gemini 3.8 Flash Cyber 专网安场景;OpenAI 的 Astra 网安完整版只向审核通过的防御方开放。三家把「最强的攻击侧能力」统一收进了白名单闸门。
安全领域专家·老周说| 方向对,但要看清两个层面:一是分级开放的「审核」标准由厂商自己定,防御团队申请门槛和响应速度还没经过一次真实应急响应检验;二是误报率降 60% 是厂商口径,第三方网安基准(如 CyberSecEval 系列)复测数据出来之前,企业采购别把这句话写进合同。护栏建在能力出口是对的,出口钥匙在谁手里才是关键。
小编小禾说| 翻译成人话:AI 现在「只当保安,不当盗贼」。对企业是好消息;对个人小白的提醒是——别指望它会帮你「测试」你家 WiFi 密码,它装不认识你。
(来源:七牛云 AI 前沿日报(2026-09-04))
榜单快报
快报 1|Arena 智能体(干活)盲测榜 · 快照 09-02(真人派活投票,本期主榜)
| # | 模型 | 厂商 | 净改善分 |
|---|---|---|---|
| 1 | Claude Opus 5 (High) | Anthropic | 13.7 |
| 2 | Claude Opus 5 (Max) | Anthropic | 11.7 |
| 3 | Claude Fable 5 (High) | Anthropic | 10.6 |
| 4 | GPT 5.6 Sol (xHigh) | OpenAI | 9.5 |
| 5 | Kimi K3 (Max) | 月之暗面 | 8.7 |
这张榜不是聊天是「派活」:真人把编程、运维之类的任务丢给智能体,按「事情到底办成没有」投票。「净改善分」= 把活干漂亮的比率减干砸的比率,越高越靠谱。前三名全是 Anthropic,OpenAI 最好成绩第四;前十里唯一的开源模型是第 5 的 Kimi K3。注意这张榜对战样本还薄,名次会晃,看梯队别看单名次。
快报 2|Arena 图像理解盲测榜 · 快照 08-28(看图说话专场)
| # | 模型 | 厂商 | 盲测积分 |
|---|---|---|---|
| 1 | claude-fable-5 | Anthropic | 1313 |
| 2 | claude-opus-4-7-high | Anthropic | 1301 |
| 3 | qwen3.8-max | 阿里巴巴 | 1300 |
| 4 | claude-opus-4-7 | Anthropic | 1299 |
| 5 | muse-spark | Meta | 1294 |
真人匿名同时问两个模型同一张图,投票谁答得好。前十名里 Anthropic 占四席但头名优势只有 2 分(1301 比 1300),阿里 qwen3.8-max 咬在第二梯队头上;Meta 的 muse-spark 前五里唯一、主打便宜。看图能力头部已经挤成一团,选型看价格和上下文长度更实际。
快报 3|Artificial Analysis 智能指数 · v4.2 新口径首张成绩单(09-05 发布)
| # | 模型 | 厂商 | 综合分 |
|---|---|---|---|
| 1 | Claude Fable 5.1 | Anthropic | 57 |
| 2 | GPT-6 Astra max | OpenAI | 55 |
| 3 | Kimi K3(开源第一) | 月之暗面 | 50 |
就是重点 1 说的那次改版:四成考题转入私有库后的第一张榜。头名只领先 2 分,且私有题库占比翻倍意味着这个差距外界没法复核——当「机构评测结论」看,别当「公开考试成绩」看。上期(09-05 刊)用的 Arena 文本/编程榜与 LiveBench 本期末换源,数据各自快照日期已在标题标注。
板块精选
1. 给人类程序员出的「保底考题」上线:AI 代写时代你还剩多少基本功
codeset 上线一个叫 Vibecoding Test 的梗测试(9 月 6 日登上 Hacker News 热榜):专门测「习惯让 AI 代写代码之后,人类自己上手还剩多少基本功」——题目全是「不让用补全,手写」级别的操作。上线一天刷屏,程序员群体自嘲式晒分。
点评:娱乐皮、体检芯:分不清哪些代码是自己写的团队,这测试比自己开会问有用。(Hacker News / codeset(2026-09-06))
2. 小米开源通用表格大模型 TabLDM:一个模型免调参通吃表格分类和回归
IT之家 9 月 5 日消息:小米发布 Xiaomi-TabLDM,单一预训练模型免调参适配表格数据的分类与回归任务,OpenML-CTR23 回归登顶、TALENT 二分类第一、TabArena 回归第二,且训练时间比榜首省 82%。表格模型长期是「每家一张卷」,能一个模型过多个基准的开源选手不多见。
点评:做业务报表预测、风控评分这类活的团队值得拉下来跑自己的数据——开源+省训练时间是真金白银。(IT之家(2026-09-05))
3. GPT-6 Astra 解开 5 道人类没解完的数学猜想:68 道题里唯一非零分
Epoch AI 与曼彻斯特大学 9 月 4 日论文披露 FrontierMath Erdős 基准结果:68 道人类未解数学猜想,GPT-6 Astra 标准测试解出 2 道、放宽预算共 5 道,其余四个顶级模型零分,全部尝试花费超 22 万美元。此前该系列基准的天花板一直是「模型全零分」。
点评:「唯一非零分」是里程碑也是营销素材——22 万美元换 5 道题,性价比争议留给学术界,先记住这是「没见过的题」。(网易科技 / Epoch AI(2026-09-04))
4. 2014 年的老显卡跑满 256K 长上下文:Qwen3.8-Flash-Next 社区实测
9 月 4 日技术社区汇总:在 Tesla T4(2014 年发布的老 GPU)配 DDR4 内存的机器上,阿里 Qwen3.8-Flash-Next 可跑满 256K 上下文。旧硬件跑大模型的门槛再降一档——长上下文过去默认要新卡大显存,这个演示把「能不能跑」和「跑得爽不爽」拆开了。
点评:个人开发者本地跑长文档的最便宜方案又近了一步,但速度体验社区没报数,别指望生产级。(技术博客 jishuzhan(2026-09-04))
5. 企业实测:法律平台 Legora 用 GPT-6 Astra 几分钟核对 41 份财务文件,揪出全部 4 处预埋错误
量子位 9 月 4 日报道(OpenAI 发布材料案例):法律平台 Legora 一次核对 41 份财务文件,几分钟找出预埋的 4 个错误,含收入附注里 50 万英镑的差额;该任务比上一代快近 40%,但全任务平均提升约 3%。
点评:厂商案例集,数字要打折看——但「快 40%、平均只提 3%」这组对比很诚实:单点任务惊艳,日常全能还是老样子。(量子位(2026-09-04))
6. 智东西横评 GPT-6 Astra 成绩单:GPQA 96.0%、数据库迁移 63.9% 创新高,编程榜被 Meta 反超
9 月 4 日报道:Astra 在 FrontierMath Tier 4 得 97.6%、GPQA Diamond 96.0%、内部数据库迁移任务 63.9%(超过 Fable 5.1 的 57.8%);但 DeepSWE 编程基准 74.1% 被 Meta Muse Spark 1.3 的 75.4% 反超。新旗舰不是全科目第一,偏科图谱比总分更接近真相。
点评:选型看分项:要数据工程活 Astra 强,要写代码 Muse Spark 略胜——一张总分榜藏不住这事。(36氪 / 智东西(2026-09-04))
7. 「三冠军」分家:本周 AI 办公榜通用推理 Astra 居首、编程 Fable 5.1 居首、速度 Gemini 3.8 Flash 全站第三
Artificial Analysis 9 月 5 日随 v4.2 口径同步公布三张分类榜:通用推理 Claude Fable 5.1 让位 GPT-6 Astra;编程榜 Claude Fable 5.1 守住头名;输出速度榜 Gemini 3.8 Flash 每秒 305 词元排全站第三。没有全能冠军的一周,按用途选模型成了更实际的策略。
点评:三张分榜比一张总榜有用:推理、写码、快是三种预算三种活,对号入座。(Artificial Analysis(2026-09-05))
8. 腾讯混元 Hy4-Preview 首秀 Arena 编程榜:第 10 名,但只打了 1600 场
Arena 编程榜快照显示:腾讯 hy4-preview 以 1623 分位列第 10,对战样本仅 1600 场、置信区间正负 16 分。新模型冲榜的常规剧本——先占坑攒样本,名次等对战数上来再定论。
点评:小样本第 10 和厚样本第 10 不是一回事,观察名单+1,结论先不下。(Arena 编程榜快照(2026-09-04))
大家都在看
- GPT-6 Astra 发布,OpenAI 总裁布罗克曼放话「欢迎来到 AGI 时代」(IT之家)
- OpenAI 证实「wiki 事件」并承诺披露框架(TechCrunch)
- AWS-bench 开源两天聚热:AI 智能体云上实操考卷(昨日刊续热)
- Flathub 宣布下架违规 AI 编码应用,开源商店首次立规(OMG Ubuntu)
明日关注
- ① Arena 智能体榜对战样本继续累积:Claude Opus 5 头名成色在样本翻倍后是否还稳
- ② ARC-AGI-3「双成绩」发酵:看有没有第三方机构公开复测流程,厂商自测口径会不会被迫统一
- ③ AA v4.2 私有库改版的复核数据:开源阵营(Kimi K3、DeepSeek)在新口径下的错题分布
物界前沿