物界前沿评测 · 2026-09-20
第 053 期预览版出炉。今天的刊有点特别,榜单快照停在 9 月 19 日没刷新,我们干脆把五张榜叠在一起对了遍账,顺手把「谁最强」这个老问题拆了。
重点更新三条
一、研究机构把「AI 在物理世界出事」立成了独立科目。Micro1 在 9 月 18 日发报告说,模型开始驱动浏览器、调用接口、操作设备之后,出错的代价从「看错一句话」变成「做错一件事」,退错款、下错单、发错设备指令都算。方向我们认,出处要多想一层,报告是一家卖 AI 工程师智能体的公司自己出的,风险清单的尺子在谁手里,比标题吓人程度重要。给普通人的动作很具体,凡是能给钱、能改东西、能开关设备的 AI,权限能开多小开多小,重要操作留人工确认那一步。
二、有人把「管住 AI 员工」写成了三张开源表格。GitHub 上刚放出的三个治理模板(MIT 协议,免费),一张决策表划清「什么 AI 自己做主、什么必须停下来问人」,一个完整示例,外加一份微软 Agent 365 落地模板。治的是当下真实窘境,AI 已经上岗了,权限清单还写在产品经理脑子里。提醒一句,一人仓库、没有对抗测试,表格写得顺,得看它拦不拦得住真越界的模型。普通人也能照着问自己用的工具三个问题。它现在能替我干哪些事?哪几件要我先点头?能不能一键收回?
三、AI 编程账单第一次能查「白跑的重试」。Show HN 上的新工具 AgentMeasure 直接读本机已有的 Codex/Claude Code 日志,列出哪一步在原地反复摔跤,再按订阅费折算结算单,数据不出本机。用包月编程智能体的人第一次能拿账本验收它到底干没干成活。刚出生一天的样机,先拿自己项目跑一周,别急着当报销依据。
榜单快报(数据截至 2026-09-19,AA 榜实时于 09-20)
- 综合智力榜,Anthropic 的 Claude Fable 5.1 和 OpenAI 的 GPT-6 Astra 并列 53 分领跑,同分不同价,GPT-6 干同样的活花钱更少。
- 文本盲测榜,前十 Anthropic 占七席,第 1 到第 4 名只差 6 分,约等于打平;第 4 名 Meta 只有 3,227 场对战,不到榜一零头。
- 编程盲测榜,头名 GPT-6 Astra 1800 分但样本全榜最薄(2,281 场、正负晃 16 分);中国阵营占住三席以上,阿里 Qwen3.8 一家坐三把椅子(第 4、6、9),Kimi K3 第 5 贴住它们。
- 智能体实干榜,考的是真活。Kimi K3 背后 10.8 万场对局、全榜样本最厚;工具幻觉率(凭空捏造接口就调的比例)前十普遍 0.37,Claude Opus 4.8 独做到 0.12,但综合名次被「办成事率」拖到第 6。
- 速度榜易主,Celeris-1 每秒约 1,567 个字、比第二名快三倍多;开源权重头名仍是智谱 GLM-5.3(45 分)。
- 对总账,智力、速度、省钱、开源、干活,今天由五个不同的模型各拿一个第一。「哪个最强」这个问法过时了,「哪个最配你这件活」才问得出答案。
板块精选一句话版
- 视觉盲测前三只差 9 分,认图读表这事头部已打平,挑便宜的用。
- Meta Muse Spark 三个版本同时铺上多张榜,押注重,样本普遍薄。
- 榜单新闻里最该看的数字不是名次,是括号里那个对战场次。
- 西语系厂商上架「AI 边界防护」自荐页,无客户案例无可验证数据,按宣传页处理。
明日关注
① Arena 快照停在 9 月 19 日(页面自报更新更早),盯官方刷新,重点看编程榜冠军场次涨没涨过 5,000
② Meta Muse Spark 系列的涨场速度,攒够万场样本名次才算站稳
③ Micro1 物理风险报告有没有第三方复测或点名反驳,扛住同行拆台之前只算提案
完整榜单表格和专家点评在当天刊页里,欢迎来聊你用 AI 干活白跑过多少冤枉钱。
物界前沿