物界前沿评测 · 2026-09-23(第 056 期 · 预览版)
别人做评测,我们做评测的雷达。今天这期聊三件跟 AI 表现直接有关的事,再附三张榜和十条精选。
本期结构
重点更新 3 条(双专家点评)、榜单快报 3 组、板块精选 10 条,外加大家都在看和明日关注。
重点更新
一、帮你在网上比价的 AI,还是分不清「查到的」和「编出来的」
彭博社 9 月 22 日的一篇通讯说,替人挑货比价的 AI 购物助手,仍然很难分清网页上哪些是事实、哪些是编出来的。这类助手的工作是读商品页、看评论、比价格,再把结论交给你。它读到的内容里,有商家自己填的参数,也有来路不明的说法,两者混在一起。
跟你有什么关系。以后拿 AI 挑东西,让它只做筛选这一步,参数自己回官网对一遍,付款和下单自己点。多花五分钟,少踩一次坑。
产品领域专家·阿哲说|购物这件事的胜负点一直不在谁挑得快,在你信不信它。上周上线的 Meta Muse 也把购物推荐当卖点,讨论的焦点同样落在信不信上。我的建议是先让它干筛选,付款和下单自己点,参数回官网对一遍。
小编小禾说|上周我让 AI 帮我挑充电宝,它报了一个「一万毫安时只有 80 克」的机型,这个数字我不信。现在的用法是让它列三个候选项,参数我自己去官网一条条核。
二、一位开发者把 Devin 的新版本用了一轮,写下了卡住的地方
9 月 22 日,一位开发者在自己的博客上贴出 Devin 的上手记录。他把这一套都试了一遍:桌面应用、命令行工具、新出的写代码模型 SWE-2(Devin 自家的模型),以及把几个模型合起来用的模式。Devin 是能自己读代码、自己改文件的 AI 编程工具。这篇是个人试用记录,没有公开跑分。
跟你有什么关系。你手上要是有一个跑了很久的老项目,先别急着把它交给这类工具。找个小模块试一周,看它报错之后能不能自己改回来。
编程领域专家·老徐说|单人一次上手的记录,值钱的地方是它写了哪一步卡住。我看这类文章先找两样东西:仓库有多大、报错之后它能不能自己改回来。这两样官方演示里从来不提。要接自己的项目,先拿丢了不心疼的小模块滚一周。
小编小禾说|我看不懂 SWE-2 是什么,只关心它能不能把我那个跑了三年的小项目改明白。要是得先把项目怎么启动教给它,那还不如我自己动手。先记账,等第二个人贴出跑通自己项目的记录再考虑。
三、星海争霸的排位赛里混进了 AI,有人教你从操作里认出它
一位开发者写了篇文章,讲他在星海争霸的线上排位赛里怎么认出对面是 AI。星海争霸是 1998 年的老对战游戏,排位赛指按胜率分级的线上对局。他给的办法是从操作节奏、开局习惯这些细节里找规律,给每个玩家做一份「指纹」。文章是作者自己的观察,没有第三方核对。
跟你有什么关系。这套「给行为做指纹」的思路,正在被搬进作业查重和招聘筛选。以后看到「像 AI 写的」结论,先问一句有没有第二种证据。
安全领域专家·老周说|认出机器和人,本质上是身份问题。文章里没写误判率是多少,这是最关键的一项。同一套「像机器就下判断」的做法,搬到作业查重、招聘筛选上,判错一次的成本全落在人身上。
小编小禾说|游戏里认错对手,最多骂一句重开。这套判断搬到考试和论文上我就不放心了:检测工具给的分只是线索,不是判决书。
榜单快报(榜单暂未更新,数据截至 2026-09-21)
先交代一句实话。今天核对过,Arena 的最新快照还是 2026-09-21 那版,跟上期用的是同一份,所以榜单暂未更新,数据截至 2026-09-21。今天也没拿到能替换的新榜,宁可照实标注,不拿旧数据充新。上期上过的视觉盲测榜这次撤下,换进上期没用过的文本盲测榜。
文本盲测榜,前五名只差 8 分
| # | 模型 | 厂商 | 分数(人类投票算出来的) |
|---|---|---|---|
| 1 | claude-fable-5-high | Anthropic | 1506(30,057 场) |
| 2 | claude-opus-4-6-high | Anthropic | 1505(71,993 场) |
| 3 | claude-opus-4-7-high | Anthropic | 1502(60,002 场) |
| 4 | muse-spark-1.2 (xHigh) | Meta | 1500(3,227 场) |
| 5 | claude-fable-5.1-max | Anthropic | 1498(5,783 场) |
大白话解读。前五名只差 8 分,头名和第五名基本算打平。第四名是 Meta 的 Muse Spark,只打了 3,227 场,榜上标的浮动是 11 分,比它跟第三名的差距还大,名次先别当真。前五名里四席是 Anthropic 家的 Claude。另外,这张榜上次更新是 9 月 13 日,比快照日期还早八天。
编程盲测榜,榜首的场次最薄
| # | 模型 | 厂商 | 分数(括号里是对战场次) |
|---|---|---|---|
| 1 | gpt-6-astra-max | OpenAI | 1800(2,281 场,上下 16 分) |
| 2 | claude-fable-5.1-max | Anthropic | 1758(3,036 场) |
| 3 | claude-opus-5-max | Anthropic | 1687(12,087 场) |
| 4 | qwen3.8-max-0902 | 阿里 | 1681(2,262 场) |
| 5 | kimi-k3-max | 月之暗面 | 1674(4,547 场) |
大白话解读。第一名 1800 分,跟第二名拉开 42 分,看着很稳。它的场次只有 2,281 场,浮动 16 分;第三名 12,087 场,浮动只有 7 分。场次薄的分数经不起多看。还有一件事:这张榜上次更新是 9 月 11 日,十三天没动过,前五名里有四个的场次不到五千。
智能体实干榜,多了一项「工具说错话」
| # | 模型 | 厂商 | 样本(对战场次) | 工具说错话的比例 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (Max) | Anthropic | 13,320 | 0.37 |
| 2 | GPT 6 Astra (Max) | OpenAI | 10,372 | 0.37 |
| 3 | Claude Opus 5 (High) | Anthropic | 24,794 | 0.33 |
| 4 | Claude Opus 5 (Max) | Anthropic | 19,934 | 0.35 |
| 5 | Claude Fable 5 (High) | Anthropic | 38,293 | 0.37 |
大白话解读。这张榜考的是能自己调工具、连着干好几步的 AI,行内叫智能体。它不排总分,六项分开算:办成事、少说错话、听不听指令、出错后能不能自己爬起来。「工具说错话」指它把没发生的工具调用说成真发生了。前五名这一项都在 0.33 到 0.37 之间,差别很小,拉开名次的是办成事那一项:第一名 19.83,第二名 17.7。场次最厚的不是头名,第四名打了一万九千多场。
板块精选(10 条,各一句点评)
1. 给 AI 助手搭一个不会闯祸的练习场。Firedrill 是个测试框架,你先造几个假工具、假数据,再让 AI 助手在上面干活,然后检查它每一步调了什么、有没有按你定的规矩走。假工具就是不会真发邮件、不会真转账的替身。难点在后面:你得先写清楚「什么算干对了」,这一步没人能替你做。
2. DeepMind 写了篇长文,讲怎么动态地考模型。谷歌 DeepMind 的研究院发了一篇文章,主张用动态的办法测试前沿模型的能力:不靠一张固定卷子,而是随着模型变强同步换题。文章讲的是方法,没有给出具体成绩。「卷子固定、模型越来越大」是眼下所有榜的共同毛病,动态出题这个方向站得住,但出题方自己也该被同样标准检查。
3. 一所大学的教务长,被校报查出多篇署名文章「像 AI 写的」。达特茅斯学院的校报做了一次调查,把该校教务长 2026 年发的评论文章和学术文章过了一遍 AI 检测工具,中位数落在「像 AI 写的」区间。检测工具给的是概率,校方和当事人还没有正式回应。又是同一类事故:分数高不等于证据,该追问的是谁有权拿这个分数去质疑一个人的署名。
4. OPPO 出了个 499 元的「AI 心力球」,一个新品类。OPPO 在 9 月 22 日的发布会上带来一款穿戴新品,体验价 499 元,官方主打把 AI 能力放进一个随身小球里。发布会上没有给续航、每天会用几次这类数据。新品类先别抢首发,穿戴设备能不能留下来,看的是充电顺不顺手、戴一天会不会忘。
5. 一个专攻古希腊残片的 AI,想把缺掉的字补出来。Wired 报道,研究者做了一个叫 Apollo 的模型,专门对付图书馆里破损严重的古希腊纸莎草残片,目标是把缺的字补上、把出处和年代对上。这类残片在几十万片量级,很多已经破到人读不下去。补字最怕补得通顺却补错,先看有没有公开的对照答案。
6. 一个开源的聊天界面,在线模型和本地模型都能接。IntelliChat 是开源的聊天前端,用 Next.js 写,目标是把好几家模型的接口接进同一个界面。开源的意思是代码可以自己部署、自己改。换模型不用换界面,对同时用好几家的人是刚需;自己部署要自己管密钥、管日志,图省事的人不划算。
7. 开源社区开始给自己立规矩:AI 写的代码怎么进仓库。一篇文章梳理了开源项目最近的动作:从最早一律禁止,到给 AI 助手写专门的说明文件(比如 AGENTS.md),再到担心自动审查机器人本身被塞指令,文里举了内核自测、QEMU 规则草案几个例子。规矩从「禁止」变成「写清楚怎么用」,这一步走对了;短板在审查这一环,那谁来审机器人。
8. 给 AI 剪辑助手准备的「爆款镜头」参考库。RetentionVolt 收了 50 多万条剪接点和开头钩子,来自一千多位短视频作者,按周更新,并整理成 AI 助手能直接调用的接口,这个接口方式叫 MCP。素材库的价值在能检索,风险在趋同:大家都照同一批爆款剪,画面会越来越像。当参考用,别当模板抄。
9. Rabbit 放出一个不用买它家硬件的 AI 助手。The Verge 报道,Rabbit 上线一个能单独运行的 AI 助手,不买它那台 R1 设备也能用。Rabbit 之前那台硬件卖得一般,这次把软件单独拿出来。判断标准还是两条:能不能替你办成事、出错后你找不找得到它干了什么。
10. 「会跟你顶嘴」的 AI 创业团队工具。LiveCrew 给创始人配四个 AI 角色,各管一块活,会互相挑错并附上依据。产品页的演示里,有人改完文案,另一个角色会回一句「这个决定我不同意」,然后列理由。不同来路的 AI 互相审,比同一个 AI 自查难糊弄;它到底挑不挑得出真错,得有人拿自己的项目跑一遍。
大家都在看
马斯克的 Grok Bot 上线一个月用户破 40 万。微软 Xbox 又一轮裁员,多家工作室并入动视。有人在 Hacker News 上发现 Couchsurfing 整站被 AI 重写,配图也是官方生成的。AstroForge 把下一次小行星任务的指挥权交给 AI。
明日关注
① 刚发布的 Claude Opus 5.5 和 GPT-6 Sol、Luna 还没进 Arena 快照(快照停在 2026-09-21),等下次刷新看名次稳不稳。
② 云栖大会开到 9 月 24 日,AgentCore 和 Qwen4 的第三方跑分还没出,官方口径先记账。
③ Meta 的 Muse 上线一周用户破 50 万,等第三方拿出实际任务完成率,再谈它算不算购物入口。
以上为第 056 期预览版,完整图文版在评测刊页面。
物界前沿