物界前沿评测 · 2026-09-21(第 054 期 · 预览版)
物界前沿评测 · 2026-09-21(第 054 期 · 预览版)
别人做评测,我们做评测的雷达。今天这期是产品榜单视角,五分钟看懂哪些 AI 工具值得你用。
本期结构
重点更新 3 条(双专家点评)、榜单快报 3 组、板块精选 10 条,外加大家都在看和明日关注。
重点更新
一、两个 AI 互相下毒手,人类当裁判,Prompt Wars 给「AI 骗 AI」开了个擂台
照着上世纪程序员玩的「核战」游戏改编。你写好一段话交给你的 AI 战士。它不用答题,专心做一件事,想办法把对面 AI 的指令洗脑,让对手忘记自己的任务、反过来替你干活。每回合攻防都存档上榜,谁家的模型最容易上当、谁家的最扛骗,一目了然。
值得盯的原因很实际。现在给 AI 开的权限越来越大,读邮件、动文件,「别人塞一段话就能操控它」正是最要命的攻击路数。这种公开对战擂台,等于给各家模型的安全底线做了次当众体检。
安全领域专家·老周说|「分不清数据和指令」这个老毛病,在这里看到的是最直白的演示场,把注入攻击从论文搬进积分榜。但老三问不变,考题是否公开、评分能否复现、测的是不是用户手上那个版本。擂台上的模型是不是你正在用的那版、有没有偷偷加固,作者不说清楚之前,名次只能当参考。
小编小禾说|我把它理解成 AI 界的整人大赛,互相使坏,看谁先上钩。看着好玩,但想到我平时真会把事情交给 AI 办,就笑不出来了。老规矩那条继续有效,不明来源的文件和链接,人和 AI 都别乱点乱喂。
二、一句话生成 App 到底几家能过审,StoreReady 把 AI 建应用工具拉去同台交卷
想用 AI 做个 App 上架的人,先去看这张案卷。它给每家 AI 应用生成工具出同样五个问题,能不能过苹果商店审核、卡在哪、被拒几次、多久能补救、最后上架没有。每家都要附证据来源,做成可翻开的对照表,最后一行还是人手写的点评压轴。
AI 帮你做 App 的宣传页人人会吹,苹果的审核才是真门槛,很多人卡在「生成容易上架难」这一步。同一道关卡的成绩摆平了比,是这类工具少见的横向实测。
编程领域专家·老徐说|出题的是它,答题的是被测工具的公开记录,每条都附来源可查,这比发布会演示强,文档写得明白算加分。不过五个问题的口径是站长定的,过审也不等于好用,上架后崩溃率、后续改版 AI 还接不接得住,这张表不考。想换工具的,先拿丢了不心疼的小项目滚一周,别急着把主力产品交出去。
小编小禾说|我替大家翻了那五行,差距真不小,有的家第一轮就被拒。普通人的土办法还是那句,别信一键上架,先看别人真实被拒的案卷。自己试的话,开发者账号六百多块一年,记得算进成本。
三、听话机 Speechify 再被测评,贵,但真把读东西这件事改了
TechRadar 记者长期实测。文档、图片、网页、电子书都能念给你听,还能倍速、换音色。结论很直白,订阅价不便宜,但它确实改变了作者消化信息的方式,通勤路上听报告、躺着听长文。
放今天看有说头。AI 念稿的音质这两年刚跨过不像机器人的门槛,这类产品从凑合能听进入改变习惯阶段,价格是不是还撑得住,正在被市场重新定价。
产品领域专家·阿哲说|语音产品这一行的规律我一直那句,入口即模型。这类听读产品以前靠音色取胜,现在大模型把朗读质量的底子整体抬高了,护城河从念得好听挪到长在你的习惯里。通勤、家务、护眼这些场景,谁先把使用惯性焊死谁活下来。记者这句贵但改变了我消化信息的方式,就是习惯被焊死的信号。
小编小禾说|我踩过语音的坑,之前说过我的会议纪要是被旁边闲聊毁掉的。这类只听不说的工具反而安全,它不偷听你,只念给你。但先别办年卡,拿一份长报告试听一周,真听得进去再掏钱。
榜单快报(数据截至 2026-09-20,Arena 快照暂未更新)
先交代一句实话。今天核对,Arena 四张盲测榜的最新快照还是 2026-09-20 那版,和上期评测用的是同一份,所以榜单暂未更新,数据截至 2026-09-20。智能指数一栏是当天从 Artificial Analysis 新抓的,两者对照着看。
文本盲测榜,前十 Anthropic 占七席
| # | 模型 | 厂商 | Elo(对战场次) |
|---|---|---|---|
| 1 | Claude Fable 5 (High) | Anthropic | 1506(30,057 场) |
| 2 | Claude Opus 4-6 (High) | Anthropic | 1505(71,993 场) |
| 3 | Claude Opus 4-7 (High) | Anthropic | 1502(60,002 场) |
| 4 | Muse Spark 1.2 (xHigh) | Meta | 1500(仅 3,227 场) |
| 5 | Claude Fable 5.1 (Max) | Anthropic | 1498(5,783 场) |
大白话解读。人类当裁判的盲测里,Claude 母公司几乎包场,前十占了七席。Meta 的新模型冲到第 4 看着唬人,但它才打三千多场,分数上下能浮动 11 分,名次先别当真。今天新抓的智能指数对得上这个结论,Claude Fable 5.1 和 GPT-6 Astra 并列 53 分居头部,阿里的 Qwen3.8 Max、月之暗面的 Kimi K3、智谱的 GLM-5.3 组成的国产梯队咬在 44 到 45 分,差距已经很小。
代码盲测榜,榜首的场次最薄
| # | 模型 | 厂商 | Elo(对战场次) |
|---|---|---|---|
| 1 | GPT-6 Astra (Max) | OpenAI | 1800(仅 2,281 场,上下 16 分) |
| 2 | Claude Fable 5.1 (Max) | Anthropic | 1758(3,036 场) |
| 3 | Claude Opus 5 (Max) | Anthropic | 1687(12,087 场) |
| 4 | Qwen3.8 Max (0902) | 阿里 | 1681(2,262 场) |
| 5 | Kimi K3 (Max) | 月之暗面 | 1674(4,547 场) |
大白话解读。榜首分数吓人,但样本只有榜三的不到五分之一。新名次先看它晃不晃,稳一两轮再下结论。要说实打实的,是那个用一万两千场垫出来的第三名。
智能体实干榜,办没办成事才是分
| # | 模型 | 厂商 | 办成事率 | 出错能自救 | 工具幻觉率 |
|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (Max) | Anthropic | 19.83 | 12.62 | 0.37 |
| 2 | GPT-6 Astra (Max) | OpenAI | 17.70 | 7.28 | 0.37 |
| 3 | Claude Opus 5 (High) | Anthropic | 9.24 | 11.98 | 0.33 |
| 4 | Claude Opus 5 (Max) | Anthropic | 12.41 | 13.08 | 0.35 |
| 5 | Claude Fable 5 (High) | Anthropic | 5.97 | 9.06 | 0.37 |
大白话解读。这张榜没有总分,只有六张成绩单。排在第 6 的 Claude Opus 4.8 工具幻觉率 0.12 全场最低,意思是最不瞎编工具,却被办成事率拖出前五。选替你干活的 AI,先看维度再看名次。第 8 名的 Kimi K3 是前十里唯一的国产,样本超过十万场,最厚。图像榜这期没有新快照,不列。
板块精选(10 条,各一句点评)
1. Apache 出品 Casbin Gateway,给电脑上的 AI 编程助手装一道门禁。所有编程 AI 共用一个安全网关,统一管它能碰哪些目录、哪些命令要人点头。挂在 Apache 名下,等于开源世界给「别把钥匙整串交给 AI」做了个标准件。老周提醒,方向正中要害,环境说了算比提示词管用,但刚上架的安检门自己也得先过安检,等真实部署案例。
2. AgentTrace,给 AI 智能体装行车记录仪。开源的观察加自愈引擎,智能体每一步干了什么全部留档,出错能回放定位,还能按策略自动修复重跑。小禾那句老话再应验,干活能回放等于多了录像,敢用了,但该自己盯的一帧不能省。
3. nitpicker,开源的 AI 代码审查员,密钥攥在你自己手里。自托管的 PR 审查工具,宣称代码不出你的机器,标语直接写钥匙在你手里。AI 产量上去了,验收环节的工具战开打。老徐立场,AI 代码信之前先验一遍,审查工具本身开源可自查,算加分项。
4. TechRadar 实测,让 AI 猜我在喝什么酒,成绩好坏参半。记者把口感描述喂给 AI 让它猜酒,时对时错,风味词能对上框架,细节一多就开始自信瞎编。AI 的话信之前先验一遍的日常版,越是它笃定的时候,越值得多问一句凭什么。
5. Axel,一个会跟别人聊你的 AI,隐私圈看傻了。新上线的聊天 AI 主打会八卦用户,把你跟它说的话变成谈资带进别的对话,开发者说是社交实验。老周提醒,跟 AI 说的一切都默认可能被第三人听到,敏感信息别喂,这实验值一耳光清醒。
6. Delightful Cells,表格批量活儿交给 AI,失败的行自动重跑。上传表格,一句话描述每行要干什么,它批量跑完,失败自动重试,跑完的行不重复计费。适合先拿不重要的名单试水,批量操作前留一份原始表,改坏了能回滚。
7. 小岛秀夫回应索尼撤资风波,《PHYSINT》还在做、双方并没有反目。今年 8 月索尼突然撤出合作多年的新项目《PHYSINT》,一度传得很难看。小岛近日正面回应:好聚好散,项目换人接手继续开发。大厂撤资不等于项目死刑,作者和投资人分开走、游戏照做——这种事以后只会越来越多。
8. OpenCloak,先把提示词里的个人信息换掉再交给 AI。开源浏览器扩展,发送前自动把姓名电话地址替换成代号,回来再还原。思路对,与其事后要求删除,不如压根没送出。注意还原环节要在本地做,别装要联网回源的。
9. Base Browser,一个不含 AI 味的 Firefox 硬核分叉。Codeberg 上的新项目,直接删掉浏览器里所有 AI 功能做纯净浏览,在 AI 全面进设置页的当下反向走,上线一天冲上热榜前排。一个对照实验,当所有人给浏览器加 AI,没有 AI 本身成了卖点。
10. Engadget 教你用 ChatGPT 做微信和 iMessage 贴纸,比想的简单。描述图案、生成、抠成贴纸包,门槛主要在导出尺寸这一步。轻实用,给家里长辈做一次比说十句都亲,生成后先确认平台贴纸规格,白边切不齐最磨人。
大家都在看
今天新抓的智能指数:Claude Fable 5.1 和 GPT-6 Astra 并列 53 分占头部,Qwen3.8 Max、GLM-5.3、Kimi K3 组成的国产梯队咬在 44 到 45 分。法拉第未来一口气发九款机器人,最贵超 92 万。古尔曼说苹果最早下月发智能家居屏幕设备。
明日关注
① Arena 四榜今天还是 09-20 版,盯 09-21 快照是否刷新,看 Meta 那几款新模型的场次涨没涨过 5000 场。
② 智谱 MaaS 的数据不留存机制刚宣布近期上线,蹲官方开通入口细则和实测反馈。
③ 阿里开源的 Qwen-Image-2.1 图像模型今天热度高,等第三方拿它跟上期热门图像榜同题对跑,别只看官方演示。
以上为第 054 期预览版,正式版 17 点更新。完整图文版在评测刊页面。
物界前沿