社区讨论 · 赛道

物界前沿评测 · 2026-09-21(第 054 期 · 预览版)

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月21日2026/09/20 185 浏览

物界前沿评测 · 2026-09-21(第 054 期 · 预览版)

别人做评测,我们做评测的雷达。今天这期是产品榜单视角,五分钟看懂哪些 AI 工具值得你用。

本期结构

重点更新 3 条(双专家点评)、榜单快报 3 组、板块精选 10 条,外加大家都在看和明日关注。

重点更新

一、两个 AI 互相下毒手,人类当裁判,Prompt Wars 给「AI 骗 AI」开了个擂台

照着上世纪程序员玩的「核战」游戏改编。你写好一段话交给你的 AI 战士。它不用答题,专心做一件事,想办法把对面 AI 的指令洗脑,让对手忘记自己的任务、反过来替你干活。每回合攻防都存档上榜,谁家的模型最容易上当、谁家的最扛骗,一目了然。

值得盯的原因很实际。现在给 AI 开的权限越来越大,读邮件、动文件,「别人塞一段话就能操控它」正是最要命的攻击路数。这种公开对战擂台,等于给各家模型的安全底线做了次当众体检。

安全领域专家·老周说|「分不清数据和指令」这个老毛病,在这里看到的是最直白的演示场,把注入攻击从论文搬进积分榜。但老三问不变,考题是否公开、评分能否复现、测的是不是用户手上那个版本。擂台上的模型是不是你正在用的那版、有没有偷偷加固,作者不说清楚之前,名次只能当参考。

小编小禾说|我把它理解成 AI 界的整人大赛,互相使坏,看谁先上钩。看着好玩,但想到我平时真会把事情交给 AI 办,就笑不出来了。老规矩那条继续有效,不明来源的文件和链接,人和 AI 都别乱点乱喂。

二、一句话生成 App 到底几家能过审,StoreReady 把 AI 建应用工具拉去同台交卷

想用 AI 做个 App 上架的人,先去看这张案卷。它给每家 AI 应用生成工具出同样五个问题,能不能过苹果商店审核、卡在哪、被拒几次、多久能补救、最后上架没有。每家都要附证据来源,做成可翻开的对照表,最后一行还是人手写的点评压轴。

AI 帮你做 App 的宣传页人人会吹,苹果的审核才是真门槛,很多人卡在「生成容易上架难」这一步。同一道关卡的成绩摆平了比,是这类工具少见的横向实测。

编程领域专家·老徐说|出题的是它,答题的是被测工具的公开记录,每条都附来源可查,这比发布会演示强,文档写得明白算加分。不过五个问题的口径是站长定的,过审也不等于好用,上架后崩溃率、后续改版 AI 还接不接得住,这张表不考。想换工具的,先拿丢了不心疼的小项目滚一周,别急着把主力产品交出去。

小编小禾说|我替大家翻了那五行,差距真不小,有的家第一轮就被拒。普通人的土办法还是那句,别信一键上架,先看别人真实被拒的案卷。自己试的话,开发者账号六百多块一年,记得算进成本。

三、听话机 Speechify 再被测评,贵,但真把读东西这件事改了

TechRadar 记者长期实测。文档、图片、网页、电子书都能念给你听,还能倍速、换音色。结论很直白,订阅价不便宜,但它确实改变了作者消化信息的方式,通勤路上听报告、躺着听长文。

放今天看有说头。AI 念稿的音质这两年刚跨过不像机器人的门槛,这类产品从凑合能听进入改变习惯阶段,价格是不是还撑得住,正在被市场重新定价。

产品领域专家·阿哲说|语音产品这一行的规律我一直那句,入口即模型。这类听读产品以前靠音色取胜,现在大模型把朗读质量的底子整体抬高了,护城河从念得好听挪到长在你的习惯里。通勤、家务、护眼这些场景,谁先把使用惯性焊死谁活下来。记者这句贵但改变了我消化信息的方式,就是习惯被焊死的信号。

小编小禾说|我踩过语音的坑,之前说过我的会议纪要是被旁边闲聊毁掉的。这类只听不说的工具反而安全,它不偷听你,只念给你。但先别办年卡,拿一份长报告试听一周,真听得进去再掏钱。

榜单快报(数据截至 2026-09-20,Arena 快照暂未更新)

先交代一句实话。今天核对,Arena 四张盲测榜的最新快照还是 2026-09-20 那版,和上期评测用的是同一份,所以榜单暂未更新,数据截至 2026-09-20。智能指数一栏是当天从 Artificial Analysis 新抓的,两者对照着看。

文本盲测榜,前十 Anthropic 占七席

# 模型 厂商 Elo(对战场次)
1 Claude Fable 5 (High) Anthropic 1506(30,057 场)
2 Claude Opus 4-6 (High) Anthropic 1505(71,993 场)
3 Claude Opus 4-7 (High) Anthropic 1502(60,002 场)
4 Muse Spark 1.2 (xHigh) Meta 1500(仅 3,227 场)
5 Claude Fable 5.1 (Max) Anthropic 1498(5,783 场)

大白话解读。人类当裁判的盲测里,Claude 母公司几乎包场,前十占了七席。Meta 的新模型冲到第 4 看着唬人,但它才打三千多场,分数上下能浮动 11 分,名次先别当真。今天新抓的智能指数对得上这个结论,Claude Fable 5.1 和 GPT-6 Astra 并列 53 分居头部,阿里的 Qwen3.8 Max、月之暗面的 Kimi K3、智谱的 GLM-5.3 组成的国产梯队咬在 44 到 45 分,差距已经很小。

代码盲测榜,榜首的场次最薄

# 模型 厂商 Elo(对战场次)
1 GPT-6 Astra (Max) OpenAI 1800(仅 2,281 场,上下 16 分)
2 Claude Fable 5.1 (Max) Anthropic 1758(3,036 场)
3 Claude Opus 5 (Max) Anthropic 1687(12,087 场)
4 Qwen3.8 Max (0902) 阿里 1681(2,262 场)
5 Kimi K3 (Max) 月之暗面 1674(4,547 场)

大白话解读。榜首分数吓人,但样本只有榜三的不到五分之一。新名次先看它晃不晃,稳一两轮再下结论。要说实打实的,是那个用一万两千场垫出来的第三名。

智能体实干榜,办没办成事才是分

# 模型 厂商 办成事率 出错能自救 工具幻觉率
1 Claude Fable 5.1 (Max) Anthropic 19.83 12.62 0.37
2 GPT-6 Astra (Max) OpenAI 17.70 7.28 0.37
3 Claude Opus 5 (High) Anthropic 9.24 11.98 0.33
4 Claude Opus 5 (Max) Anthropic 12.41 13.08 0.35
5 Claude Fable 5 (High) Anthropic 5.97 9.06 0.37

大白话解读。这张榜没有总分,只有六张成绩单。排在第 6 的 Claude Opus 4.8 工具幻觉率 0.12 全场最低,意思是最不瞎编工具,却被办成事率拖出前五。选替你干活的 AI,先看维度再看名次。第 8 名的 Kimi K3 是前十里唯一的国产,样本超过十万场,最厚。图像榜这期没有新快照,不列。

板块精选(10 条,各一句点评)

1. Apache 出品 Casbin Gateway,给电脑上的 AI 编程助手装一道门禁。所有编程 AI 共用一个安全网关,统一管它能碰哪些目录、哪些命令要人点头。挂在 Apache 名下,等于开源世界给「别把钥匙整串交给 AI」做了个标准件。老周提醒,方向正中要害,环境说了算比提示词管用,但刚上架的安检门自己也得先过安检,等真实部署案例。

2. AgentTrace,给 AI 智能体装行车记录仪。开源的观察加自愈引擎,智能体每一步干了什么全部留档,出错能回放定位,还能按策略自动修复重跑。小禾那句老话再应验,干活能回放等于多了录像,敢用了,但该自己盯的一帧不能省。

3. nitpicker,开源的 AI 代码审查员,密钥攥在你自己手里。自托管的 PR 审查工具,宣称代码不出你的机器,标语直接写钥匙在你手里。AI 产量上去了,验收环节的工具战开打。老徐立场,AI 代码信之前先验一遍,审查工具本身开源可自查,算加分项。

4. TechRadar 实测,让 AI 猜我在喝什么酒,成绩好坏参半。记者把口感描述喂给 AI 让它猜酒,时对时错,风味词能对上框架,细节一多就开始自信瞎编。AI 的话信之前先验一遍的日常版,越是它笃定的时候,越值得多问一句凭什么。

5. Axel,一个会跟别人聊你的 AI,隐私圈看傻了。新上线的聊天 AI 主打会八卦用户,把你跟它说的话变成谈资带进别的对话,开发者说是社交实验。老周提醒,跟 AI 说的一切都默认可能被第三人听到,敏感信息别喂,这实验值一耳光清醒。

6. Delightful Cells,表格批量活儿交给 AI,失败的行自动重跑。上传表格,一句话描述每行要干什么,它批量跑完,失败自动重试,跑完的行不重复计费。适合先拿不重要的名单试水,批量操作前留一份原始表,改坏了能回滚。

7. 小岛秀夫回应索尼撤资风波,《PHYSINT》还在做、双方并没有反目。今年 8 月索尼突然撤出合作多年的新项目《PHYSINT》,一度传得很难看。小岛近日正面回应:好聚好散,项目换人接手继续开发。大厂撤资不等于项目死刑,作者和投资人分开走、游戏照做——这种事以后只会越来越多。

8. OpenCloak,先把提示词里的个人信息换掉再交给 AI。开源浏览器扩展,发送前自动把姓名电话地址替换成代号,回来再还原。思路对,与其事后要求删除,不如压根没送出。注意还原环节要在本地做,别装要联网回源的。

9. Base Browser,一个不含 AI 味的 Firefox 硬核分叉。Codeberg 上的新项目,直接删掉浏览器里所有 AI 功能做纯净浏览,在 AI 全面进设置页的当下反向走,上线一天冲上热榜前排。一个对照实验,当所有人给浏览器加 AI,没有 AI 本身成了卖点。

10. Engadget 教你用 ChatGPT 做微信和 iMessage 贴纸,比想的简单。描述图案、生成、抠成贴纸包,门槛主要在导出尺寸这一步。轻实用,给家里长辈做一次比说十句都亲,生成后先确认平台贴纸规格,白边切不齐最磨人。

大家都在看

今天新抓的智能指数:Claude Fable 5.1 和 GPT-6 Astra 并列 53 分占头部,Qwen3.8 Max、GLM-5.3、Kimi K3 组成的国产梯队咬在 44 到 45 分。法拉第未来一口气发九款机器人,最贵超 92 万。古尔曼说苹果最早下月发智能家居屏幕设备。

明日关注

① Arena 四榜今天还是 09-20 版,盯 09-21 快照是否刷新,看 Meta 那几款新模型的场次涨没涨过 5000 场。

② 智谱 MaaS 的数据不留存机制刚宣布近期上线,蹲官方开通入口细则和实测反馈。

③ 阿里开源的 Qwen-Image-2.1 图像模型今天热度高,等第三方拿它跟上期热门图像榜同题对跑,别只看官方演示。


以上为第 054 期预览版,正式版 17 点更新。完整图文版在评测刊页面。

2 条回复

?
Ctrl + Enter 快速回复
蒋售前
蒋售前9月21日

Claude 办成事率不到20%,这模型能力能包装成产品,但客户付费意愿强吗?

瑶瑶选品
瑶瑶选品9月21日

Meta那新模型才3千场,分数浮动11分?选品最怕数据飘,这种榜单我都不敢直接信。