社区讨论 · 赛道

物界前沿评测 · 2026-09-22(第 055 期 · 预览版)

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月22日2026/09/21 178 浏览

别人做评测,我们做评测的雷达。今天这期聊三件跟你直接有关的事,再附三张榜和十条精选。

本期结构

重点更新 3 条(双专家点评)、榜单快报 3 组、板块精选 10 条,外加大家都在看和明日关注。

重点更新

一、「AI 项目八成会失败」这句话,追到底只有一行脚注

会上常听到的这句结论,被当成行业常识用好几年了。独立顾问 Jamie Watters 顺着它一路往回查,发现咨询公司、供应商的演示文稿、行业媒体的报道都在引用它,但能找到的最早出处只有一行脚注,没有样本量,也没说统计的是哪些项目。也就是说,这个「八成」更像被反复转述出来的印象,不是一次公开可查的统计。

跟普通人的关系很实在。它就是那种会决定你方案生死的数字,领导一句「八成都会失败」,你的预算可能就没了。以后听到,先问一句这是谁算的、算的是什么项目,比争辩管用。

编程领域专家·老徐说|这种数字我见得太多了,传上几年就没人记得出处。它不像跑分那样能当场复跑,别人一引用,你连反驳的入口都找不到。真想知道 AI 项目行不行,数你们自己团队上个季度做完的几个,成功率摆桌面上说话。

小编小禾说|我踩过的坑是这个。听说「八成失败」,我就答应了先小步试的方案,结果真正卡住的不是 AI 不行,是没人定谁验收。现在我只看两件事,谁验收、做砸了算谁的。

二、给 AI 写的报告配一张「配料表」,对不上原始数据就当场拦下

新开源的免费小工具 factlabel,干的事像食品包装背后的配料表。AI 写完一段结论,它回头把每一句和引用的那张表格、那组数字对一遍,编出来的、对不上的直接标出来拦住。代码放在 GitHub 上,自己部署就能跑,不用交钱。

这东西对着的是个很日常的麻烦。AI 写错数字最烦的地方不是错,是它写得跟真的一样顺,人一懒就直接转发出去。有了这道核对,你至少知道哪几句要先看原始出处。

安全领域专家·老周说|这个方向正中要害。我的老规矩不变,AI 报出来的数,原始表格在哪,找不到就先别用。现在多了个能自动对一遍的工具,至少省掉一半肉眼核对的功夫。但它对出来的是「和引用数据一致」,数据本身是错的它拦不住,还得靠人。

小编小禾说|上次我让 AI 整理报销单,金额和日期它都能编,我对着原始单据核到眼花。有这个东西,我至少知道先看哪几句,不用整篇重读。

三、不用等云端降价,有人把「自家电脑跑前沿模型」的全套流程开源了

把你自己那台带显卡的电脑当服务器,模型在你本地跑,资料不出门,也不用按月交钱。这件事的教程一直零散,Tim Dettmers 是这方面公认讲得清楚的作者,这次他把课上用的整套环境、依赖和踩过的坑一起放了出来,包括显卡不够时怎么降级跑、哪一步最容易卡住。

值不值得动手,看你的机器。这条路省的是订阅费和隐私顾虑,付出的是折腾时间。

穿戴领域专家·阿凯说|我关心的是噪音、发热、电费这三样。跑分高,机器摆客厅里嗡嗡响,照样吃灰。教程里写没写「什么卡跑到什么水平、连着跑一小时稳不稳」,比它能跑多快重要得多。

小编小禾说|我的老规矩不改,这种教程先收藏,不动手。等我那台旧电脑先跑通一个小任务,再谈要不要加内存。

榜单快报(榜单暂未更新,数据截至 2026-09-21)

先交代一句实话。今天核对过,Arena 四张盲测榜的最新快照还是 2026-09-21 那版,和上期评测用的是同一份,所以榜单暂未更新,数据截至 2026-09-21。今天没有找到 72 小时内发布的新榜可替换,宁可照实标注,也不拿旧数据充新。

文本盲测榜,前十 Anthropic 占七席

# 模型 厂商 分数(人类投票算的,括号内为对战场次)
1 Claude Fable 5 (High) Anthropic 1506(30,057 场)
2 Claude Opus 4.6 (High) Anthropic 1505(71,993 场)
3 Claude Opus 4.7 (High) Anthropic 1502(60,002 场)
4 Muse Spark 1.2 (xHigh) Meta 1500(仅 3,227 场)
5 Claude Fable 5.1 (Max) Anthropic 1498(5,783 场)

大白话解读。人类当裁判的盲测里,Claude 母公司几乎包场,前十占了七席,前三全是它家的。Meta 的 Muse 冲到第 4 看着唬人,但它只打够三千多场,分数上下能浮动 11 分,名次先别当真。

编程榜,榜首的场次最薄

# 模型 厂商 分数(括号内为对战场次)
1 GPT-6 Astra (Max) OpenAI 1800(仅 2,281 场,上下 16 分)
2 Claude Fable 5.1 (Max) Anthropic 1758(3,036 场)
3 Claude Opus 5 (Max) Anthropic 1687(12,087 场)
4 Qwen3.8 Max (0902) 阿里 1681(2,262 场)
5 Kimi K3 (Max) 月之暗面 1674(4,547 场)

大白话解读。榜首分数吓人,样本却不到榜三的五分之一。新名次先看它晃不晃,稳一两轮再下结论。实打实的是那个用一万两千场垫出来的第三名。国产的 Qwen 和 Kimi 都进了前五。

AI 助手实干榜,办没办成事才是分

# 模型 厂商 样本(对战场次)
1 Claude Fable 5.1 (Max) Anthropic 13,320
2 GPT 6 Astra (Max) OpenAI 10,372
3 Claude Opus 5 (High) Anthropic 24,794
4 Claude Opus 5 (Max) Anthropic 19,934
5 Claude Fable 5 (High) Anthropic 38,293

大白话解读。这张榜没有总分,只有六张单项成绩单。排在第 6 的 Claude Opus 4.8,胡说工具的比率只有 0.12,全场最低,意思是最不瞎编工具,却被「真正办成事」的比例拖出前五。选替你干活的 AI,先看维度再看名次。第 8 名的 Kimi K3 是前十里唯一的国产,样本超过十万场,最厚。

板块精选(10 条,各一句点评)

1. PokerTools Arena,让 AI 同桌打德州扑克的公开考场。几个模型放到同一张无限注德州扑克桌上,发牌、跟注、弃牌每一步都留在网页上,可以回放看它哪步打错,开源免费。扑克是典型的「信息不全还得连着做决定」,比答选择题更接近真人干活;但它只考了扑克这一件事,别当成综合实力榜。

2. Agent Harness Replay,把 AI 写代码的全过程录下来重放。它抓的是一次真实的 AI 编程会话,模型收到的每次请求、每步工具调用都摊开给你看。以前只能看它最后交的代码,现在中间每一步都能翻,出了问题你至少知道该看哪一屏。

3. Callwitness,记录 AI 到底从工具里拿到了什么。调用了哪个工具、工具返回了什么内容,全部留回执。排查「它明明调了接口,答案却是编的」就靠这份记录;缺点是它只管记录,不判断对错。

4. 用 AI 打漏洞悬赏的实战记录。一位安全研究员公开了自己用 TypeSafe AI 找漏洞的完整过程,哪些环节它帮上了忙、哪些还得人工判断,连没成功的尝试都写在里面。敢公开失败轮次的记录比只发成功案例的值钱,但这是单人样本,别当通用结论。

5. FearGate,一个专门记 AI 圈「没兑现的承诺」的网站。厂商和媒体说过的 AI 大话按时间挂出来,到期的没兑现就标一个逾期,首页现在挂着几条已过期的说法。看 AI 宣传先看它过去的履约记录,思路对普通人有用的;但收录和判定是站长一个人定的,只能当线索。

6. 给大模型「减重」的新算路,当成物理题来解。把模型里哪些层留住、哪些层拆掉写成一道物理学里的优化题来求解,模型瘦下来,同样的机器就能跑得动更大的版本。方向有意思,但这是研究博客不是公开考卷,瘦身之后掉了多少本事,没有第三方数据。

7. Jev 的网页试验场,一个只让你做「是 / 否」判断的 AI。输入一个问题,它只给两个按钮,比如「这个请求紧急吗」,不陪你绕圈子。只给结论不闲聊,适合流程里要卡一个判断的活;但答案对不对,仍然得你自己心里过一遍。

8. 国产开源模型第一次在亚马逊云上卖。月之暗面的 Kimi K3 上架亚马逊云,海外开发者可直接调用,也能下载模型自己部署。开源模型能不能自己养活自己,比它跑多少分更影响你以后还能不能免费用到它。

9. deslop-skills,给 AI 产出「去油」的技能包。一组给 AI 编程助手用的小技能,专门盯两类毛病,界面做得千篇一律、文字写得又长又空,装上之后让 AI 先自查再交活。治的是通病,思路可以抄;但它给的是清单,改不改得动还得看模型听不听话。

10. 一份给 AI 助手做合规的实操指南。这篇长文按欧盟 AI 法案的条款,一步步说清一个 AI 助手要上线得准备哪些材料、留哪些记录,也包括什么情况下必须有人工兜底。面向公司而不是个人,但有出海业务的读者可以先知道要交哪些材料。

大家都在看

AMD 市值头一回摸到 1 万亿美元,靠 AI 芯片需求顶着。亚马逊把 Meta 的 Muse 购物助手挡在自家门外,先谈崩了。加州州长签了七项法案,专门给 AI 数据中心的水电账立规矩。黄仁勋再撂一句,说 AI 十年内灭绝人类完全错了。

明日关注

① 云栖大会今天开幕,阿里千问新负责人刘大一恒要交第一份作业。

② 欧盟数据中心能耗披露规则进立法流程,海外建站的成本要重算。

③ 三星给芯片工厂组建的机器人团队,第一批活干什么。


以上为第 055 期预览版,正式版 17 点更新。完整图文版在评测刊页面。

2 条回复

?
Ctrl + Enter 快速回复
灵犀
灵犀9月22日

试了一下本地跑那套流程,显卡不够降级跑那步最容易卡,教程没写清怎么验收。

刷题中
刷题中9月22日
回复 灵犀

降级跑这步卡住 +1。教程要像 factlabel 那样能对原始数据,可它只保证"和引用一致",验收还得自己定标准。