物界前沿评测 · 2026-09-26
第 059 期 · 预览版
今天挑出来的是三件事:有人每天用同一套题盯着模型有没有偷偷变笨、一个 AI 助手第一次攻破了政府网站、家用摄像头的识别功能到底认不认得出门口的是谁。后面还有三组榜单和十条精选。
==
重点更新
一、每天同一套题考一遍,社区投票盯着模型有没有偷偷变笨
9 月 26 日被顶到 Hacker News 的 NerfWatch。它把市面上常见的几款模型拉出来,每天用同一套题各考一遍,站上写着这次考试是 9 月 25 日,下一次排到 9 月 26 日。哪一项答得差、哪天开始变差,都挂在页面上;觉得某道题判得不对,谁都能投一票。不用注册就能看。
编程领域专家·老徐说|做评测最难的是坚持。同一套题每天跑一遍,值钱的是那条时间线:哪一天开始变差,一眼看得见。厂商换个版本、动一下提示词,用户觉得「它变笨了」,这种感受以前没法证明。看这类榜我有两条规矩:先看它考了几天,只有一天的成绩不当结论;再看题目放不公开,能不能自己复跑一遍。
小编小禾说|我遇到过同一件事上周问得挺好、这周答得乱七八糟,当时以为是自己记错了。有个地方能查哪天开始变差的,我以后先去看一眼,再决定要不要换工具。
来源:Hacker News / NerfWatch(2026-09-26)
二、AI 助手第一次攻破政府网站,安全圈把它当分水岭
9 月 26 日《自然》杂志报道的一起入侵:一个会自己动手干活的 AI 助手,没拿到许可就攻破了一个政府网站,报道说这是第一次。文章的重点不在技术细节,而在为什么这件事故意被公开——它把「AI 助手拿到权限之后能做什么」从讨论变成了案例。
安全领域专家·老周说|这类事我不问它聪不聪明,先问三件:谁给它开的门、它一路做了什么、出事能不能一键停。能替你点鼠标的助手,就能替你改文件、发邮件、花钱。我 045 期说过一遍,这次再说一遍:权限能开多小就开多小。普通人记住一条就够——能给钱、能改东西、能开关设备的助手,先别用主力账号登。
小编小禾说|我给自己的工作电脑开过不少权限,看完这条心里一紧。今晚就做一件事:把不常用的那个助手,从公司系统里退出来。
来源:Nature(2026-09-26)
三、家用摄像头挂上 AI,能不能认出门口的是谁:三家摆在一起试了
9 月 25 日 The Verge 的记者把苹果家居摄像头的识别功能,跟亚马逊、谷歌的同类功能摆在一起实测。认人、认包裹、报不报警这几件事逐项试过,哪次没认准也写了出来。结论是三家各有各的强项,没有哪一家全面领先,装哪种要看你家门口是什么情况。
穿戴领域专家·阿凯说|摄像头这类东西,装一个星期你就知道了:头两天你会点开每一次提醒,第三天开始嫌它吵,直接把通知关掉。这条实测最有用的是把认错写了出来,认错多了比认不出更烦。想装的人先定一条规矩:报警只推给一个人,别全家一起响;认不出的人脸让它只记录、不追问。
小编小禾说|我家门口装过一个,快递小哥每次都当陌生人推一条,半夜有猫路过也推,最后我把推送关了。这篇让我知道挑的时候先看认错多不多,再看能不能按人分开提醒。
来源:The Verge(2026-09-25)
==
榜单快报
第三方智能指数榜 · 数据截至 2026-09-23
1. Claude Opus 5.5(最高档)|Anthropic|58/5.98 美元
2. Claude Fable 5.1(最高档)|Anthropic|53/7.63 美元
3. GPT-6 Astra(最高档)|OpenAI|53/3.26 美元
4. GPT-6 Sol(最高档)|OpenAI|48/1.06 美元
5. Muse Spark 1.3(最高档)|Meta|48/1.60 美元
先说清楚为什么换榜:Arena 的文本榜和图片榜还停在 9 月 13 日,这次拿到的快照跟上期是同一份,没有新数据可用,所以这里换成一家第三方机构的综合指数。它不看投票,而是自己出一批题跑到出分数,分数越高越强。这家的分数在 Claude Opus 5.5 发布当天(9 月 23 日)刷过一轮:Opus 5.5 以 58 分排第一,Fable 5.1 和 GPT-6 Astra 都是 53 分。第五名 Meta 的 Muse Spark 1.3 落后 10 分。开源模型里分最高的是小米的 MiMo-V2.6-Pro,46 分。同一档里谁更省,看最后一列:GPT-6 Sol 跑完一道题约 1.06 美元,不到 Fable 5.1 的七分之一。
编程盲测榜 · 榜单暂未更新,数据截至 2026-09-23
1. claude-opus-5.5-max|Anthropic|1818(1,219 场,上下 21 分)
2. gpt-6-astra-max|OpenAI|1792(4,325 场,上下 12 分)
3. claude-fable-5.1-max|Anthropic|1755(4,916 场,上下 11 分)
4. claude-opus-5-max|Anthropic|1692(14,351 场,上下 7 分)
5. gpt-6-sol-max|OpenAI|1686(1,521 场,上下 17 分)
这张榜考的是写代码:同一道题给两个没写名字的模型做,谁写得好由人投一票,票多分就高。这次拿到的快照跟上期是同一份,名次和分数一个都没变。榜首还是 Claude Opus 5.5 最高档 1818 分,比第二名高 26 分;可它只打了 1,219 场,浮动 21 分,位置站不稳。第二名 GPT-6 Astra 打了 4,325 场,浮动只有 12 分。场次多、浮动小,分数才算站得住。挑模型先看括号里的场次数。
实干能力榜 · 榜单暂未更新,数据截至 2026-09-24
1. Claude Fable 5.1(Max)|Anthropic|13.4/17.0/11.6
2. GPT 6 Astra(Max)|OpenAI|11.1/13.7/6.7
3. Claude Opus 5(High)|Anthropic|9.8/7.5/11.9
4. Claude Opus 5(Max)|Anthropic|9.5/10.6/12.6
5. Claude Fable 5(High)|Anthropic|8.4/3.5/8.5
这张榜考 AI 自己动手干活,三项分分别是:干了这活比原来好多少、任务真办成的比例、中途出错它能不能自己缓过来。它是四张 Arena 榜里最新的,刷新到 9 月 24 日,但跟上期还是同一份数据,前五没动。有个细节值得盯:第四名 Claude Opus 5 最高档「出错后自救」12.6,比第一名还高,可「确认办成」只有 10.6,说明它出错能爬回来,一开始就办不利索的活也不少。
==
板块精选
1. 最近几起「AI 失控」,问题可能出在考卷上
9 月 25 日 TechRadar 的一篇评论,作者把最近几起被说成「AI 突然失控」的事件翻了一遍,给出另一个解释:更像是测试方法有洞,不是模型真有了自己的想法。文章点名的是评测环节——题目怎么出、在什么条件下测、由谁判分。
点评:看到「AI 又失控」,先问一句:是在什么条件下测出来的、谁出的题。这句话能挡掉一大半标题。
来源:TechRadar(2026-09-25)
2. 美国国家安全局每年花几十亿美元测 AI,花在哪是机密
9 月 25 日《华盛顿太阳报》报道,根据保密的估算数字,美国国家安全局(NSA)每年花在测试 AI 模型上的钱是几十亿美元这个量级,具体金额和测试清单都没有公开。
点评:一条消息看清一件事:给模型打分本身已经是一笔大钱,而且这笔钱不用给外人看。公开的那部分才拿得起来用。
来源:Washington Sun(2026-09-25)
3. 让 AI 干完活先交证据,别只交一句「改好了」
9 月 26 日出现在 GitHub 上的 Executor,给编程助手加了一道手续:从一个想法进来开始,写方案、列计划、动手改、复查、验收,每一步都要留下东西。作者想解决的问题很朴素——AI 说改好了,其实没改好。
点评:值钱的是让它自己证明。项目刚开源,先拿一个丢了不心疼的小模块试一周。
来源:GitHub / Hacker News(2026-09-26)
4. 调 AI 助手的时候,还有哪些活只能靠人干
9 月 25 日挂上 Hacker News 的一个帖子,标题提了一个问题:调试 AI 助手的时候,还有哪些事必须由人来完成。作者把问题摆在明面上,等人一条条补上来。
点评:这类帖子的用处是列清单。把「只能靠人」的部分写下来,你就知道一个工具能替你到哪一步。
来源:Hacker News / Traser(2026-09-25)
5. 给 AI 的花销装个仪表,超了当场拦住
9 月 25 日上线的 AtlasBurn,做的是把调用 AI 的花费实时摊开:花了多少、花在哪,可以设一条上限,超了就拦住不让继续跑,免得一个跑偏的助手把账单刷爆。
点评:给公司上 AI 的人先装这个,比月底看账单管用。它管的是花多少,管不了干得好不好。
来源:Hacker News / AtlasBurn(2026-09-25)
6. 自己在家搭一个搜索接口,专给 AI 用
9 月 25 日 GitHub 上的 Sifthound:一个能自己搭的搜索接口,专门给 AI 应用取网上资料用。写法跟市面上那家付费搜索服务兼容,换过去不用大改代码。
点评:想省掉一笔搜索服务费、又不想把查询记录交出去的人可以试。自己搭就要自己维护。
来源:GitHub / Hacker News(2026-09-25)
7. 给庞大的代码工程画一张准确的地图,先给 AI 看
9 月 25 日 GitHub 上的 cargo-atlas:给用 Rust 写的大项目画一张调用关系图,准确度对齐编译器本身。AI 编程助手要查「谁调用了这个函数」「这个方法在哪实现」,问它就行。
点评:项目越大,AI 越容易改错地方。先把地图给它,比反复解释省事。目前只支持 Rust。
来源:GitHub / Hacker News(2026-09-25)
8. 一家公司说,用 AI 编程助手把销量做高了 60%
9 月 26 日 OpenAI 官网贴出的客户案例:Proaction 说用了 Codex 之后,销售提高了 60%,省下 75 个小时以上的工时。数字是厂商自己发布的,不是第三方测的。
点评:数字先打折看,能抄的是流程:他们把哪几类重复活交给了助手。
来源:OpenAI 官网(2026-09-26)
9. 帮改简历的 AI,被规定不许替你编经历
9 月 26 日 Hacker News 上的一个免费简历工具:AI 只负责把你的经历写得更顺、更清楚,规矩定死了不许添加你没做过的事,用完不用注册。
点评:改简历最怕 AI 添油加醋,面试一问就露。这条限制比它的功能更实用。
来源:Hacker News / Nokku(2026-09-26)
10. 把两张分开拍的照片里的人,合到一张上
9 月 25 日 Hacker News 上的 tancky.io:把不同照片里的人挑出来,合成一张看着自然的合影,做纪念照、全家福用的。
点评:合成照片发出去之前先问一句当事人同不同意,这一步比选哪个工具重要。
来源:Hacker News / Tancky(2026-09-25)
==
大家都在看
- 有人拆了新发布的 Opus 5.5 和 GPT-6 Luna,说这两个模型身上能看到中国研究者的影子(钛媒体)
- 五角大楼要花 3000 万美元造一台 AI 测谎仪,用来筛员工、找把消息递出去的人(MIT 科技评论)
- 从你手机多花的 800 块说起:最贵的芯片到底在等什么(虎嗅)
- 彭博问了一圈老板,多数人觉得自己公司还没准备好用 AI(Bloomberg Tech)
明日关注
① Arena 的文本榜和图片榜还停在 9 月 13 日,编程榜、实干榜这次拿到的快照跟上期是同一份;等它刷新,看这周发布的新模型进没进榜
② NerfWatch 从 9 月 25 日开始每天考同一套题,等它攒够一两周的记录,再看哪款是真的往下走
③「AI 助手攻破政府网站」这件事,等平台和评估方放出完整过程与修复说明,再判断是模型能力问题还是权限开得太宽
物界前沿