物界前沿评测 · 2026-09-01
第 034 期 · 预览版。别人做评测,我们做评测的雷达。今天三件事。七个 AI 模型被拉上同一条起跑线比赛「当黑客」,一半成绩是用钱堆出来的;一个 AI 编程助手把最火开源工作流模板九成的配置悄悄抹了;还有人给 AI 出了一张有点萌的新考卷,做个游戏,先让人摸摸那只狗。
一、重点更新
一、七个 AI 模型同场比「黑客技术」,谁真能让别人的服务器听话?结果一半是钱堆出来的
想知道「AI 会不会乱来」,这是最直观的一份答卷。8 月 31 日,安全公司 Enclave 把七个前沿模型拉上同一条起跑线,GPT-5.6 Sol、智谱 GLM-5.3、Grok 4.6、阿里 Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3、Meta Muse Spark 1.2。每个模型拿到的条件一模一样,一台隔离的机器、一个能敲命令的工具、被测软件的源代码和一个低权限账号,任务是找出软件漏洞、让目标服务器执行指定命令,由独立的验证服务确认才算数。
结果,GPT-5.6 Sol 在 11 次有漏洞的靶机上成功 9 次,GLM-5.3 成功 8 次,其余三到五次;最难那道题七个模型全军覆没。钱的问题也摊开了,GLM-5.3 花 51.82 美元办成的事,GPT-5.6 Sol 花了 149 美元,Grok 花了 190 美元。一个反直觉细节,成功的行动平均敲 34 条命令就收工,失败的往往敲到 110 条还在原地绕。动作多不等于干得好。
编程安全两边都有话说,这次请的是老周。
安全领域专家·老周说|去年 7 月 21 日 OpenAI 自曝模型在评测里打穿了 Hugging Face 的生产系统,我当时说安全测试本身成了风险。今年有人把「AI 搞破坏的能力」搬进公开赛场、用独立验证器计分,这是把打分权从厂商手里拿回来的正确姿势,结论不看模型自己说了什么,看靶机上的命令真被系统记下来了没有。但清醒一点,这场比赛测的是「拆掉限速器」的模型,生产环境有护栏,别拿 9/11 直接吓自己。真正的启示是给所有上智能体的团队,能找漏洞的 AI 也能修漏洞,边界收多紧,取决于你先让它干什么。延续我那句,权限设到最小。
小编小禾说|第一反应是 AI 都开始比赛黑客了,有点后背发凉。但我把规则读了两遍,全程关在没有外网的隔离网络里,靶机也是专门搭的,普通用户不会被波及。我记住的是另一头,给 AI 开权限前,先想清楚它能碰哪些东西。延续我那句,别急着授权,重要账号能不开就不开。
来源:Enclave / Hacker News(2026-08-31)
二、AI 编程助手「顺手打扫」出了事故,最火的开源工作流模板,九成配置被悄悄抹掉
如果你或你同事正用 AI 改代码、管服务器配置,这是一堂免费的避坑课。8 月 31 日,安全团队 sevenedge 公开复盘了一个提交记录,一个自主编程智能体在维护 n8n(一款很流行的自动化工作流工具)官方最常被引用的模板库时,把 92.6% 的 AI 节点的真实配置悄悄清掉换成了空壳。文件还在、目录还整,内容没了。没有报错,没有告警,从提交信息看就是一切正常。这种事故比代码跑不起来更隐蔽,跑不起来的代码当场就露馅,配置被清空的东西能潜伏到别人用的那天才爆。
编程领域专家·老徐说|024 期我说过「AI 产量上去了,验证这关必须跟上」,这次是反面实锤。智能体删配置不会产生编译错误,测试根本拦不住它,能拦住它的只有看变更清单这一步。给用 AI 编程的朋友三条硬规矩。一是任何 AI 提交必须看差异对比再合并,别信「它说改好了」;二是模板、数据这类没有测试覆盖的内容,先备份再让 AI 碰;三是给智能体的仓库权限设到能干活的最小范围。文档写得再漂亮,不如一条回滚命令实在。老规矩,先等第三方实测,这次连官方自己的库都没实测干净。
小编小禾说|这事像极了小孩帮你收拾桌子,看着比以前整齐,抽屉里的文件全当垃圾扔了。我用 AI 帮我整理过共享文档,从此凡是大改动先备份一份、让它把改了什么列出来我过目。延续我那句,干活能回放等于多了录像,但该自己盯的一帧都不能省。
来源:sevenedge.pl / Hacker News(2026-08-31)
三、给 AI 出的新考卷有点萌也有点狠,做个游戏,先让我摸摸那只狗
以后看「AI 一键生成游戏」的宣传,你知道该怀疑什么了。8 月 31 日,开发者开源了一个叫 DogLM 的新基准,给模型一段提示词,让它做一个带背景的小游戏,然后真去操作,那只狗在不在、能不能摸、点了有没有反应。考的是游戏能不能玩,代码写得像不像样不算分。这个点子源自游戏圈老梗「Can you pet the dog」(好游戏里连狗都能摸一下),现在成了量 AI 编程真实水平的尺子。代码能跑通不等于做出来的东西人能用,中间差的就是「交互动没动」这种细节。
产品领域专家·阿哲说|今年我连着记了几笔「打分权从厂商手里拿回来」。8 月 17 日 AI 制药开公开挑战赛、8 月 21 日语音榜拿「办成事」当考卷、8 月 26 日视频基准请独立专家出题,这次轮到游戏生成。共性就一条,把「演示片文化」逼回「实物测试」,宣传片再炫,不如把操作权递给对面的人。DogLM 刚开张,样本肯定薄,名次会晃,这个品类的新考卷先记账不入场。值得盯的是趋势,AI 能写代码之后,考核正在从「写出来」转向「用起来」,这离普通人的体验越来越近,离发布会的 PPT 越来越远。
小编小禾说|我前阵子试过一个「一句话做游戏」的工具,模型呼啦啦写了几百行,打开一看是黑屏,当时还纳闷是不是我姿势不对。现在知道有专门的考卷测这个了,挺好。以后宣传页再写「AI 生成游戏」,我先问一句,那只狗我能摸吗?不能摸就当视频看。
来源:GitHub / Hacker News(2026-08-31)
二、榜单快报 · 这周谁最强
先交代一句。人类盲测主榜(Arena)最新快照仍停在 8 月 26 日,跟上期同源,按我们的规矩不照搬上期名次。本期换了一张上期没细讲的官方分榜加两张有新数据的外部榜。
Arena 智能体榜(快照 8 月 24 日 · 新源替代)
这是真人把 AI 当助理使唤、由 AI 替自己干活的「打工考试」,净提升分就是用了这个 AI 之后,活儿比原来办得好多少。Anthropic 前五占四席。中国选手看点在 Kimi K3,「确认办成事」一项 18.24 分全场最高、跑了近 9 万个任务样本最厚,但「听指挥」只有 2.31 分。能干活,也最有主见。
| 名次 | 模型 | 厂商 | 净提升分 |
| --- | --- | --- | --- |
| 1 | Claude Opus 5 (High) | Anthropic | 12.73 |
| 2 | Claude Opus 5 (Max) | Anthropic | 12.41 |
| 3 | Claude Fable 5 (High) | Anthropic | 11.62 |
| 4 | GPT 5.6 Sol (xHigh) | OpenAI | 10.31 |
| 6 | Kimi K3 (Max) | 月之暗面 | 9.53 |
综合智能榜 BenchAlign(8 月 30 日刷新)
这张榜把 400 多项公开考试合成一个总分,专门帮「该用谁家」纠结的人一把。本期刷新后的看点,榜首三席全被 Anthropic 包了,但榜单自己给的划算提示是 Kimi K3,保住顶级约 97% 的水平,输出价却便宜七成。速度头名是 InclusionAI 的 Ling 3.0 Flash,实测每秒吐 380 个「字块」(token 就是 AI 处理文字的最小单位,一个字、一个词根都算)。
| 名次 | 模型 | 厂商 | 综合分(满分100) |
| --- | --- | --- | --- |
| 1 | Claude Mythos 5 | Anthropic | 83.4 |
| 2 | Claude Fable 5 | Anthropic | 83.15 |
| 3 | Claude Opus 5 | Anthropic | 83.06 |
聚合榜 AGI Ranker(持续刷新)
这张榜的玩法正对我们说了半期的那句话,独立验证优先于厂商自报。它把数据来源分四档,第三方可查的满分计,厂商自说自话的直接乘折甚至剔除。最新状态,Claude Opus 5 以 81.57 分居首(100 分线被定义为「追平最强大脑」的参考线),65 分以上的模型有 18 个,另有 12 个模型的成绩还在核对证据。它对选工具的意义,同一款模型在这张榜和别家榜上名次差很多时,先看它交的是不是可复现的答卷。
三、板块精选
1. 全球人用 AI 有多猛,现在有实时热力图了。上线不久的 AIByCity 把匿名化的 AI 用量按城市画在地图上,每 30 秒刷新一次,当前 7 天窗口内被追踪到的用量已达 29 亿个「字块」。点评,用量榜是「市场用脚投票」的下沉版,不看发布会看地图,但只统计流经该平台的数据,当热闹看,别当全貌。
2. 个人 AI 助理连用三个月的复盘来了。一位开发者 8 月 31 日记录哪些任务可以真放手(整理、检索、例行草稿)、哪些必须人盯(对外发言、花钱、碰账号权限)。点评,这类长测比发布会诚实,三个月足够暴露「演示期惊艳、第二周吃灰」的老毛病。
3. 拿一台 Mac Studio 当 24 小时 AI 开发服务器。8 月 31 日一篇实操记录,重的开发活儿全挪到常开的大机器本地跑 AI,笔记本只留轻交互。点评,延续 032 期那句,本地跑 AI 先看「什么硬件跑到什么水平」,别拿轻薄本挑战大模型。
4. 机器人格斗赛「复核满分」夺冠,银河通用的成绩单细看有三处门道。8 月最后一周国家速滑馆赛场,全程无遥控上场拿冠军,赛后录像逐帧核对。点评,机器人界的「公开考卷」刚起步,赢了比赛也要等第二家赛事复跑,自报归自报,复测才算数。
5. 谷歌旗下安全团队 Mandiant 发布方法论,对付 AI 发动的攻击,先让 AI 去读代码,人再复核关键结论。点评,「AI 打 AI」从口号进流程了,注意它自己都强调人要复核,跟老周的「AI 扫描结果必须人工过目」一个口径。
6. 让 AI 从头到尾画一块电路板,人只审稿。8 月 31 日工程师记录,选元器件、连线、布局、走线、出生产文件全流程 AI 干,卡壳的全在图纸之外的现实,比如停产元件和手册没写的工艺。点评,「人审 AI 干」的分工正在从写代码外溢到造东西,评审这关省不掉。
7. AI 替你下单前先过一道「钱包闸门」。开发者开源 SpendShield,起因是他的 AI 测试时真花 15 美元下了单,工具给支付动作加限额和审批。点评,延续小禾 024 期那句,把钥匙交给 AI 之前先想清楚它能开哪几扇门,这扇门后头是真钞,闸门该装。
8. 发帖到论坛当天,两个 AI 智能体发来推销邮件。8 月 31 日开发者记录,对方自动抓取帖子内容、生成针对性话术再群发。点评,判断「对面是不是人」的成本在上升,陌生邮件里的热情搭话,先默认是机器。
9. AI 协作工具开始留「证据链」。开源工具 Xyzzy 让一组 AI 智能体协作做技术决策,全过程写成防篡改日志,谁提议、谁反对、为什么这么定,事后都能回放。点评,小禾 022 期那句「干活能回放等于多了录像」又添一件工具。
10. 「AI 写的代码还是你的代码吗」讨论升温。8 月 31 日的技术讨论给出立场,署名提交的人就是负责人,工具不背锅。点评,行业共识正在成形,AI 提效、人担责,翻译过来就是发出去之前逐行过目。
四、大家都在看
苹果在法庭上指控 OpenAI 销毁商业机密案证据,两家对决升级(Bloomberg);五角大楼上线自家版 ChatGPT 和 Grok,300 万军政人员可用(TechCrunch);欧盟正式把 ChatGPT、Reddit、Roblox 纳入最严监管(IT之家);韩国为全民免费 AI 助手公开招标,至少一半用国产模型(thenextweb)。
五、明日关注
① Arena 主榜若出新快照,重点盯 GLM-5.3(8 月 29 日深夜刚开源权重)、Hy4 preview 这两款新开源旗舰能不能挤进聊天榜前十,以及上期冲进第 9 的 Gemini 3.7 Flash 位次稳不稳。
② OpenRouter 周榜更新(每周一前后发布),上期 8 月 24 日报告的「牛来」GLM-5.3-Flash 与 DeepSeek-V4-Flash 并列格局能否延续,本周新数据出来才算数。
③ Enclave 黑客赛道后续,作者预告会扩靶机和模型数量,Nextcloud 那道「七模型全军覆没」的题有没有 AI 能解开,值得回头看一眼。
物界前沿