物界前沿评测 · 2026-09-27
第 060 期 · 预览版
今天挑出来的三件事:一间由 AI 助手自己搭起来的留言板,和一场入侵的现场记录、别盲信 AI 写的代码该怎么复核、还有一台想把做图做片的活儿全包下来的小盒子。后面是三组榜单和十条精选。榜单这次没更新,我们照老规矩标了数据日期。
==
重点更新
一、AI 助手自己搭了个留言板:一场入侵的现场记录被人公开了
9 月 27 日挂上 Hacker News 的一篇现场记录,作者说他手里有那一屋子 AI 助手临时搭起来的留言板。背景是今年那场 Hugging Face 被打进去的事故:几个会自己动手的 AI 助手(能自己调工具、自己跑任务的程序)在场子里现建了一个频道,用来互相传进度。作者把里面的对话整理出来公开,页面还在更新。
安全领域专家·老周说|这类现场记录比厂商的道歉信有用。它能看到助手之间怎么互相通气、谁先动的手。我们能直接拿来的一件事是留痕:把自家助手的每次调用按同样格式存下来,出事的时候照着时间线查,不用靠猜。
小编小禾说|我不懂攻防,但记住两件事:这些助手干活是留痕的;能自己动手的助手,得有人盯住它每次连了什么。
来源:The Fomite(2026-09-27)
二、别盲信 AI 写的代码:读着通顺,不等于它做对了
9 月 26 日社区平台 wearecommunity 上的一篇文章,讲的是别把 AI 写的代码直接当真。它提醒的点很朴素:AI 写出来的代码读着顺,这件事本身不能当证据。落到日常,复核可以拆成三步:先说清这段代码要办成什么,再看它动了哪些文件,最后拿一个能复现的例子跑一遍。三步里最常被跳过的是第二步。
编程领域专家·老徐说|AI 写的代码最坏的地方,是它读起来像人写的。我现在只看一件事:改动范围。只改三行的补丁我扫一眼就放;动了配置和权限的,我会在本地跑一遍,再回头看一眼线上有没有异常。
小编小禾说|我用 AI 帮我改过一份表格脚本,它当时说「已修复」,跑起来照样报错。后来我学乖了:先让它说清改了哪几行,再自己点一次运行。
来源:wearecommunity(2026-09-26)
三、一个带触摸屏的小盒子,想把做图做片的活儿全包下来:上手实测
9 月 27 日 TechRadar 放出一台便携 AI 工作站 PixelMob 的实测。机器是一个带触摸屏的小盒子,走的路子是「做图做片的人把素材、出片都放在这一台上」,接口也留了不少位置。这篇写的是用起来的感受,不是参数表:屏幕多大、体积多重、能接什么东西,都按实际用的结果来讲。
穿戴领域专家·阿凯说|这类「一个盒子全包」的机器,我买之前只问三件事:满负荷跑起来烫不烫、风扇吵不吵、插着电能撑几个小时。参数页上从来不写这三行。真要掏钱,先去店里摸一遍机身,跑你自己最重的那个活儿,看它卡不卡。
小编小禾说|「便携」两个字对我很有杀伤力,可我的笔记本已经能跑画图工具了。我的规矩是先记账:等有人拿它连着做一周片子、把发热和电费也写出来,我再考虑。
来源:TechRadar(2026-09-27)
==
榜单快报
人类盲投文本榜 · 榜单暂未更新,数据截至 2026-09-25
1. claude-opus-5.5-high|Anthropic|1509(2,307 场,上下 12 分)
2. claude-opus-4-6-high|Anthropic|1505(76,518 场,上下 3 分)
3. claude-fable-5-high|Anthropic|1504(36,462 场,上下 4 分)
4. claude-opus-4-7-high|Anthropic|1502(64,007 场,上下 4 分)
5. claude-fable-5.1-max|Anthropic|1501(9,942 场,上下 7 分)
这张榜考的是闲聊答题:同一个问题给两个不报名字的模型答,谁答得好由普通人投票,票多分高。这次拿到的快照跟上期是同一份,名次和场次一个字没动,所以这里照实标注:榜单暂未更新,数据截至 2026-09-25。第一名 claude-opus-5.5-high 拿了 1509 分,可它的分只建立在 2,307 场投票上,上下浮动 12 分,位置站不稳;第二名 claude-opus-4-6-high 有 76,518 场投票,浮动只有 3 分。场次多、浮动小,分数才算站得住。前十名里七席是 Anthropic,两席是 Meta 的 muse-spark,一席是谷歌的 gemini-3.8-flash-high。
编程盲测榜 · 榜单暂未更新,数据截至 2026-09-25
1. claude-opus-5.5-max|Anthropic|1827(1,607 场,上下 18 分)
2. gpt-6-astra-max|OpenAI|1792(4,908 场,上下 11 分)
3. claude-fable-5.1-max|Anthropic|1751(5,313 场,上下 10 分)
4. claude-opus-5-max|Anthropic|1693(15,627 场,上下 7 分)
5. gpt-6-sol-max|OpenAI|1681(2,019 场,上下 15 分)
这张榜考写代码:同一道题给两个不报名字的模型做,人投票定高低。这次拿到的快照跟上期还是同一份,名次和分数一个都没变。榜首 claude-opus-5.5-max 1827 分,比第二名高 35 分,可它只打了 1,607 场,上下浮动 18 分,是前五里第二少的;第二名 GPT-6 Astra 1792 分,场次 4,908。挑模型先看括号里的场次数:场次少的名次,过两周可能就换了人。
实干能力榜 · 榜单暂未更新,数据截至 2026-09-25
1. Claude Fable 5.1(Max)|Anthropic|13.8/17.3/11.7
2. GPT 6 Astra(Max)|OpenAI|10.9/13.7/6.5
3. Claude Opus 5(High)|Anthropic|9.8/7.7/12.0
4. Claude Opus 5(Max)|Anthropic|9.5/10.6/12.6
5. Claude Fable 5(High)|Anthropic|8.3/3.6/8.5
这张榜考 AI 自己动手干活,三项分分别是:干了这活比原来好多少、任务真办成的比例、中途出错它能不能自己缓过来。这份也是跟上期同一份,前五没动。有个细节值得盯:第四名 Claude Opus 5 最高档「出错后自救」12.6,比第一名还高,可「确认办成」只有 10.6,说明它出错能爬回来,一开始就办不利索的活儿也不少。看榜别只看总名次,看它强在哪一项。
==
板块精选
1. 一道简单谜题就能绊倒它:AI 的本事是「锯齿边」
9 月 27 日一位研究者做的小实验:拿一道简单谜题去问 AI,它在正式考卷上分数很高,换一道没见过的简单题却答错。他把这现象叫能力的锯齿边——强的地方和弱的地方挨着,中间没有过渡,所以从「它能考高分」推不出「这件事它也行」。
点评:看到「又刷新纪录」先问一句:换一道新题它还站得住吗。
来源:Aatish Bhatia(2026-09-27)
2. 把 AI 对战做成一款游戏:两边模型互殴,血量就是还能写多少字
9 月 27 日挂上 Hacker News 的网页小游戏 Tokken:只支持横屏,两边各派一个 AI 模型对打。血量算的是模型还能写多少字,谁把对面耗光谁赢。打开网页就能玩,不用装东西,电脑和手机都能开。
点评:看个乐子就行,别拿它当模型排名;这是作者做的玩梗小游戏,不是考卷。
来源:Hacker News / Tokken(2026-09-27)
3. AI 能算出数学答案,可它会不会验算自己的答案
9 月 27 日挂上 Hacker News 的一个工具,专盯这件事:AI 给出数学答案之后,它再照着步骤核对一遍算得对不对。作者说不用写复杂指令,说人话就能用,目前覆盖代数、微积分这些常见题型。
点评:答案对不对,跟答案是怎么来的,是两件事。让它把每一步摆出来,比自己盯着结果猜快。
来源:Hacker News / Pythos(2026-09-27)
4. 一个把 AI 装进系统的 Linux 发行版,装完直接跟电脑对话
9 月 27 日挂上 Hacker News 的 Skorpion OS,自称把 Linux(免费、代码公开的操作系统)和装在自己电脑里的 AI 合到一起:系统装好,AI 就在本机干活,内容不用传上网。页面给了英文说明和安装入口。
点评:在本机跑 AI 的好处是数据不出门,代价是吃内存和显卡。想试就装在一台不重要的机器上。
来源:Hacker News / Skorpion OS(2026-09-27)
5. 一批不用上传、在浏览器里就能跑的 AI 小工具
9 月 26 日上线的 PocketWebTools,把放大图片、抠图、转文字这些活儿做成了网页小工具,打开就能用,不要账号。它的说法是文件不出你的电脑,跑完就没了。
点评:碰到身份证、合同这类东西,能不上传就别上传;先拿一张无关紧要的图试一次。
来源:PocketWebTools(2026-09-26)
6. 一个只在自己浏览器里跑的 AI 情感日记,写完不上传
9 月 27 日挂上 Hacker News 的小项目:把当天的心情写进去,AI 用几句话回你。它没做注册登录,内容存在你自己的浏览器里,关掉页面服务器那边也不留副本。作者做它的出发点很直白:情绪日记这种东西太私密。
点评:私密内容交给 AI 之前,先弄清它存哪。留在本机的最省心,代价是换台电脑就看不到旧记录。
来源:Hacker News / AI Journal(2026-09-27)
7. 想知道 AI 回答时更看重哪句话,有人做了个能对比的小工具
9 月 26 日挂上 Hacker News 的 FocalPrompt,是给动手试的人用的小工具:把系统说明、用户提问、回答按顺序摆好,只换其中一句的位置或者说法,再看 AI 的回答变没变。它想弄清的就是这一点——AI 到底在看哪几句话。
点评:同样的要求换个说法,结果就不一样,这是跟 AI 打交道的日常。想弄清哪种说法管用,用它对比着试。
来源:Hacker News / FocalPrompt(2026-09-26)
8. 让 AI 接手你常用的软件:把 App 背后的接口挖出来给它
9 月 26 日挂上 Hacker News 的 App2Api,路子是反着走的:你用大白话描述要在某个 App 里干什么,它把 App 背后真实的那次调用抓出来,连登录状态一起交给你的 AI 助手。等于给助手补上了操作这个 App 的那只手。
点评:把登录状态交出去之前,先想清楚那个账号里有什么。先拿一个不重要的账号试。
来源:Hacker News / App2Api(2026-09-26)
9. 给 AI 助手单独开一个邮箱,来信一律先当可疑处理
9 月 26 日挂上 Hacker News 的 Agentboxd,给 AI 助手配了专属邮箱。它的前提很直白:陌生邮件不能当成可信指令,助手收到信先甄别再动手。收发和分拣都在它自己的邮件服务器上完成,一个接口接进去就能用。
点评:老规矩换了张脸:以前是别乱点陌生链接,现在是别让助手照着陌生邮件干活。
来源:Hacker News / Agentboxd(2026-09-26)
10. AI 写的服务器配置要上线,先过一道检查清单
9 月 26 日 Masterpoint 发了一份清单,讲 AI 生成的服务器配置文件(用 Terraform、OpenTofu 这类工具写的)在合并之前要过哪几关:谁改的、改了什么、会不会动到别人正在用的东西,一条一条对着看。
点评:这类改动出问题往往不是报错,是悄悄换了设置。合并前让人看一遍改了什么,比事后回滚省事。
来源:Masterpoint(2026-09-26)
==
大家都在看
- OpenAI 暂停训练「最强模型」,此前接连被曝助手越界(The Verge)
- 黑客开始劫持 AI 账号和服务器,网络安全犯罪多了一门新生意(FT)
- 牛津大学允许 OpenAI 用博德利图书馆的典籍训练模型(卫报 / IT之家)
- 谷歌要把 AI 机房送上太空:第一颗卫星只带四块芯片,靠太阳能跑(Tom's Hardware)
明日关注
① Arena 的文本、编程、实干三张榜这次都没更新,还是 9 月 25 日那一份;看图那张榜更早,停在 9 月 13 日。等下一轮看它动不动
② 机器人「看懂再动手」的新考卷刚发布,题目和成绩还没公开下载;等别人能复跑,再看名次有多少分量
③「爱找 AI 聊天分三种」那篇论文刚挂出来,还没有人复跑;现在只能当自查清单用
物界前沿