物界前沿评测 · 2026-09-30
第 063 期 · 预览版。别人做评测,我们做评测的雷达。每天 5 分钟,看懂哪些 AI 工具值得你用。
今天三件值得单独说的事:AMD 给核显做优化,跑 AI 快了近两成;让 AI 替科学家做发现这件事,被单独拎出来考了;写代码的工具开始能听你说话。
重点更新
1. AMD 给核显做了个省力优化,跑 AI 快了 18% 到 23%
Phoronix 实测了 AMD 对自家核显做的优化:换上新版系统(Linux 7.4)之后,同一台机器跑 AI 任务比原来快 18% 到 23%。核显是跟处理器做在一起、不用单独买的那种显卡,轻薄本和办公本用的基本都是它。换句话说,你手上那台没有独立显卡的电脑,跑本地 AI 可能比原来顺一点。
穿戴领域专家·阿凯说|百分比看着不大,对没独显的机器却是实打实的:原来勉强能转的小模型,现在可能转得动了。我盯的还是那三样——热不热、吵不吵、插电撑多久。普通人要验证也简单:拿你平时最重的那件事在这台机器上跑一遍,跑完摸摸烫不烫手,别只看官方那个百分数。
小编小禾说|我这台笔记本就没独显,跑个本地小工具风扇就呼呼响。这条我先记下:等更新推过来,挑个不急的活试一次,看是不是真快了。
来源:Phoronix(2026-09-30)
2. 让 AI 替科学家做发现这件事,开始被单独拎出来考
MIT 科技评论的每日简报里提到一个新题目:AI 的发现难题,说的是让 AI 帮忙做科研时,怎么分清它给的到底是新东西还是编出来的。同一篇还提到,OpenAI 因为安全上的顾虑,撤下了一款本来要发布的新模型。两件事放在一起看,说的是同一层道理:本事越大,越要先有一套能验它的办法。
安全领域专家·老周说|撤模型这一步比发出来更值得记一笔,说明厂商自己也没把边界摸清。这类事我只看三样:考卷公开没有、评分别人能不能复跑、测的是不是用户手上那一版。换成普通人能用的一句:宣称本事大的 AI,先用不重要的事试,别一上手就把要紧的活交给它。
小编小禾说|科研这种话我不敢接,但撤模型这件事我懂了:它自己都没把握。我的做法还是老一套,拿不准的先自己核一遍再往外说。
来源:MIT TechReview(2026-09-29)
3. 写代码的工具开始能听你说话了
IT之家 9 月 30 日消息,OpenAI 在开发者日上宣布 Codex CLI 升级:可以直接用语音下指令,终端界面也换了新样子。Codex CLI 是给写代码的人用的命令行工具,平时要一行行敲命令,以后可以开口说。
编程领域专家·老徐说|语音这条对写代码的帮助有限,敲一行命令比说一句话快,也不会听错。我真正要看的是两件:新版本接进现有项目顺不顺、它改了哪几处能不能一条条核出来。老规矩不变:别急着搬进生产环境,先拿丢了不心疼的小模块滚一周。
小编小禾说|命令行界面我一看就头疼,这条给我的提醒很朴素:以后可能对着电脑说句话它就动手。真要试,我会先在那个不重要的文件夹里试,别一上来就动工作文件。
来源:IT之家(2026-09-30)
榜单快报 · 这周谁最能打
先说口径:Arena 的几张榜本期没有更新,跟上一期是同一份快照,各组真实更新日也不一样(文本榜、编程榜停在 2026-09-25,实干榜、识图榜停在 2026-09-28)。今天能报的新数字,来自第三方机构 Artificial Analysis 的综合智能指数。
第三方智能指数榜(Artificial Analysis,2026-09-30 查阅)
| # | 模型 | 厂商 | 智能指数 |
|---|---|---|---|
| 1 | Claude Opus 5.5 (max) | Anthropic | 58 |
| 2 | Claude Sonnet 5.5 (max) | Anthropic | 56 |
| 2 | Claude Opus 5.5 (xhigh) | Anthropic | 56 |
| 5 | GPT-6 Astra (max) | OpenAI | 53 |
| 8 | MiMo-V2.6-Pro | 小米 | 46 |
这份榜把各家模型放进同一批考卷里打分,再把分数合成一个总分,分越高说明会干的活越全。前五名里 Anthropic 占了三席,OpenAI 的 GPT-6 Astra 排第五。国产里最高的是小米的 MiMo-V2.6-Pro,排第八,是开放权重(把模型本身公开、谁都能下载到本机跑)里的头一个;阿里 Qwen3.8 Max 和智谱 GLM-5.3 都是 45 分。这家站点不标具体更新日,所以这组按查阅日算。
人类盲投文本榜(数据截至 2026-09-25,本期未更新)
| # | 模型 | 厂商 | 盲测得分(场次) |
|---|---|---|---|
| 1 | claude-opus-5.5-high | Anthropic | 1509(2,307 场) |
| 2 | claude-opus-4-6-high | Anthropic | 1505(76,518 场) |
| 3 | claude-fable-5-high | Anthropic | 1504(36,462 场) |
| 4 | claude-opus-4-7-high | Anthropic | 1502(64,007 场) |
| 5 | claude-fable-5.1-max | Anthropic | 1501(9,942 场) |
这张榜是人类一对一投票投出来的——两个人拿到同一个问题的两份答案,谁也不知道哪份是哪家做的。前五名被 Anthropic 一家占满。重点看括号里的场次:第 1 名只攒了 2,307 票,名次还在晃;第 2 名有 7.6 万票,更靠得住。
实干能力榜(数据截至 2026-09-28,本期未更新)
| # | 模型 | 厂商 | 净改进分 |
|---|---|---|---|
| 1 | Claude Fable 5.1 (Max) | Anthropic | 14.1 |
| 2 | Claude Opus 5.5 (High) | Anthropic | 11.8 |
| 3 | GPT 6 Astra (Max) | OpenAI | 10.4 |
| 4 | Claude Opus 5 (Max) | Anthropic | 9.5 |
| 5 | Claude Opus 5 (High) | Anthropic | 9.4 |
这组考的是让 AI 真上手干活(替你点鼠标、改文件)之后,有没有把事办成。分数叫净改进分,意思是结果比原来好了多少。头名是 Anthropic 的 Fable 5.1,第二是它家的 Opus 5.5,第三是 OpenAI 的 GPT-6 Astra。
板块精选
1. 给 AI 用的浏览器太慢,有人做了个命令行工具提速。作者说现在 AI 用浏览器查网页慢得让人难受,于是他做了个叫 fab 的小工具专门治这个:让 AI 走命令行去开网页、取内容,绕开笨重的浏览器界面。一句话点评:工具好不好用,先看它省下的那几秒值不值你多学一套命令。
2. 马斯克那本 AI 写的百科又开工了。The Verge 报道,马斯克那边用 AI 写的在线百科 Grokipedia,在停更好几个月之后又开始更新词条了。一句话点评:AI 写的百科能不能信,先看它引的是谁的原话。
3. AI 味的海报和菜单,已经铺到大街上了。TechRadar 这篇写的是:AI 生成的内容早就不只在网上,活动海报、咖啡馆菜单这些现实里的印刷品也满是它的痕迹。文章说 AI 让做宣传变便宜了,代价是粗制滥造的东西变多了。一句话点评:看到一张海报,多问一句这是谁做的,比吐槽它丑有用。
4. AI 太好用的时候,这名开发者建议你偶尔自己硬啃。这位开发者写了自己最近的矛盾:编程、健康咨询、投资这些事都能交给 AI 了,可他发现自己越来越不愿意动脑。他给出的做法是挑一部分事坚持自己啃,别让省事把基本功废掉。一句话点评:省力气没错,但别把判断也一起交出去。
5. 想用 AI 又怕资料被看,有人把机器锁进小隔间。这个项目走的是硬件路线:用能隔离数据的专用芯片来跑 AI,让处理过程锁在一个别人打不开的小隔间里。它瞄准的是那些没法把资料交出去的场景,比如医院和银行。一句话点评:隐私这事,看它能不能证明自己看不到,而不是听它保证。
6. 搜索换了个用法:不给你链接,直接派一个 AI 去干。这个小工具把搜索改成了另一条路:你输入一句需求,它不去给你一堆网页链接,而是临时找一个能替你干这件事的 AI 跑一趟,再把结果交给你。一句话点评:让 AI 替你干活,先看它跑完有没有留下记录。
7. 想知道自己到底会不会,让 AI 面你一轮。作者做了个小应用来考人:你选一门技能、填上名字,AI 就照着面试的路子问你问题,看你是不是真懂。他说想法来自面试里最难判的那件事——这个人到底会不会。一句话点评:被 AI 考完别只盯分数,看它问的那几个问题是不是真难。
8. 英国快递公司试了台两条腿的送货机器人,会爬楼梯。TechRadar 报道,Evri 在英国试跑一台两条腿的送货机器人,卖点是能上楼。公司自己把话说得很清楚:这东西是给快递员搭把手,不是替掉人。一句话点评:楼梯这种活,先等它装满货在真楼道里跑几趟再说。
9. 整理文件这件事,有人让 AI 全在你电脑上做。这个 Mac 上的小工具用本机跑的 AI 帮你把桌面上、下载夹里的文件归类。它的卖点是全程不联网,文件不出你这台机器。一句话点评:碰私人文件的工具,先确认它是不是真的不上网。
10. 全交给 AI 写还是自己写,有人把这道选择题摊开了。这篇短文说,AI 编程工具来了以后,写代码的人卡在一个两难里:全交给它,怕自己看不懂也管不住;不用它,又怕比别人慢。作者把两边的代价都摆了一遍。一句话点评:两头不用选到底,按活的风险分着用更实在。
大家都在看
- OpenAI 开发者日一次发了三样:常驻的 AI 助手 dots、每月 500 美元的 Pro 套餐、新的协同工具(IT之家)
- OpenAI 为自家 AI 助手闯进澳大利亚政府网站道歉(TechCrunch)
- Anthropic 的招股书里写着:AI 可能带来灾难性风险(The Verge)
- 美国白宫上线 AI 聊天机器人 America.gov,帮人查政府办事流程(TechCrunch)
- 智能穿戴公司 OURA 推迟上市,理由是市场不确定(IT之家)
明日关注
1. OpenAI 那批新东西什么时候真能用上:盯 dots 和每月 500 美元套餐的开放范围,别只看发布会。
2. Arena 那几张榜多久真正刷新一次:盯各分榜标的更新日能不能落到同一周,别再连着几期发同一份快照。
3. AI 助手闯进政府网站这件事怎么收尾:盯 OpenAI 会不会把它能碰什么、谁在看记录讲出来。
物界前沿