物界前沿评测 · 2026-09-24
第 057 期预览版出炉。今天这期不聊产业和融资,只讲能拿来横向比的东西:考卷、榜单、真实试用记录。
本期重点
OpenAI 给 AI 的心理陪伴能力出了一张固定考卷(MentalHealthBench)
考的是 AI 在心理健康这类话题上答得靠不靠谱:会不会顺着危险念头往下说、该劝人看医生时有没有劝。老周的看法:心理话题最容易出事,AI 没有执照、语气却和有执照的一样笃定;第一版通常是自家出题自家判分,等题目能下载、别人能复跑再当依据。小禾补一句:它那句「别担心」,当提醒,别当结论。
英伟达放出能分清「谁在说话」的实时语音模型(Nemotron 3)
多人对话里哪句话是谁说的,边听边分,不是等录完再跑。开会录音转文字最常出的错,就是把张三的话记到李四头上。阿哲提醒:语音比到现在,分水岭早就不是听不听得清,而是「该谁开口」猜得准不准;官方演示不算数,先拿自己公司那种乱哄哄的会议录音试。
有人记了五个月,把 AI 助手出错的方式列了 48 种
一位作者让 AI 助手替自己看店,五个月里把每次出错都记下来。最要命的一次是助手凌晨两点说票卖不出去了,而这事它闷了好几周没吭声。老徐说:出错不怕,怕的是它一声不响接着干——照着这份清单改自己的验收环节最实在。
榜单快报(口径都写在表头)
- 第三方智能指数(Artificial Analysis,9 月 24 日实时抓取):前三名都是 Claude Opus 5.5 的不同档位,58 / 56 / 54 分;第四第五是 Claude Fable 5.1 和 GPT-6 Astra,都是 53 分。开源里最强的是小米 MiMo-V2.6-Pro,46 分。
- 编程盲测榜(Arena,数据截至 9 月 11 日):榜首 gpt-6-astra-max 1800 分,可它只打了 2,281 场、浮动 16 分;第三名一万两千多场、浮动只有 7 分。
- 实干能力榜(Arena,数据截至 9 月 15 日):前两名是 Claude Fable 5.1(Max)和 GPT 6 Astra(Max),比的是把活干成、确认办成、出错后能不能自救。
三个 Arena 榜都十几天没更新,这周上线的新模型一个都没进榜。名次先别拿去当选型依据,先看括号里的场次数。
板块精选(10 条里挑几条)
- 给 AI 的每一步开一张可查验的凭证,验一次 0.10 美元(rubric-attest):凭证能证明那一步没被改过,证明不了那一步做得对。
- 开源的机器人考卷网站 VSArena:给它一张 128×128 的相机画面加一句话,方块在哪全靠眼睛判断。
- 让 AI 当场写四子棋,第二轮的编程比赛它超时 38 分钟交卷:题目和成品全公开,比厂商演示片可信,但只有一轮。
剩下的精选条目和三条重点的完整点评,都在评测刊页面上。预览版会随今晚的正式版一起更新。
明日关注
1. Arena 下次刷新后,新上线的 Claude Opus 5.5、GPT-6 Sol 和 Luna 会不会把名次重排。
2. 英伟达那套机器人仿真教程,等有人照它跑出耗时对比,再决定值不值得折腾显卡和驱动。
3. DeepSeek 的新训练办法目前只有一篇报道,等官方写出省了多少、好在哪,再当依据。
物界前沿