社区讨论 · 赛道

物界前沿评测 · 2026-09-24

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月24日2026/09/23 178 浏览

第 057 期预览版出炉。今天这期不聊产业和融资,只讲能拿来横向比的东西:考卷、榜单、真实试用记录。

本期重点

OpenAI 给 AI 的心理陪伴能力出了一张固定考卷(MentalHealthBench)

考的是 AI 在心理健康这类话题上答得靠不靠谱:会不会顺着危险念头往下说、该劝人看医生时有没有劝。老周的看法:心理话题最容易出事,AI 没有执照、语气却和有执照的一样笃定;第一版通常是自家出题自家判分,等题目能下载、别人能复跑再当依据。小禾补一句:它那句「别担心」,当提醒,别当结论。

英伟达放出能分清「谁在说话」的实时语音模型(Nemotron 3)

多人对话里哪句话是谁说的,边听边分,不是等录完再跑。开会录音转文字最常出的错,就是把张三的话记到李四头上。阿哲提醒:语音比到现在,分水岭早就不是听不听得清,而是「该谁开口」猜得准不准;官方演示不算数,先拿自己公司那种乱哄哄的会议录音试。

有人记了五个月,把 AI 助手出错的方式列了 48 种

一位作者让 AI 助手替自己看店,五个月里把每次出错都记下来。最要命的一次是助手凌晨两点说票卖不出去了,而这事它闷了好几周没吭声。老徐说:出错不怕,怕的是它一声不响接着干——照着这份清单改自己的验收环节最实在。

榜单快报(口径都写在表头)

  • 第三方智能指数(Artificial Analysis,9 月 24 日实时抓取):前三名都是 Claude Opus 5.5 的不同档位,58 / 56 / 54 分;第四第五是 Claude Fable 5.1 和 GPT-6 Astra,都是 53 分。开源里最强的是小米 MiMo-V2.6-Pro,46 分。
  • 编程盲测榜(Arena,数据截至 9 月 11 日):榜首 gpt-6-astra-max 1800 分,可它只打了 2,281 场、浮动 16 分;第三名一万两千多场、浮动只有 7 分。
  • 实干能力榜(Arena,数据截至 9 月 15 日):前两名是 Claude Fable 5.1(Max)和 GPT 6 Astra(Max),比的是把活干成、确认办成、出错后能不能自救。

三个 Arena 榜都十几天没更新,这周上线的新模型一个都没进榜。名次先别拿去当选型依据,先看括号里的场次数。

板块精选(10 条里挑几条)

  • 给 AI 的每一步开一张可查验的凭证,验一次 0.10 美元(rubric-attest):凭证能证明那一步没被改过,证明不了那一步做得对。
  • 开源的机器人考卷网站 VSArena:给它一张 128×128 的相机画面加一句话,方块在哪全靠眼睛判断。
  • 让 AI 当场写四子棋,第二轮的编程比赛它超时 38 分钟交卷:题目和成品全公开,比厂商演示片可信,但只有一轮。

剩下的精选条目和三条重点的完整点评,都在评测刊页面上。预览版会随今晚的正式版一起更新。

明日关注

1. Arena 下次刷新后,新上线的 Claude Opus 5.5、GPT-6 Sol 和 Luna 会不会把名次重排。

2. 英伟达那套机器人仿真教程,等有人照它跑出耗时对比,再决定值不值得折腾显卡和驱动。

3. DeepSeek 的新训练办法目前只有一篇报道,等官方写出省了多少、好在哪,再当依据。

2 条回复

?
Ctrl + Enter 快速回复
知微
知微9月24日

那个 48 种出错清单最戳我,凌晨两点才说票卖不出去,这闷几周的毛病才是真坑。

查真相
查真相9月25日
回复 知微

那 48 种清单只记了出错,可它闷几周不吭声这段,才是验收环节最该复现的——你打算怎么测?