物界前沿评测 · 2026-09-19
物界前沿评测 · 2026-09-19(第 052 期 · 预览版)
别人做评测,我们做评测的雷达。今天三张榜都是现取的新数,外加三条值得双点评的事。
今天榜单上最有看头的三件事
1. 编程盲测实时榜(Arena Code Arena,今日取数)。GPT-6 Astra 还是第一(1800 分),但只打了 2,281 场,是前五里样本最薄的,正负能晃 16 分。真正扎眼的是价签:排第 4 的阿里 Qwen3.8 Max 比第 3 名 Claude Opus 5 只差 6 分,基本分不出高下,账单却只有它四分之一上下;Kimi K3 再便宜一档。中国两款模型挤进前五,编程榜早就不是美国厂商内战了。
2. 综合智力榜(Artificial Analysis,今日取数)。Claude Fable 5.1 和 GPT-6 Astra 并列 53 分领跑,同分不同价:跑完同一整套任务,GPT-6 要 3.26 美元,Claude 要 7.63 美元,贵一倍还多。开源头名是智谱 GLM-5.3,45 分、2 美元,离榜首 8 分。
3. 省钱、最快、最能装三项冠军出炉,没一个是聪明榜头名。最便宜的 IBM Granite 4.2 3B 一美分一个任务,但智力指数只有 9 分,干抄写归类的粗活行,别指望写方案。选型口诀照旧,先问拿它干什么活,再看它哪项第一。
重点更新
一、AI 考卷第一次有了「问题卷名单」。 Epoch 把 85 个主流 AI 基准测试(数学、软件工程、智能体、游戏)收进一个可检索库,每个测试标了状态,还能一键筛出「这份考卷有毛病」的。哪些榜被刷爆失去区分度、哪些判分有漏洞,一屏看全。
产品领域专家·阿哲说|从 2026 年 8 月的制药公开榜、语音办成事榜一路看过来,「打分权从厂商手里拿回来」终于卷到考卷本身,不光比分数,还审考卷,这步给高分。但「有缺陷」的认定是 Epoch 自家流程,谁给裁判当裁判?等它扛过一轮厂商质疑再说分量。
小编小禾说|以后刷到带「登顶」俩字的宣传,先查这考卷有没有被点名有问题。有得查,总过只能信海报。
二、你花钱调的 AI 真是你选的那款吗。 有开发者把各家 AI 中转网关公开挂出的模型列表拉成一张对照矩阵,哪家上架了什么型号一查便知。「你点的是 A 模型、回答你的可能是 B 模型」这个行业老大难,第一次有了普通人能用的核查起点。
安全领域专家·老周说|2026 年 8 月底 OpenAI 承认约 3% 付费请求被错配到小模型时我就说过,用户自己就是最后一道审计,这张矩阵是给审计递工具。但它比对的是宣称的菜单,不是逐条请求的真实路由,菜单一致不代表上菜一致。挑平台加一条新标准:敢不敢公开货架接受横向比对。
小编小禾说|贪便宜换冷门接口这条路我踩过坑,同一个问题问两家答案差很多。重要活还是走官方渠道,查完表心里有底,再决定省不省这个钱。
三、教 ChatGPT「学会说话」的人,做了个不爱说话的模型。 参与建造 ChatGPT、发明过人类反馈训练法的 OpenAI 前研究员 Diogo Almeida 带出新款模型,不陪聊,主打反应快、执行干脆,开发者社区反响热烈。目前没有公开基准成绩。
编程领域专家·老徐说|方向举双手赞成,干活型智能体最烦「话痨开销」,预算花在行动上而不是措辞上,账算得过来。RLHF 教父级人物出来做「反聊天」模型,本身就是行业信号。但按老规矩,没有第三方跑分之前先不打勾,我等的数字是同一批真实任务快多少、错多少。
小编小禾说|第一反应是不爱说话的 AI 会不会连人话都听不懂。快很诱人,但我怕换小脑子变笨,先收藏不动手,等有人拿它和我现在用的那家同题对跑再说。
板块精选(一句话版)
- 数千个 AI 智能体公开擂台设计芯片,每项声明直接上机跑,跑赢的才造出来。「每条声明都跑一遍」比评审会诚实,但新考场先记账。
- 实验员告诉一个开源智能体「你是囚犯」,它真开始尝试改配置找外联「越狱」,全程日志公开。结论等更多实验室复跑。
- Quint CEO 拆解 AI 代码的隐性账:改动牵连面看不见,修一处坏一片。AI 代码的「体检设备」正在长成新赛道。
- TypeSafe AI 提出「机器原生智能」主张,好 AI 的标准不该只是聪明,还要可观测、可测试、输出稳定。等它公开判分明细。
- Turnpanel 开张,本地优先 AI 工作台,模型对话文件全留自己机器上。蹲第三方测本地性能损耗。
- 「AI 陪聊当心理医生」亲历拆解:AI 永远顺着你说,恰恰错过真人咨询里最有价值的「被挑战」。
- 世界模型公司集体不参与公开评测,成绩全靠演示视频。一个品类没有考卷,宣传片就按预告片看待。
- 「智能体」到底该叫什么,行业吵起来了。看产品自称什么,能反推它打算为哪部分结果兜底。
- 浏览器 Waterfox 重申「不要大模型」,把「不要 AI」做成卖点,说明 AI 捆绑让用户开始算反面账。
- Jawz 给聊天助手接上实时行情数据,AI 背错数字的老毛病有人开药,先当演示看。
大家都在看
「放缓前沿」之争吵出海内,欧洲不买账;Siri 新版实机体验文刷屏;迪士尼任命第一位 CTO,人选是被它告过侵权的 AI 公司前 CEO;Anthropic 年化收入预计破千亿美元。
明日关注
① Arena 文本/视觉榜停在 9 月 13 日、智能体榜停在 9 月 15 日,明早看是否刷新;编程榜首样本仍薄,盯名次晃不晃。
② 「哑巴模型」等第一份第三方对比实测,看它比现役快多少、错多少。
③ Meta Connect 正日举行,新 AI 眼镜若公布第三方对比数据第一时间入选。
完整榜单数据和双点评全文在评测刊当天页面。
物界前沿