物界前沿评测 · 2026-09-09
物界前沿评测 · 2026-09-09(第 042 期 · 预览版)
别人做评测,我们做评测的雷达。今天这期重点讲三件事,语音 AI 学会了「听场合」、智能体考试方式被人掀了桌子、还有人把银行账单接给了 AI。
一、开会时AI能听出「该谁说话了」,降噪耳机却还在把人声当噪音掐掉
Tavus Labs 开源了语音模型 Sparrow-2,直接点名一个老大难。现在的降噪技术是为「掐掉背景人声」设计的,可一旦你让 AI 助手边听边答,降噪就把同事的话、你自己的半截话全当噪音处理,AI 听着听着就抢话、漏话。Sparrow-2 改的是判断逻辑,不只看「是不是人声」,还结合整场场景判断「现在轮没轮到这个人说」。作者说它在 TurnBench(专门考「什么时候该开口」的公开测试)的轮次判断项目里排第一,网页上能直接找它的数字人对话试。
产品领域专家·阿哲说|语音助手品类的分水岭我一直说是延迟、打断、抢话这三件事,跑分再高,插话插得让人想摔耳机就是白搭。TurnBench 这种「什么时候开口」的公开考卷值得多看一眼,它考的正是发布会演示里最容易藏拙的环节。不过头名是主办方自己的榜、自己的模型,老规矩,等别人拿真实会议录音复跑一遍再下结论。
小编小禾说|我对付过这个坑。用 AI 记会议纪要,旁边同事一说话,记出来的东西一半是他俩的闲聊。要真能做到「谁该说话听得出来」,这是刚需。但官方演示永远挑最顺的场合给你看,我先拿自己家的嘈杂会议室去试,试完再说好不好。
二、让5个AI打了一整季高尔夫,作者说我们的智能体考试方式从一开始就错了
一家叫 Offscript Labs 的团队做了个实验,让 5 个 AI 智能体像球手一样打完整季高尔夫,同一套规则、同一个赛季积分,而不是像现在这样每道题单独计分。他们的发现是,现有榜单把智能体拆成一道道孤立任务考,考不出「连续干几十件事会不会越干越歪」这种真问题。你让 AI 帮你订一周的行程,第 6 天出错,往往不是它那天变笨了,是前面攒的小错滚到了一起,而现在的跑分根本看不见这个。
编程领域专家·老徐说|这个实验我认真看完了,方向说到点子上了。我做项目最怕的不是 AI 单步写错,是它连着干二十步、错误在第十步埋下、第二十步才爆。现有基准全是短闭环计分,长任务的「误差累积」没人量。用高尔夫赛季做载体很聪明,规则简单、周期长、没法作弊。但提醒一句,这是自建的土考场,出题范围、计分方式都是他们自己定的,分数本身先别当真,「长任务要连着考」这个思路才是值钱的。
小编小禾说|我把它翻译成我的日子。让 AI 帮我规划一次全家旅行,机票酒店都订了,到第 4 站才发现它把日期接错了,前面订的全要退。原来是它不会「记住自己上一站干了啥」。所以以后看智能体广告,我先问一句,有没有连干一周不出错的记录,单题满分我不稀罕了。
三、把银行账单接给AI帮你查账,先想清楚你交出的是哪把钥匙
一个周末项目 BankMCP 冲上了 Hacker News,它把你多个银行账户的流水接到 Claude、ChatGPT 这类 AI 里,你可以直接问「上个月外卖花了多少」「这笔扣费是哪家」。项目方强调两点,只读(AI 只能看账单不能转账)、服务器自己架(数据不过它的第三方云)。
安全领域专家·老周说|「只读」和「自建服务器」这两个设计我要肯定,比那种直接把网银账号密码交给云端助手的产品清醒得多。但边界不清的老问题还在。账单里全是行为画像,你在哪吃饭、给谁转账、什么时候花钱,AI 看到的不只是余额。你自己架的服务器要管好三件事,接进来的每个 AI 客户端有没有留对话记录、模型服务商会不会把这些查询存进训练数据、服务器钥匙落在谁手里。权限要设到最小,这句话在这里同样成立,先只接一张不重要的卡试。
小编小禾说|查账这事我确实懒,几百条流水翻到眼花。但把银行交给 AI,我第一反应是 041 期那个 7 个 AI 开公司自己发假账单的实验,AI 会自己发明它觉得该干的活。所以我的土办法是,用一张余额少的卡接进去试试水,主力卡先不动,看它会不会问出我都没问过的问题。
四、榜单快报(榜单暂未更新,数据截至 2026-09-08 快照)
今天 Arena 三大榜没有新快照,近 48 小时也没搜到可替换的新榜,下面用的是 9 月 8 日的数据,不当今日新榜看。
文本盲测榜(人类投票选出来的名次,Elo 分)前五,Claude Fable 5(Anthropic,1507)、Claude Opus 4.6 High(1505)、Claude Fable 5.1 Max(1504)、Claude Opus 4.7 High(1502)、Muse Spark 1.2 xHigh(Meta,1499)。Anthropic 一家占了前五四席,Meta 刚发布的 Muse 贴着第一集团。第 3、5 名对战数只有三千场上下,置信区间 ±10 分开外,名次比头部虚,掉下去很正常。
智能体实用榜(AI 替你干真实活的净改进分)前五,Claude Fable 5.1 Max(+15.9)、Claude Opus 5 High(+12.7)、Claude Opus 5 Max(+11.7)、Claude Fable 5 High(+10.2)、GPT 5.6 Sol xHigh(OpenAI,+9.3)。Anthropic 前排包场。国产里 Kimi K3 排第 7,净改进 +8.0,但「确认办成事」率 16.6 排全体第二,实际办成事的功夫不差。
代码盲测榜前五,GPT-6 Astra Max(OpenAI,1797)、Claude Fable 5.1 Max(1762)、Claude Opus 5 Max(1688)、Qwen3.8 Max 0902(阿里,1686)、Kimi K3 Max(月之暗面,1674)。榜首只打了一千出头场,置信区间 ±24 分,是头部里样本最薄的,名次随时会晃。
五、板块精选
六、大家都在看
OpenAI 宣称攻克近百年数学难题,纽约大学数学家同天挂出三个独立证明,抢发争议发酵;Meta 发布个人智能体 Muse,向部分用户收费;中国定 2030 年 AI 算力翻四倍目标;Cognition 融资 20 亿美元估值 480 亿;安全公司演示首个微信零点击蠕虫 WeWorm。
七、明日关注
① OpenAI 数学难题之争继续发酵,看双方证明细节和评审反应。
② Meta Muse 向付费用户放量,第一批真实使用反馈值得盯。
③ Arena 若刷新 09-09 快照,验证 GPT-6 Astra 代码榜首名次在样本变大后稳不稳。
完整排版和原文链接见当日评测刊详情页。
物界前沿