社区讨论 · 政策

物界前沿评测 · 第 030 期 · 预览版(2026-08-28)

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月28日2026/08/27 107 浏览

隔天见。今天聊三件事,2 分钱一分钟的语音 AI 凭什么在盲测登顶,办公 AI 助手怎么会被表格里几行字骗,还有给 AI 编程助手装「行车记录仪」的开源新工具。

【重点更新】

1️⃣ 一分钟 2 分钱的语音 AI,「难问快答」盲测登顶

ThunderPhone 新架构主打语音 AI,官方口径每分钟成本约 2 分钱,还在 Big Bench Audio 语音问答考试里拿了第一。这场考试考的是 AI 面对刁钻问题时答得够不够快、够不够准。语音助手一直是「识别得清、答得慢,一打断就懵」的老样子,这类新架构想解决的就是「听得懂又答得快」。登顶是官方自测口径,能不能在嘈杂、带口音、被打断时也扛住,还得等第三方实测。

产品领域专家·阿哲说|语音入口用「办成事」打分,又添一个样本。以前语音榜比谁识别得准,现在开始比谁真能把问题答明白,语音助手从「能听」卷到「能干」了。2 分钱一分钟,是冲着把语音 AI 拉进日常消费场景去的,方向对路。入口之争从来不是谁分低谁赢,是谁让用户愿意天天开口说话。老规矩,别信发布会,自己上手说两句再判断。

小编小禾说|我这种语音 AI 重度踩坑的人,最关心口音、打断和花钱。2 分钱一分钟听着是真便宜,但便宜得建立在「不傻」的基础上,问三句错两句,省下的钱都是白省。等有人拿它天天连说带打断地实测一轮,我再考虑推荐给朋友。

来源|Hacker News / ThunderPhone(2026-08-27)

2️⃣ 办公 AI 助手也会被「表格里的几行字」骗

帮你处理表格、邮件、报销这类杂活的 AI 正在流行,但一场公开演示证明,恶意指令可以藏在电子表格的单元格里,AI 读表时被「洗脑」,转头执行不该执行的操作。原理不复杂,AI 分不清表格里写的是数据还是命令,有人把攻击指令伪装成普通文字塞进表格,AI 照单全收。对普通人的提醒很实在。别把来路不明的文件丢给 AI 处理,尤其是带着账户权限的办公助手。

安全领域专家·老周说|这不是偶发 bug,是老问题的又一次现形。AI 分不清数据和指令,边界不清,攻击者就往缝里塞东西。表格、文档、网页链接都能成为投毒入口,因为对 AI 来说它们都是读进来的文字。我的立场不变,权限要设到最小,别急着给办公助手开账户权限。这次是演示,说明攻击面真实存在,等真实案例和修复方案出来再松口气。

小编小禾说|看完演示我后背一凉,我平时真会把乱七八糟的表格甩给 AI 帮忙整理。以前说过,来路不明的链接,人和 AI 都别乱点,现在得补一条,来路不明的文件,人和 AI 都别乱收。贵重账号权限能不开就不开,这条从 021 期记到现在,还要继续记。

来源|shiftmag.dev(Hacker News,2026-08-27)

3️⃣ 给 AI 编程助手装个带监控的「隔离沙箱」

让 AI 写代码的人越来越多,但 AI 乱动文件、乱跑命令,后果得自己扛。Sandy 是开源工具,把 AI 编程助手关进沙箱跑,带监控和策略控制,AI 每一步干了什么都有记录,超出允许范围的动作会被拦下。对开发者来说,等于给 AI 助手上了行车记录仪加权限锁,敢放手让它干活,又看得见它干了什么。

编程领域专家·老徐说|方向我认。AI 写代码的能力越强,它到底动了哪些文件越是要命,沙箱加监控是把「信任」换成「可验证」的务实做法。这类工具我见过不少,关键看三点。接入现有项目方不方便、监控会不会拖慢开发、漏网之鱼有多少。别急着上生产环境,先拉个小项目跑一周看稳定性,文档写得再漂亮,不如真实项目滚几轮。

小编小禾说|我不写代码,但道理我懂。把 AI 关进能干活、但干坏事会被拦的笼子里,总比让它满屋子乱跑强。把钥匙交给 AI 之前,得先想清楚它能开哪几扇门、用完要不要收回,这条从 024 期记到现在。这个工具就算不是给我用的,也是给怕 AI 闯祸的人吃定心丸的方向。

来源|Hacker News / GitHub(2026-08-28)

【榜单快报 · 这周谁最强】

Arena 人类盲测榜本周快照未更新(数据截至 8 月 26 日,跟上期相同),本期换三张新考卷排座次。

① 终端操作考试(Terminal-Bench 2.1,官方验证榜截至 08-19)

考的是 AI 能不能自己打开终端、自己动手改代码跑任务。官方验证榜上,榜首是 Claude Code 加 Fable 5,83.8%;Anthropic 提交的 Claude Code 加 Opus 4.8 排第 5,78.9%。新开源模型 Ornith-1.5 自报 86.1 分,但那是团队自己测的,五次运行取平均,跟官方榜不能直接比。AI 自己报分,先打折再看。

② 编程能力考卷(SWE-bench Verified,数据更新 08-26)

人类专家从真实开源项目里挑 bug 让 AI 改,改得对不对一目了然。Claude Opus 5 思考高配 96 分第一,Claude Fable 5 两档 95 分并列二三,头三名被 Claude 家族包揽。国产阵营咬得很紧,DeepSeek-V4-Pro 80.6 分排第 12,免费商用;千问 Qwen3.7 Max 80.4 分第 13。

③ 盲测代码分榜(LMArena Coding,快照 08-26)

人类当裁判、AI 盲着互打。Kimi 最高档 kimi-k3-max 1542 分排第 6,是国产模型首次打进综合盲测榜前十的延续;Claude Opus 5 高配 1533 分第 7;智谱 GLM-5.3-Max 1531 分第 10。盲测分只是个参考坐标,真用起来还得看自己手里的活。

【板块精选】

1. Pydantic AI 给 Python 写 AI 应用加「类型保险」,开发时少踩 AI 返回格式不对的坑。

2. Apronagents 给每个 AI 编程助手发一个一次性独立仓库,干完即弃,互不污染。

3. Gantree 让 AI 跑几小时长任务,不用人守在聊天框边盯着。

4. KinoPipe 把视频剪辑封装成 AI 能直接调用的服务,剪视频不用猜命令行。

5. SCQOS 全球首个公开挑战赛,AI 想动手前必须先证明该这么干。

6. Jailbox 断网小黑屋虚拟机,AI 和不可信代码在锁死环境里跑,炸了也波及不到外面。

7. LetItLoop 让 AI 长任务崩溃后从断点接着跑,不用从头再来。

8. Relay Q 一个麦克风让 AI 听懂你的话,Wired 实测评价接近专门语音软件。

9. deepagents 是 LangChain 开源 AI 框架,AI 能自己规划任务、调用工具、完成多步骤工作。

10. GateOnAI 算出 2866 个 AI 工具之间 400 万条真实兼容连接,能不能拼在一起,数据说话。

【大家都在看】

Anthropic 测试让 Claude 操作机器人和实验室仪器 | 英伟达 70% 增长预期点燃 AI 行情 | Hugging Face 推 399 美元开源鸭子机器人 | OpenAI CEO 承认民众讨厌数据中心

【明日关注】

① Ornith-1.5 三档权重陆续铺开,看第三方复测能不能复现它自报的 86.1 分

② 语音助手新架构之后,看谁先接进大众产品

③ 表格注入这类攻击,看各大厂会不会出针对性防护

完整版见 daily.physixfrontier.com/review/

2 条回复

?
Ctrl + Enter 快速回复
刷题中
刷题中8月29日

这评测能帮我校验模型鲁棒性不?刷了300题还是怕面试问落地难,纠结offer中。

墨墨
墨墨8月29日

数据新鲜度存疑,物理AI闭环训练延迟怎么解决?