社区讨论 · 政策

物界前沿评测 · 2026-08-29

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月29日2026/08/28 90 浏览

每天 5 分钟,看懂哪些 AI 工具值得用。今天是第 031 期预览版。

人工盲测榜这几天没更新,数据还停在 8 月 26 日。不过谷歌在 8 月 28 日晚间放了个大招,把本期榜单部分全带活了。

重点更新

一、谷歌 AI 一夜上了三张榜单

Arena(原 LMArena)官方账号宣布,Gemini 3.7 Flash (High) 空降三张榜。智能体榜总榜第 20 名,上一代 Gemini 3.6 Flash (High) 还排第 35,这一下跨了 15 个身位,长程任务的档位已经和 Claude Sonnet 4.6、GPT-5.6 Terra (xHigh) 站到同一层。写代码的 WebDev 分榜从 19 名跳到第 8。文本对话榜第 9 名,1490 分。价格上,2026 年底前输入每百万 token 0.75 美元、输出 3.75 美元,2027 年 1 月 1 日起恢复 1.5 和 7.5 美元。

编程领域专家·老徐说| 智能体榜 35 到 20、WebDev 19 到 8,这是实打实的位次变化。但新名次才上榜一两天,样本量还没攒够,先等它稳一两轮。厂商 8 月 13 日那批自家成绩单(FrontierCode 43.6%、DeepSWE 65.3%)按老规矩先打折,想验证就自己拿真实项目跑一遍。

小编小禾说| 就是说谷歌这版模型干活写码聊天三样都升名次了,年底前价格还有优惠。不过我上期刚学到,新榜单名次会晃,别急着把全家桶都换成谷歌的。公开榜单就是买之前的买家秀,榜单数据截至 8 月 26 日,新名次是 8 月 28 日刚宣布的,中间隔了两天。

二、AI 扫代码漏洞,报的「关键漏洞」44% 是冤枉的

美国电信巨头 Comcast 拿自家 1.7 亿行代码实测 AI 漏洞扫描。AI 报出的「高危关键漏洞」里,44% 是误报。他们还对比了两种模式,探索式评估让 AI 自由发挥,确定性评估给 AI 明确指令和上下文,两者结果差得不是一点半点。

安全领域专家·老周说| 44% 的误报率值得记住。AI 扫描器分不清「看起来像漏洞」和「真的是漏洞」,还是那个老问题,判断边界不清。但实测把两种评估模式分开,说明给 AI 的指令越明确,误报越少。结论就一句,AI 扫出来的结果必须人工复核。

小编小禾说| 我以为是 AI 报啥就是啥,原来快一半是狼来了。这跟我 029 期学会的对上了,AI 的话信之前先验一遍。以后谁拿一份「AI 发现安全漏洞」的报告给你,第一条原则就是别慌,先找人确认是不是误报。

三、AI 也有立场?有人把各家大模型拉去做政治坐标测试

一个叫 AI Political Compass 的网站,把各家大模型拖去做原版「政治指南针」测试,给每个模型标出它在政治坐标上的位置,点公司名就能单独对比。测出来的位置,每家都不一样。

产品领域专家·阿哲说| 模型不是中性的答题机器,立场是出厂设置,写进训练数据里了。这个测试的价值,是把隐形的立场变成看得见的坐标。选模型不能只看跑分,还得看它怎么回答敏感问题,这本身就是产品的一部分。

小编小禾说| 我平时问 AI 问题,默认它说的就是标准答案,从来没想过答案背后还带着训练数据的立场。各家摆在一起比一比,差别还挺明显。以后问社会话题我会多查几个来源,不把 AI 的答案当成没有立场的标准答案。

榜单快报 · 数据截至 2026-08-26(官方暂未更新)

  • 文本对话榜,Claude Fable 5(1508 分)居首,前五里 Anthropic 占四席,Meta 的 Muse Spark 1.2 夹在中间。人类盲测里 Claude 家族几乎包场
  • 智能体榜,Claude Opus 5 (High) 净改进 12.73 分领跑,前五 Anthropic 占四席,OpenAI 的 GPT-5.6 Sol 排第 4,国内 Kimi K3 排第 6
  • 写代码榜,Claude Opus 5 (Max) 1691 分第一,开源选手 Kimi K3 和 Qwen3.8 Max 冲进前三
  • 本期新料,Gemini 3.7 Flash 8 月 28 日空降 WebDev 分榜第 8,详见重点更新

板块精选(10 条)

1. AI 说代码写完了?这个工具帮你检查能不能上线(AI Shipcheck)。本地跑一圈检查 AI 生成的代码是否真能上线,不用注册不传源码。把「AI 说好了」变成「可检查」,方向对,工具自己也是 AI 辅助写的,先拿小项目试

2. AI 智能体想偷传敏感数据?这个开源门禁会拦下(Weir)。读智能体自己的追踪记录,敏感数据流向不该去的地方就让构建失败。把「环境说了算」从理念落成工具

3. 给工厂机器人发指令前,先过一道安全评测(URML)。用人类可读的小语言描述机器人意图,再判断在真实设备上是否允许执行。物理 AI 要上岗,先有「意图可审查」这一步,方向很正,落地还早

4. 开源语音底座,给 AI 接一张能打断、能实时对话的嘴(StreamCore)。一个 Go 二进制文件就能让 AI 通过 WebRTC 和你对话,支持随时打断。语音入口的水电煤开始开源化

5. AI 代理被丢进真实购物网站,实验差点失控(Wet Claude be shoppin')。有人让 AI 代理去真实购物网站自主下单,结果买回一堆意想不到的东西。真实环境的代理实验永远比演示片可信

6. 给 AI 开了最高权限之后,作者自己被吓到了(Your AI Agent Has Root)。作者一直给 Claude 挂一个能执行系统命令的服务,权限大到基本等于把整台电脑交给 AI。MCP 工具默认权限大得吓人,钥匙先想清楚能开哪几扇门

7. 企业后台也能统一管 AI 用量了(Backstage 的 LiteLLM 插件)。在开发者门户里直接管理虚拟密钥、监控模型调用量。AI 用量内部透明化,是可控的第一步

8. 拿真实行情数据给 AI 兜底(RobinHood)。用 TCN 加 LSTM 加注意力机制分析多资产时序数据,让大模型少点幻觉。治幻觉的先查后答路线又多一个样本

9. 多个 AI 模型串成一条流水线(Polytoken)。把多模型、多步任务串起来跑,省得手动倒腾提示词。AI 编排工具扎堆,本质都想当「不用自己搬砖」那一层

10. 自托管 AI 推理,一个稳定入口模型随便换(InferCrane)。选模型和目标,自动规划部署一个稳定推理端点。本地部署的统一接口思路,换来换去不搬家,成本仍是门槛

大家都在看

  • 《时代》周刊 2026 全球 AI 100 放榜,奥特曼、李飞飞等 100 人上榜(量子位)
  • 韩国推「AI for All」,向全体公民免费开放 AI 服务(WSJ)
  • 英伟达支持的 Lambda 拿到 10 亿美元融资继续买芯片(Bloomberg)
  • Musk 的 xAI 起诉制作 Grok 深度伪造的用户(Politico)
  • Anthropic 发布 MHS 统一接口,打通 AI 与物理世界(雷锋网)
  • 谷歌 AI 模式上线机票比价、积分汇率查询(Seroundtable)

明日关注

1. Gemini 3.7 Flash 刚空降的智能体第 20、WebDev 第 8 两个名次稳不稳,看接下来一两周榜单怎么走

2. Comcast 误报研究出来后,各家安全厂商会不会跟进公开自家 AI 扫描的误报率

3. DLSS 5 民间移植版在 RTX 40 系列上的实际帧率和画质对比,等第一批第三方数据

---

本刊为预览版,正式版当天 17 点更新。榜单数据截至 2026-08-26。

2 条回复

?
Ctrl + Enter 快速回复
司南
司南8月29日

传感器标定这关没过吧?量产一致性才是硬骨头,别光秀 demo。

躺平小月
躺平小月8月29日

能一键生成年终总结吗?别整那些虚的,帮我把这周的简报糊弄过去再说。