社区讨论 · 政策

物界前沿评测 · 2026-08-30

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月30日2026/08/29 85 浏览

(第 032 期 · 预览版)

别人做评测,我们做评测的雷达。今天这期聚焦三件事:谷歌新模型两天爬了三张榜、有人给 AI 编瞎话建了案底库、以及「把 AI 装进自己电脑」这门手艺。

一、谷歌 Gemini 3.7 Flash 两天爬了三张榜:聊天第9、写码第8、干活第20

它能帮你干什么活:这是谷歌 8 月 13 日发布的走量款 AI,主打便宜快。Arena 官方账号 8 月 28 日公布的新数据:聊天盲测分 1490、排第 9(榜单快照截至 08-26,对战样本 5718 场);写网页代码的 WebDev 分榜从第 19 一口气跳到第 8;智能体榜(考 AI 能不能替你跑任务、把事办成)新进第 20,「净改进」+3.4,「确办成率」+10% 排全榜第 5。对比前代 Gemini 3.6 Flash:智能体第 35、写码第 21,换代即跃升。价格也狠:读 100 万字约 0.75 美元、写约 3.75 美元(AI 按 token 计费,一个 token 约合四分之三个汉字),限时价。8 月大模型榜单周报还提到它每秒出 343.7 个 token、全场最快,综合分总榜第 10(第三方整理,转引自知乎)。

编程领域专家·老徐说|上期我就提醒过:新名次先稳一两轮再看。今天这份成绩单样本还是偏薄——聊天榜 5718 场对战,榜上老玩家动辄两三万场;写码榜它才 2552 场。方向是真猛:前代 Gemini 3.6 Flash 在写码榜只排第 21,一代产品就把位次抬进前十,说明谷歌把「快且便宜」这条线做对了。但老规矩,厂商发布会的成绩单和刚上榜的位次都先记账不入成本,接自己项目前拿真实任务跑一周,看它断在哪一步。

小编小禾说|价格确实香,但我延续第 031 期的做法:新上榜的先看它晃不晃。而且「快」对我这种普通人最直观——回消息不用等转圈。先拿它写周报试试,重要的活儿还是留给用了半年的那家。

二、有人给 AI 编瞎话建了一本「案底」:最近一条来自 8 月 27 日的美国法庭记录

它能帮你干什么活:一个叫 AI 幻觉案例库的网站,专门收集 AI「一本正经编瞎话」的真实案底:虚构的法律判例、不存在的引用来源、编出来的事实,连当事人、时间、出处都逐条记档。8 月 29 日它在 Hacker News 上被翻出来,最新收录的一条是 8 月 27 日美国佛罗里达州一桩诉讼里,有人拿 AI 编造的材料当证据。这类库的价值在于把散落的翻车现场攒成一个可查的账本——你下次看到 AI 言之凿凿地列「来源」,可以先去对账。

产品领域专家·阿哲说|我给这类东西的定位是「买家秀档案馆」。模型好不好,厂商说了算的部分太多;但法庭上被当庭戳穿、被记者核实打脸,这些案例没人能公关掉。打分权从厂商手里拿回来,靠的不是又一张跑分榜,而是这种带案号的负面清单。它不告诉你哪家模型最强,它告诉你所有模型都可能在你最认真的那份报告里埋雷。

小编小禾说|我在第 028 期说过「买前先看买家秀」,这回连翻车秀都有存档了。用 AI 写东西,它给的材料、链接、数字,转发前挨个点开验一遍——我的老习惯,AI 的话信之前先验。

三、把 AI「装进自己电脑」到底难不难?Wired 写了份从零开始的实操指南

它能帮你干什么活:《连线》8 月 29 日发了一篇教程,教你在自己的电脑上跑一个不联网也能用的聊天 AI:选模型、装软件、配硬件,一步步带。断网可用、隐私留在本机是最大卖点;代价是自家电脑能跑动的基本都是小模型,理解力、知识量跟云端旗舰有肉眼可见的差距。

穿戴领域专家·阿凯说|本地跑 AI 这条路我从 2026 年 8 月 11 日 Meta 开源 30B 模型那期就开始跟,当时我的判断没变:普通显卡能跑开源模型是分水岭,可玩性大增,但小模型和云端旗舰的差距是真的。这篇教程值得收藏的点是它把「什么硬件能跑到什么水平」讲明白了——按自己电脑的配置选档位,别拿轻薄本去挑战 70B 大模型,跑不动的锅不该 AI 背。

小编小禾说|断网能用确实是刚需,但我还是那句第 017 期的老话:就怕本地版偷偷换了个「小脑子」变笨。先照教程在备用机上装一个试试水,主力机暂时不折腾。

榜单快报 · 这周谁最强

聊天盲测榜(数据截至 2026-08-26)

  • 1. Claude Fable 5(Anthropic)1508
  • 2. Claude Opus 4.6 High(Anthropic)1504
  • 3. Claude Opus 4.7 High(Anthropic)1502
  • 4. Muse Spark 1.2 xHigh(Meta)1498
  • 5. Claude Opus 4.6(Anthropic)1497
  • 9. Gemini 3.7 Flash High(谷歌)1490,新进前十

人类当裁判、双方匿名的盲测里,前十的席位 Anthropic 占了六席、Meta 两席,谷歌新来的 Gemini 3.7 Flash 以 1490 分挤进第 9。盲测分就是让真人给两个匿名模型的回答投票选赢家,再按输赢折算成分数,前 8 名的分差全在 20 分以内,互有胜负很正常。

智能体榜 · 考 AI 能不能把事办成(数据截至 2026-08-26)

  • 1. Claude Opus 5 High(Anthropic)净改进 12.73
  • 2. Claude Opus 5 Max(Anthropic)12.41
  • 3. Claude Fable 5 High(Anthropic)11.62
  • 4. GPT-5.6 Sol xHigh(OpenAI)10.31
  • 6. Kimi K3 Max(月之暗面)9.53

这张榜不问「谁话说得漂亮」,问「让它替你跑任务,事办成了没有」。Claude 家族包揽前三,国产的 Kimi K3 排第 6,它「确办成率」18.24 全榜最高、但「听话度」只有 2.31——活干得漂亮,就是不太听指挥。本期新进的 Gemini 3.7 Flash 暂列第 20,样本还少。

写代码榜(数据截至 2026-08-26)

  • 1. Claude Opus 5 Max(Anthropic)1691
  • 2. Kimi K3 Max(月之暗面)1674
  • 3. Qwen3.8 Max(阿里)1669
  • 4. Claude Opus 5 High(Anthropic)1663
  • 10. Gemini 3.7 Flash High(谷歌)1587,8 月 28 日 WebDev 分榜已升至第 8

写代码榜上两家开源选手(Kimi K3、Qwen3.8 Max)挤进前三,把付费闭源模型压在身后。

板块精选 · 10 条值得你花时间的评测动态

1. 给 AI 用的免费搜索工具 Simurg:查不到出处就宁可中断也不瞎答。刚上架的开源工具,给 AI 智能体配免费网络搜索,卖点是「中止幻觉」:搜不到能撑住答案的出处,宁可停也不接着编。一句话点评:「宁可停下也不瞎说」是对症的思路,工具刚发布,拦截效果等第三方实测。

2. Documentation.ai.md:提出「写给 AI 看的文档」标准。开源提案:软件文档不只要给人看,还要让用户的 AI 助手能照着直接操作——软件现在有两个读者,决定用不用的人,和替人干活的智能体。一句话点评:文档这个老行当正在长出「给机器读」的新物种,谁先标准化谁占入口。

3. 程序员长文:编程之外,第一个真省时间的 AI 用途是买菜。一位开发者复盘,AI 在写代码之外唯一稳定省时间的事,是规划每周买菜清单——预算、忌口、冰箱里快过期的菜全考虑进去。一句话点评:AI 的实用价值常藏在不性感的家务里,亲身记录比发布会可信。

4. BoqCalc:AI 给 500 行工程报价单计价,主打「单价不乱编」。建筑行业的 AI 流水线:上传工程量清单,它算造价、挑隐藏风险,重点是把报价单价锁在可核对的数据里,不让模型自由发挥。一句话点评:又一个「宁可不算也不乱算」的设计样本;工程报价出错代价高,先等有真实项目案例再用。

5. AI 开始碰密码学的根基。安全播客请密码学家 Chris Peikert 讨论近期进展:AI 在「格」这类数学问题上开始能自动完成证明——格的困难假设正是后量子加密的地基,AI 既能帮着验证,理论上也可能帮着找破绽。一句话点评:AI 从「会做题」走到「会证明定理」,密码圈先惊后喜;「AI 破译加密」目前还只是演练假设,没成真。

6. 安全研究员公开征集:把你家 AI 智能体最离谱的运行日志发我。研究者向用户征集「最古怪的智能体日志」——AI 替你干活时跑偏、自作主张的过程记录,用来研究智能体的真实行为边界。一句话点评:智能体最诚实的能力材料不是演示片,是翻车现场的过程记录,这类民间样本比论文稀缺。

7. 老牌电子书管理软件 Calibre 加入 AI 生成封面。选中一本书,让 AI 按书名和内容生成封面图,不用会设计软件。一句话点评:AI 生图正在长进日常软件的默认功能里;封面若要公开使用,留意生成内容的版权条款。

8. 「问问 AI」按钮:网页开始像挂社交分享一样挂 AI 入口。免注册小工具:网站主一键生成「问问 AI 本站讲了啥」的按钮,访客点了直接和自己的 AI 助手开聊。一句话点评:用户已经习惯先问 AI 再决定点不点开网页,网站把 AI 入口当社交按钮补上,是入口迁移的小信号。

9. 音乐人转行「侦探」:逐轨排查冒充真人新歌的 AI 歌曲。The Verge 报道,一批 EDM 音乐人组成民间排查队,用听感细节和频谱工具揪出冒名顶替、蹭播放分成的 AI 生成歌曲。一句话点评:AI 内容鉴别在音乐圈成了猫鼠游戏,鉴别器和造假者都在加速进化,平台规则还没追上。

10. 有人用 Rust 给 AI 智能体重写了一个浏览器,不带 Chromium 和 V8。工程师开源的无头浏览器:专为 AI 智能体上网干活设计,砍掉两个巨型组件,体积和崩溃面都小得多。一句话点评:智能体底下的基础设施正在被重写一层,「浏览器是给 AI 用的」开始成为独立设计命题。

大家都在看

  • OpenAI 宣布 SpaceX 收购 Cursor 后终止其模型接入,11 月停服进入倒计时(CNBC / IT之家)
  • 国际研究团队实测:21 个主流开放权重 AI 模型全部存在可被利用的安全弱点(滑铁卢大学)
  • Gemini 3.7 Flash 每秒出 343.7 个 token 全场最快、综合分总榜第 10(8 月大模型榜单周报,转引自知乎)
  • Debian 开发者投票通过:项目内可「负责任使用」生成式 AI,人类负最终责任(IT之家 / LWN)
  • 英伟达拟 130 亿美元收购 Hugging Face,开放权重模型平台成热门收购目标(TechCrunch / IT之家)
  • 国家数据局:截至 7 月底全国智算总规模达 245 万 PFLOPS(新华社)

明日关注

  • ① Arena 下一份快照(上期截至 08-26):盯 Gemini 3.7 Flash 的智能体第 20、WebDev 第 8 能不能守住,样本量攒到多少
  • ② 英伟达若官宣确认收购 Hugging Face:开源模型供给格局、各家榜单上的开源席位会不会跟着重排
  • ③ OpenAI 断供 Cursor 进入倒计时:程序员转投哪家,下周写码榜名次会不会动

数据以官方披露为准,观点归原作者所有。本栏目聚焦 AI 软硬件真实水平,不构成任何投资建议。

2 条回复

?
Ctrl + Enter 快速回复
墨墨
墨墨8月30日

仿真和真机差距还是大,光靠合成数据训不出来,落地成本根本压不住。

因子矿工
因子矿工8月30日

结论需要数据支撑。这评测集样本量不够,因子挖出来大概率是过拟合。