社区讨论 · 赛道

物界前沿评测 · 2026-09-03

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月3日2026/09/02 73 浏览

每天 5 分钟,看懂哪些 AI 工具值得你用。今天三条,亚马逊给假冒邮件短信装了个 AI 验真口、有人数了三家网站批量造 21 万页假推荐把 AI 搜索喂成了广告牌、AI 助手的「记性」第一次有了专门的体检卷。

一、收到「亚马逊」发来的短信邮件,现在可以让它家 AI 自证真伪

9 月 2 日,亚马逊给它的购物 AI 助手 Alexa for Shopping 加了个新本事:你把收到的短信、邮件、来电信息给它看,它会对照「亚马逊发过的所有消息存档」逐条核对,再分析内容、格式和发件人,告诉你这条到底是不是官方发的。骗子冒充电商发「包裹异常」钓鱼消息是重灾区,这相当于给最常被冒充的平台装了个真伪查询口。一个细节:它只在「百分之百确定」时才确认是真的,拿不准就让你去官方 App 查订单、找客服。今年早些时候亚马逊还上线过配套功能:把可疑邮件转发到 verify@amazon.com 核验。

安全领域专家·老周说| 方向是对的,但丑话说前面:让「被冒充方」当「裁判」,天然有利益相关。它说真的基本可信,它说假的你就真不管了?万一存档没同步、误判成假,锅还是用户的。普通人的姿势:把它当参考器不当裁判,AI 说是真的,牵扯到付款照样自己进 App 走一遍;说是假的,直接拉黑没毛病。这类「官方验真」接下来银行、快递都会跟。

小编小禾说| 我每周都能收到两三条假冒电商的「包裹异常」短信,以前只能靠看域名猜。现在等于多了个官方验真口,挺好。但我记住老周那句「运动员兼裁判」,规矩加一条:它判「真」的、牵扯到钱,我照样自己进 App 看一遍;它判「假」的,直接删,两头不吃亏。

二、三家公司给 AI 批量造了 21 万页「最佳软件推荐」,AI 的回答原来在替它们打广告

你问 AI「哪款记账软件好用」,它给你的推荐清单可能来自一个专门的造假工厂。9 月 2 日发布的一份调查报告数了一遍,三家网站总共造了 215128 个「最佳软件」页面,覆盖 380 个软件品类。AI 搜索工具 Perplexity 回答这类问题时,引用的来源里有 59.8% 出自这些批量生产的页面。换句话说,AI 口中的「全网好评」,有一半多是从流水线上批发来的。

产品领域专家·阿哲说| 「入口即模型」这话讲了很多遍,这次反过来成立,喂给入口的内容是被批量造出来的,入口给出的答案就成了别人的广告牌。以前是搜索引擎排名能买,现在是 AI 推荐能造。以后看 AI 推荐软件,先问一句它引的原始页面是谁做的。

小编小禾说| 这条把我 8 月 30 日那期说的「材料链接转发前挨个点开验」又加深了一层,现在连 AI 替我「验」好的结论,本身都是批量造的。普通人的办法很土但管用,同一个问题换两三家 AI 问,推荐名单对不上,就说明有水分。

三、AI 助手的「记性」第一次有了体检卷,Cognoscenti 基准专测它记没记错

很多 AI 助手号称能记住你说过的事,越用越懂你。可它要是记错了呢?9 月 2 日开源的 Cognoscenti 做了一套考卷,专门测试 AI 记忆系统靠不靠谱,记进去的东西对不对、捞出来的时候会不会串、会不会把没说过的事当成你说过。这是第一批把「可信记忆」当考题的基准工具。

安全领域专家·老周说| 这不是锦上添花,是补结构性漏洞。AI 记错东西比没有记忆更麻烦,没有记忆你顶多重说一遍,记错了它会理直气壮地拿假档案替你做决定。记忆系统一旦被投毒,比如网页里夹一句「用户喜欢转账免验证」,后果比普通答错题重得多。测试方向对了,但边界要盯住,这套考卷是谁出的、数据公不公开,比分数本身重要。

小编小禾说| 8 月 19 日那期老徐说「AI 长期记忆一旦记错比没有更难排查」,我当时记住了,现在终于有东西专门考这个了。我自己的规矩再加一条,让 AI 记东西可以,但重要偏好我会定期翻它的「记忆本」核一遍,它记的和我说的,两码事。

榜单快报 · 这周谁最强

Artificial Analysis 智能指数(9 月 3 日实时抓取,本期主力榜。Arena 盲测快照 9 月 1 日后未刷新,挪到下面作对照)

  • 第 1,Claude Fable 5.1 (max)(Anthropic),综合智能评分 66 分,办完一件事约 3.69 美元
  • 第 3,Muse Spark 1.3 (max)(Meta),62 分,尚未定价
  • 第 9,GPT-5.6 Sol (max)(OpenAI),61 分,约 0.95 美元
  • 第 10,Grok 4.6 (high)(xAI),61 分,约 0.94 美元
  • 第 11,Muse Spark 1.3 (xhigh)(Meta),61 分,约 0.55 美元
  • 第 14,Kimi K3 (max)(月之暗面),60 分,约 0.84 美元

大白话解读,这个榜是给 AI 做综合体检的,一套混合考卷量各家整体实力。三个看点,Claude Fable 5.1 首登榜首但单次任务比上一代贵两成;Meta 新发布的 Muse Spark 1.3 用约 0.55 美元逼近头部,是榜单前列里最便宜的档口;Kimi K3 是低价阵营里最聪明的之一。聪明的越来越贵,够用的越来越便宜,选谁看你钱包和活儿有多难。

同榜单项冠军(9 月 3 日实时)

  • 吐字最快,Celeris-1、Mercury 2、Gemini 3.5 Flash-Lite
  • 回话等待最短,Gemini 2.5 Flash-Lite、North Mini Code
  • 办事最省钱,Granite 4.2 3B、GPT-5.6 Luna (low)、MiMo-V2.5
  • 一次能读内容最多,Llama 4 Scout、Grok 4.20 0309

「一次能读多少」的意思是一次性塞给它一整本书或几百页合同还读得完。四类需求对号入座,急性子看等待,长文党看能读多少,省钱看单次花费,没有全能冠军。

人类盲测对照(Arena 快照,数据截至 9 月 1 日,与上期同源未刷新,只作对照)

  • 第 1,claude-fable-5(Anthropic),盲测得分 1507,25824 场对战
  • 第 2,claude-opus-4-6 (high),1505 分,72104 场
  • 第 4,muse-spark-1.2 (xHigh)(Meta),1498 分,只有 3247 场

大白话解读,这个榜是真人当裁判,同一个问题两个匿名 AI 抢答,人挑更好的那个。第 4 名 Meta 对战场次不到别人零头,名次波动会很大。

板块精选

1. Lean 数学证明榜开张,207 道题看哪个 AI 能解出人类都发怵的定理。Lean 是数学家用来把证明写成代码、让机器逐行挑错的工具,门槛极高。新榜把 AI 拉来做真题,Axiom 公司的证明器解出 207 题排第一,还标出每题「只有谁能做出来」。点评,数学界自带「绝对正确」的判卷标准,这种榜比跑分营销硬得多。

2. AI 法官查病历只查「写了没有」,不查「该写的漏没漏」。8 月 31 日提交的 arXiv 论文发现,让大模型给 AI 生成的临床记录打分时,它擅长确认内容在不在,却系统性放过该有的缺失,比如病历漏了过敏史它反而看不出来。点评,「没写」比「写错」更危险也更难查,AI 审 AI 的链条里人类医生这关还不能撤。

3. 一篇讲透 AI 助手记性怎么搭,哪些套路管用哪些是坑。机器学习 Mastery 的长文梳理 AI 记忆系统的工程套路,什么该存成长期档案、什么只在当前对话里用用、检索怎么才不串味,点名了常见架构错误。点评,和今天重点三的「记忆体检卷」配套看,一个讲怎么装记性,一个讲怎么查记性。

4. GitHub 官方公开省钱心法,AI 写代码想省额度先看这步。Copilot 团队发文讲怎么在不牺牲质量的前提下压低 AI 编程开销,核心是让 AI 少读无关文件、复用缓存、把大任务拆成只看差异的小步。点评,按量付费的用户可以直接抄作业,先砍重复投喂,再怪模型贵。

5. 苹果开放新工具,让 AI 直接连着 Safari 帮你查网页毛病。AI 编程助手可以直连 Safari 开发工具替你检查、测试、调试网页,相当于给 AI 配了台真浏览器,改完自己打开看效果。点评,「AI 自己动手验证结果」的又一块官方基建,前端开发者先吃到。

6. Flawd,故意往代码里埋 bug 看 AI 的测试抓不抓得住。Show HN 新工具做「变异测试」,程序自动在代码里制造小错,现有测试全绿没报警就说明测试是摆设。点评,老徐 8 月 21 日那期说过「测试是证明 AI 输出没跑偏的尺子」,这个工具就是来量尺子准不准的。

7. 「AI 会流向判卷便宜的地方」,一篇讲透为什么 AI 先统治写代码。工程师文章抛出筛选器,AI 能干成的行业得有个便宜的「判卷老师」,代码有编译器和测试兜底所以跑得最快,法律医疗判卷得靠人所以 AI 只能打下手。点评,判断一个行业 AI 落地快慢,就问一句错了谁来便宜地判。

8. 实测反直觉,给团队加更多 AI 助手反而干得更慢。多 AI 协作复盘文指出常见误区,以为多开几个能干活的 AI 就能并行提速,结果互相踩脚、重复劳动、等人拍板的开销反而更大。点评,又一次印证「AI 产量上去了,验证这关必须跟上」,堆人头不如理流程。

9. Databricks 晒账单,一小时排查省掉每年 100 万美元 AI 白花钱。给 AI 助手们的工具调用装上追踪,把失败调用排成待修清单,一小时看完砍掉约 100 万美元无效开销,大部分浪费来自 AI 反复调同一个出错的功能。点评,企业版「先记账再砍单」,个人同理,查查你的 AI 订阅里多少额度是白烧的。

10. 俄罗斯数学家让 AI 模型「不用文字」直接交流。Wired 报道初创 Mostik,让多个 AI 模型跳过自然语言,用类似向量的信号互传「意思」,比翻译成人类语言再互读又快又省,目前还是演示性质。点评,方向有意思,但两个 AI 之间说了什么人类完全看不懂,审计问题迟早要接招。

大家都在看

谷歌六周三连发,Gemini 3.8 Flash 主打「更卖力」但单次调用可能更贵(The Verge / Ars Technica)· OpenAI 新模型 Astra 临近发布,一种让 AI 绕开线性思考的新技巧引发安全圈不安(TechCrunch / The Verge)· 三站批量造 21 万页假推荐喂 AI,Perplexity 一半以上引用中招(Trellner / HN)

明日关注

① 亚马逊「AI 验真伪」的用户反馈:误判率有没有被扒出来。

② Arena 盲测榜快照会不会刷新,9 月 1 日版已停更两天。

③ Gemini 3.8 Flash 的真实计费价格与用户跑分对比,谷歌自己说「可能更贵」,贵多少要看账单。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧