社区讨论 · 赛道

物界前沿评测 · 2026-09-07

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月7日2026/09/06 97 浏览

2026 年 9 月 7 日 · 星期一(第 040 期 · 预览版)

别人做评测,我们做评测的雷达。今天的三件大事,新 Siri 用了一个夏天被放回角落,华盛顿邮报指控 AI 音频又承认没证据,还有 GPT-6 Astra 空降编程榜头名。榜单部分说明一下,Arena 人类盲测的最新快照和上期相同、数据没更新,本期换成今天实时抓的 Artificial Analysis 智能指数当主榜,外加 Arena 编程榜这期首次入刊。

一、重点更新(双点评)

1. 被寄予厚望的新 Siri,编辑用了一个夏天又放回角落

苹果在 iOS 27 测试版里把 Siri 换上了大模型,它能索引你手机里的短信、照片和日程,翻出三年前的旧消息一句话搞定,答案质量也明显超过老版本。Wired 编辑 9 月 6 日发来回访,他七月初上手时认定这是「万能工具」,结果一个月后使用量慢慢回落,又回到手动刷 Instagram 和查店的旧习惯,还坦白手机上天天打开的是另一家聊天应用 Claude。分析师意见分裂,有人说 iPhone 用户反正信任苹果的默认软件、隐私换留存够用,也有测试者说自己反而用得更多了。

产品领域专家·阿哲说|「入口即模型」的经典反例,有入口不等于有使用。苹果的底牌是系统级入口免费、本地内容可搜,这些外部聊天应用拿不到。但这位编辑的回落暴露了真正的分水岭,语音助手如果没有把你绕不开的场景焊死在开口上,模型再强也只能当更聪明的搜索栏。8 月 7 日我说过语音助手品类从此和大模型绑定、回不去了,现在补一句,方向回不去,用户回得去。候补名单机制和隐私信任才是苹果真正的产品。

小编小禾说|我看懂了,就是 AI 变强了、人没改习惯。类似功能我在旧手机上试过去搜三年前的短信,它真搜到了,但我用了两次还是回去手动翻。以前 Siri 不聪明所以我不开口,现在聪明了但我想不到要问它。普通人的建议就一条,逼自己连用一周,用不起来不是你的错,是它还没长在你需求的路上。

来源 Wired(2026-09-06)

2. 报馆点名说「这段音频是 AI 合成的」,然后自己承认没有证据

9 月 7 日 Hacker News 热榜,《华盛顿邮报》指控知名主播 Piker 的一段音频是 AI 生成,却在文中承认拿不出证据。AI 声音检测的可靠性长期存疑,8 月 27 日我们报道过同一家报馆的文字检测器互动实验,读者自己正常写的文字照样被判「有 AI 味」。这次它从误判别人升级成了指控别人还自认无凭。对普通人的意义很直接,判断一段音频是不是 AI 合成,需要鉴定级别的证据链,检测工具只能当线索,不能当判决书。

安全领域专家·老周说|「边界不清」这个结构性问题的媒体版,从「检测器认为可能」到「确认是 AI 伪造」中间隔着整条取证链,报馆一步跨过去了。028 期我对文字检测器说过,它只能当提示、不能当判决书,换成语音标准只会更高,误报率披露、多工具交叉验证、原始录音溯源,一个都不能少。真正要警惕的不是这一次误指控,而是「权威媒体加无证据标签」成为公共定性惯例,那之后任何不利的真实语音都可以被说成合成,说谎成本归零。

小编小禾说|028 期我玩过这家报馆的文字检测器,学会「自己正常写也会被标 AI 味」。现在它升级成直接在版面上点名别人的声音是 AI 做的,自己又承认没证据。对普通人的教训,以后刷到热门语音,别跟着喊「AI 合成」,先问一句检测报告在哪。没有报告,就都当猜测看。

来源 Hacker News / X(2026-09-07)

3. 独立开发者用 AI 把游戏之夜改了个遍,先让智能体改老游戏

9 月 5 日发布、7 日凌晨登上 Hacker News 热榜的博主实录,这位开发者靠编程智能体写掉大部分代码,和认识二十年的朋友把每月游戏之夜改成了自改老游戏、自造本地对战小游戏的实验场。十年前的选择是别人做好什么你玩什么,现在一个离谱点子二十分钟就能改成能玩的版本。他说打磨成品仍然费血汗,AI 真正压低的是「试一个点子」的成本。

编程领域专家·老徐说|这个样本比厂商 demo 值钱,真实用户用编程智能体干的是自己判断得了对错的小活。两个工程细节值得抄作业。一是改现有游戏而不是从零起项目,代码边界清楚、输出可验证,正合我 028 期说的那条,考试环境再小也得是自己认得的考场。二是二十分钟验证一个点子,AI 的真实生产力在压缩试错成本,不在替代工程师。024 期我说产量上去了验证这关必须跟上,这篇文章里验证环节就是游戏之夜当场开一局,闭环短到家,普通团队学不了形、学得了这个思路。

小编小禾说|看完有点想组局。我不写代码,但听懂了一个逻辑,以前想玩个什么冷门玩法得等大厂出,现在有点子就能先试试。不过他原话也承认,把东西做精致还是得下血汗,AI 只是把「试一试」的门槛踩平了。所以别指望一夜做出能卖钱的游戏,先做出来给朋友玩。

来源 Hacker News / mmazzarolo.com(2026-09-06)

二、榜单快报

快报 1|Artificial Analysis 智能指数(今天实时抓取,数据截至 2026-09-07,本期替代 Arena 旧快照的主榜)

| # | 模型 | 厂商 | 智能指数 |

|---|---|---|---|

| 1 | Claude Fable 5.1 (max) | Anthropic | 66 |

| 2 | Claude Opus 5 (max) | Anthropic | 63 |

| 3 | Muse Spark 1.3 (max) | Meta | 62 |

| 4 | GPT-5.6 Sol (max) | OpenAI | 61 |

| 5 | Grok 4.6 (high) | xAI | 61 |

| 6 | Kimi K3 (max) | 月之暗面 | 60 |

| 7 | GLM-5.3 (max) | 智谱 | 60 |

这个指数像 AI 的高考总分,考数学、编程、阅读理解一揽子综合题,60 分以上已经是第一梯队。头部十三席全是 100 万 tokens 上下文,一次能塞进一整本书还多。今天 Arena 人类盲测榜快照和上期相同没更新,本期主榜换成这张 9 月 7 日实时抓的。注意两件事,Anthropic 一家占了前八里五席;9 月 3 日刚发布的 GPT-6 Astra 还没进这张榜,成绩单得再等几天。

快报 2|Arena 编程盲测 Elo 榜(快照 09-06、09-05 刷新,本期首次入刊)

| # | 模型 | 厂商 | Elo 分 |

|---|---|---|---|

| 1 | GPT-6 Astra (max) | OpenAI | 1797 |

| 2 | Claude Fable 5.1 (max) | Anthropic | 1762 |

| 3 | Claude Opus 5 (max) | Anthropic | 1688 |

| 4 | Qwen3.8-Max (0902) | 阿里巴巴 | 1686 |

| 5 | Kimi K3 (max) | 月之暗面 | 1674 |

Elo 就是下棋等级分,真人同一道题匿名分给两个模型写代码,投票谁写得好,赢了涨分输了掉分。9 月 3 日才发布的 GPT-6 Astra 四天空降榜首,甩开第二名 35 分,头名优势明显。老规矩,刚上榜的新名次样本还薄,先看它稳不稳得住,别急着为这一个分换掉手里的工具。阿里 Qwen3.8-Max 和 Kimi K3 守住第 4、5,国产模型在编程榜上仍是第二梯队排头。

快报 3|同一梯队,差价 5 倍(AA 榜单里的钱包与速度,2026-09-07)

| # | 模型 | 厂商 | 价格 |

|---|---|---|---|

| 1 | GLM-5.3 (max) | 智谱 | $0.68/任务 |

| 2 | Kimi K3 (max) | 月之暗面 | $0.84/任务 |

| 3 | Grok 4.6 (high) | xAI | $0.94/任务 |

| 4 | GPT-5.6 Sol (max) | OpenAI | $0.95/任务 |

| 5 | Claude Fable 5.1 (max) | Anthropic | $3.69/任务 |

「价格」是完成一道标准任务的平均花费。同样 60 到 66 分的头部梯队,最便宜和最贵差 5 倍还多,GLM-5.3 每任务 $0.68,Fable 5.1 要 $3.69,而后者输出还只有 66 tok/s(每秒吐出的字,越高回话越快)。速度这边,Muse Spark 1.3 (xhigh) 跑到 182 tok/s 是主流模型最快,全场最快被 Celeris-1、Mercury 2 这类专用加速模型拿走。结论很朴素,不追求最后 5 分智力时,中档价位的活干得一样多。

三、板块精选

1. 免注册在线 AI 修图站上线,托管热门模型「Nano Banana 2」

9 月 6 日登上 Show HN 的 PicEditor,不用注册,上传照片用一句话改图或文生图,最高支持 4K 输出。免费用户走普通队列速度较慢,付费才有高优先级队列和商用授权。注意它是第三方托管该模型,不是谷歌官方站点。

点评:免费等于慢队列加仅限个人使用,商用图片先把授权条款看清楚再用。(来源 PicEditor,2026-09-06)

2. AI 视频去除物体上了逐帧跟踪,点一下运动员、后续画面全程抹除

Show HN 项目 Object Remover,在视频里给球员、logo、路人画个框,绿色遮罩逐帧锁定目标,之后模型把它从每一帧里抹掉。移动目标跟踪是视频修补里最难的一环,静态擦除早已普及。

点评:擦移动物体和擦静止物体的效果差距大,先拿自己拍的视频对拍,别看演示页就付费。(来源 Object Remover,2026-09-06)

3. 给 AI 智能体上的「决策治理运行库」公开测试,接口冻结进 v0.70

PV-PP Runtime API 把「AI 下一步该执行哪个动作」的判断独立成一个运行库,496 个回归测试全过才冻结接口,并明确运行库负责选择动作、宿主应用掌握真实世界的最终决定权,选择本身不改世界状态。

点评:「AI 提方案、环境说了算」符合最小权限思路,但这是个人项目公开测试,没有第三方基准,先当方法论看。(来源 PV-PP,2026-09-07)

4. 资深工程师用六种情绪给 AI 写体检单,文末强调文字全部亲手写

博主 beza1e1 发布《How I feel about AI》,对 AI 逐条列了惊讶、恐惧、厌恶、悲伤、愤怒、开心六种情绪和各自理由,比如惊讶于「没有规划算法却能涌现规划」,愤怒于开放网络被爬虫冲垮。文末自注,每个字都是自己打的,只让 Mistral 做了审校。

点评:AI 参与程度主动公开标注,这种坦诚样本本身就是内容可信度的地基。(来源 beza1e1,2026-09-06)

5. Springer 新书章,AI 对齐的前提就有问题,因为人类价值观本身在漂移

刚出版的开放获取章节《迈向与生成式 AI 的共生社会》抛出证据,GPT-4 发布后几个月里,它爱用的短语「delve into」全球搜索热度明显上扬,说明生成式 AI 已经在改写人类的语言习惯。作者主张用双向动态适应替代单向 AI 对齐。

点评:拿 Google Trends 数据论证 AI 反塑人类语言,角度新;属于理论研究,还没有落到评测实践。(来源 Springer,2026-09-07)

6. 「高级 AI 建站提示词」售卖页登热榜,页面自封「官方」

MotionSites AI 推销所谓「官方高级」AI 建站提示词包,整页是「解锁你的 AI 设计超能力」式营销话术,页面看不到任何第三方面测数据和开发者信息。

点评:「官方」自称、无实测、无出处,买 AI 工具前先找第三方真实使用记录,没有就当广告。(来源 MotionSites,2026-09-07)

四、大家都在看

  • Claude Fable 5.1 (max) 66 分登顶 Artificial Analysis 智能指数,头部梯队上下文长度清一色 100 万 tokens(Artificial Analysis,09-07 实时)
  • GPT-6 Astra 于 9 月 3 日发布后四天空降 Arena 编程盲测榜首,Elo 1797、领先 35 分(Arena 快照 09-06)
  • 头部梯队单任务最便宜的是 GLM-5.3 的 $0.68,Kimi K3 以 $0.84 紧随其后,两家同分不同价(Artificial Analysis)
  • Muse Spark 1.3 (xhigh) 输出速度 182 tok/s,主流模型第一(Artificial Analysis)
  • Arena 智能体干活榜前十 Anthropic 占七席,Kimi K3 是前十里唯一的国产开源模型(快照 09-06)

五、明日关注

  • GPT-6 Astra 还没出现在 Artificial Analysis 智能指数上,等它进榜后和 Claude Fable 5.1 的分差见真章
  • Arena 智能体榜 9 月 5 日刚刷新,盯 Claude Fable 5.1 (Max) 的领先在新增投票后扩大还是收窄
  • iOS 27 正式版进入倒计时,Siri AI 是否按候补名单机制放量,是这轮语音入口之战的关键节点

1 条回复

?
Ctrl + Enter 快速回复
IoT刘
IoT刘9月7日

这场景用户真需要吗?安装门槛高不高,别为了智能而智能。