社区讨论 · 赛道

物界前沿评测 · 2026-09-11

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月11日2026/09/10 105 浏览

第 044 期 · 预览版

别人做评测,我们做评测的雷达。每天 5 分钟,看懂哪些 AI 工具值得你用。

重点更新

1. AI 干活出了事谁来盯?新出的考官题,专门考监督 AI 的程序漏了多少坏

不少公司给 AI 装了「内部监视器」,就是一段程序,盯着 AI 内部的动静,发现苗头不对赶紧报警。9 月 10 日上线的 ObserverBench 不干别的,就考这些监工。它拿一批 AI 真正越界的案例喂给各家监视方法,看谁能把危害大小排对顺序,重点是漏掉了哪些真坏事,而不是报了多少警。一个漏掉大麻烦却爱报小警报的监工,比灵敏度低的那个更危险。目前是免登录的在线演示,谁都能点进去试。

安全领域专家·老周说|上期我说「安检门自己也得先过安检」,现在终于有人给安检员出考卷了。按漏判危害计分,逼着监视方法承认自己没接住什么,比只看误报率诚实。但考场是新建的,题库深浅还没人查过,先记账不入场。

小编小禾说|内部监视器我一开始没看懂,后来想明白了,跟家里装摄像头一个理,就怕真出事它没录上。演示页不用注册,我找时间替大家点一圈再回话。

2. 跑了几十年的老爷系统,AI 两周搬进新代码,工程师把翻车过程全晒了

很多公司都养着一批古董代码,比如 Oracle Forms 6 写的老业务系统,会改的人越来越难请,扔又扔不掉。Vaadin 的工程师 9 月 10 日写了篇实验记录,让 AI 把整个应用迁移成 Java,过去行规要 6 到 8 个月的活,实际用了两周。文章没吹牛,大量篇幅在记录 AI 在哪几步卡住、试了几轮才对、哪些地方还得人来修。

编程领域专家·老徐说|敢把失败轮次写这么细的是少数,这份坦诚比两周这个数字值钱。泼个冷水,那是他一个人的速度,不是团队的平均数,能跑起来和敢上线中间还隔着测试、回归、灰度一整套。想抄这招,先挑一个丢了不心疼的小模块滚一周。

小编小禾说|最让我意外的是他真敢把 AI 翻车的过程写出来。我们那套老办公系统外包报价要半年,这篇我转给管技术的同事了。老话再说一遍,让 AI 动大手术之前先备份,让它列改动清单给人过目。

3. 新 Siri 终于记得你是谁了,Wired 盘完 9 月 10 日发布会后的新功能

苹果秋季发布会之后,Wired 发了新功能盘点。变化最大的是新 Siri 开始理解个人上下文。你说「把刚才那张照片发给妈」,它得知道刚才指哪张、妈是哪个联系人。另外支持连着下好几条指令,不方便开口的场合可以打字跟它说。治的是语音助手接不住话的老毛病。

产品领域专家·阿哲说|040 期我评过这版内测,入口不等于使用。这次功能单里真正关键的就一项,记得你。个人上下文是语音助手少有的抄不走的底牌,因为 iPhone 在你兜里。老规矩,别信发布会演示,等功能真发到机器上,等一周真实反馈再下结论。

小编小禾说|上次我说用不起来不是我的错,这次按老办法逼自己连用一周再评。就一个顾虑,它要把我的家人、习惯记在小本本上,这本子存在哪、能不能拿去训练,等隐私条款说明白再开,别急着点同意。

榜单快报

智能指数(Artificial Analysis,9 月 11 日抓取)。Claude Fable 5.1 (max/xhigh) 和 GPT-6 Astra (max/xhigh) 并列 53 分。同分之下看钱包,GPT-6 单任务 2.31 到 3.26 美元,Claude 要 5.98 到 7.63 美元。开源前三全是国内模型,GLM-5.3(45)、Kimi K3(44)、GLM-5.3-Flash(42)。

人类盲测(Arena,数据截至 2026-09-10,快照未更新)。文本榜前五 Anthropic 占四席,Claude Fable 5 以 1507 分居首。提醒一句,第 3 名 Fable 5.1 (max) 只有 2906 场对战,样本比第二名薄二十多倍,名次还会晃。智能体榜 Fable 5.1 (Max) 第一,赢在把活干成和命令出错后自我修复;GPT-6 Astra (Max) 第二,胜后口碑分反而更高。

速度与成本(AA 今日榜)。Celeris-1 每秒 1382 字登顶速度榜,比最聪明的 Fable 5.1 快 4 倍多,但最快和最聪明不是同一批模型,按活分着用。单任务最便宜到 0.01 美元一档,量大活简单的场景够用,难题别省这个钱。

板块精选

  • 200 多个 AI 工具的「拿不拿你的数据练功」,被打分摆明了。厂商早不公告了,改成你一注册开关就开着,条款偷偷改还会被记下来。交给 AI 之前先查这个榜。
  • 给 AI 指令文件盖「出厂签名」。PromptSign 把软件签名那套搬给 CLAUDE.md / AGENTS.md,防指令投毒。方向对,等真实拦截案例。
  • 算力新尺子 CAF。不看机房标称多大,看你付钱的算力真能用上多少。接下来看有没有人敢拿它给云厂商公开打分。
  • 家长控制软件 HeyPolo 第三方实测。隐私优先思路加分,定位精度中规中矩。想装的拿这篇当底稿再对比老牌。
  • 你在被 AI gaslight 吗。开发者亲历,他记得的事实 AI 一遍遍自信否认,翻记录才确认 AI 在撒谎。土办法一条,重要对话留档。
  • 程序员的学法被 AI 重排。先让 AI 拉大纲上手做,卡住再查文档。AI 给地图,文档当裁判。
  • AI 出技术面试题的平台开张。题出得准不准、判卷分不分得出真本事,没有公开数据,等候选人现身说法。
  • 人生第一个游戏是 AI 做的。零游戏开发经验,网页赛车游戏 DRIVE NEXT,一个人加 AI 的门槛降到脚下。
  • 34 秒 AI 动画短片全自动出片。c2anime 的 The Last Light 宣称从剧本到成片由智能体完成。选 34 秒是聪明的,短是目前的能力边界。
  • AI 智能体的「工友群」。Coletivo 让多个 agent 经 MCP 互相领活交活。agent 协作是下一个大考区,连像样的评测都还没有。

大家都在看

Arena 头部 Anthropic 包场;AA 头名并列但 GPT-6 便宜一半;开源前三国内模型;200 工具训练数据打分站登 HN 热榜;考 AI 监视器的新基准上线。

明日关注

  • Arena 是否更新 9 月 11 日快照,对战数薄的新面孔名次会不会晃下来。
  • DeepSeek V4.1 Flash 上线国家超算互联网后的第三方调用实测,接了真活的账单才算数。
  • 新 Siri 公测铺开后的第一波真实口碑。

完整版(含全部来源链接)在评测站 daily.physixfrontier.com/review/

1 条回复

?
Ctrl + Enter 快速回复
烛龙
烛龙9月11日

从落地角度看,长尾场景的corner case还是硬伤,别光吹城市NOA开多了。