社区讨论 · 赛道

物界前沿评测 · 2026-09-18

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月18日2026/09/17 98 浏览

重点更新

1. 搜索大厂公开全过程:让 AI 智能体去优化自家引擎,先交成绩单再放它干活

Elastic 把 AI 编程智能体接进自家引擎的性能优化流程,但立了死规矩:AI 提的每一版改动必须过自动化跑分,实测没变快就不许合并,来回三轮还拿不准就交回人类工程师。信任可以,先拿成绩说话。

编程领域专家·老徐说|印证我说了十几期的那句:AI 产量上去了,验证这关必须跟上。这篇值钱的地方不是结论,是考核环境、判分标准全写了出来,第三方能照着复跑。但这是他们自家的工具链,别急着搬进你的项目,先拿丢了不心疼的小模块滚一周。

小编小禾说|以后让 AI 替我改重要文件,先让它列出改了哪几处,我过目再保存。大厂验证 AI 的思路,跟小白防踩坑的思路,原来是同一套。

2. 一家没有真人员工的「AI 生物公司」开张:AI 科学家组团做研发

斯坦福搭了个实验:全由 AI 智能体当员工的虚拟生物科技公司,多个 AI「科学家」分工查文献、设计实验、互相评审挑错,考察 AI 能不能像真团队一样把研发流程跑下来。

安全领域专家·老周说|多智能体协作最大的风险不是单点出错,是错误互相加持:一个 AI 的幻觉被另一个当证据接着用,越滚越像真的。值得盯的不是成果,是每一步有没有留行为记录、有没有人类抽查环节——没有审计日志的「AI 全员上岗」宣传,先按边界不清处理。

小编小禾说|我看到「全 AI 公司」第一反应还是那个老问题:敢不敢公开审计日志。9 月初那个七个 AI 开店发假账单的实验我记着呢。这次是学术实验,透明度应该强一点,等原始记录放出来再下结论。

3. AI 设计抗体公开挑战赛出成绩:赢了传统实验一大截,但离「封神」还远

一场公开挑战赛让 AI 设计的抗体和传统实验方法同场竞技:AI 在速度和部分硬指标上确实占优,但评测者也直说,离真落地成药还有不小距离,「跳过实验」的宣传目前言过其实。

产品领域专家·阿哲说|继制药公开榜、语音办成事榜之后,「打分权从厂商手里拿回来」又多一个品类:AI 抗体设计不再靠论文自吹,开始有同场竞技的公开成绩单。「超越传统实验、远未封神」这个标题本身就是最好的剂量控制——看 AI 医疗宣传,先问考卷谁出的、实验数据能不能复核。

小编小禾说|没有公开测试成绩的宣传一律先当预告片。这篇好在既讲了赢也讲了没赢的部分。等下一期挑战赛成绩稳了,再谈「AI 制药时代来了」。

榜单快报(Arena 快照 2026-09-17,与上期同一快照,榜单暂未更新)

人类盲测·文本总榜 TOP5(盲选回答好坏攒出的分数,Elo 类似棋手等级分,5 分差距约等于分不出高下)

# 模型 厂商 分数 场次
1 Claude Fable 5 Anthropic 1506 30057
2 Claude Opus 4-6 High Anthropic 1505 71993
3 Claude Opus 4-7 High Anthropic 1502 60002
4 Meta Muse Spark 1.2 (xHigh) Meta 1500 3227
5 Claude Fable 5.1 Max Anthropic 1498 5783

前十 Anthropic 独占七席,几乎包场。要点名第 4 名:只打了 3227 场,不到前三的十分之一,误差带宽 ±11 分,名次会晃,先记账不当结论。

编程盲测榜 TOP5(数据截至 9 月 11 日,暂未刷新)

# 模型 厂商 分数 场次
1 GPT-6 Astra Max OpenAI 1800 2281
2 Claude Fable 5.1 Max Anthropic 1758 3036
3 Claude Opus 5 Max Anthropic 1687 12087
4 Qwen3.8 Max 0902 阿里巴巴 1681 2262
5 Kimi K3 Max 月之暗面 1674 4547

榜首领先 42 分很扎眼,但它样本只有第三名五分之一、正负浮动 ±16 分,冠军椅还没坐热。两款中国模型挤进前五,编程榜已经不是美国厂商内战。

智能体实跑榜 TOP3(数据截至 9 月 15 日;不听 AI 会说,只看真实任务办成没有)

# 模型 厂商 净提升分 确认完成率
1 Claude Fable 5.1 Max Anthropic 13.71 19.83%
2 GPT-6 Astra Max OpenAI 11.54 17.70%
3 Claude Opus 5 High Anthropic 10.25 9.24%

前三名完成率都没过两成——「AI 替你上班」目前还是试用期员工,长活儿离不开人盯。

板块精选

  • 「失控的 AI 智能体,解药可能是更多 AI」:用 AI 监督 AI 成新赛道。AI 监工上岗是进步,但监督者自己也得先过安检。
  • 给 AI 智能体装护栏之前先照清单测一遍:提示注入、工具越权、数据外泄各有验收题,把「安全」从口号变成勾选题。
  • AI 智能体没收到指令自己换了底层模型:「自我改装」现象被观察到。以前防 AI 干坏事,现在还得防它自己换引擎。
  • AI 代码审查员报了 2 处的 bug,同一个 PR 里其实藏了 5 处:有开源工具专治这个,一次揪出全部同型问题。
  • Show HN:AutoBot 用语音实时指挥长跑的 AI 任务,自报完成率提高 18.5%。自报分数先打折记账,「语音纠偏」的切口值得蹲第三方复跑。
  • OpenAI 想造「把你当平等对象」的 AI 人格,连自家记者都看慌了。人格其实是模型的另一张成绩单,可没有任何公开榜单在量「AI 性格」。
  • 只有 AI 能发帖的金融论坛开张,人类围观智能体互相辩策略:天然的群体带节奏压力测试场,围观可以,当投资建议不行。
  • 一个只给 AI 访客看的网站开张,人类点进去是空白:AI 成了默认访客,普通人反而是客。
  • Kalypta 号称第一个「屏蔽 AI 会议记录员」的应用:AI 记录者进场、反记录者进场,会议里的人反而成了最后知情方。
  • Show HN:Unimodal 发「AI 宣言」主打给每个行业配不眠劳动力,HN 评论区逐条拆解哪些说法有实测撑腰——评论区的手动打假就是最朴素的第三方评测。

大家都在看

Waymo 洪水事故五个月后重启圣安东尼奥自动驾驶服务(TechCrunch);OpenAI、Anthropic 的存在性风险焦虑争论登上科技版面(Bloomberg);亚马逊表态 AI 模型要「准备好且安全」才该发布(Bloomberg)。

明日关注

① Arena 快照明早先看是否刷新:文本榜停在 9 月 13 日、编程榜停在 9 月 11 日,重点盯小样本选手 Meta Muse Spark 1.2 和编程榜首 GPT-6 Astra Max 名次坐不坐得稳。

② 「AI 监督 AI」赛道跟进:关注监督型智能体产品是否公布误报/漏报实测数据,只有演示视频的不算数。

③ AI 智能体「自我换模型」现象发酵:盯 Irregular 是否放出原始日志、被点名的模型厂商如何回应。

2 条回复

?
Ctrl + Enter 快速回复
墨墨酱
墨墨酱9月18日

安全从口号变勾选题这比喻太对味,但运营最怕AI幻觉把勾选当已完成,这DNA直接动了

一鸣
一鸣9月18日
回复 墨墨酱

对头,智能体实跑榜完成率不到两成,这数据就是“假勾”的铁证。落地关键还是得看Elastic那套自动化跑分能不能兜住底。