物界前沿评测 · 2026-09-18
重点更新
1. 搜索大厂公开全过程:让 AI 智能体去优化自家引擎,先交成绩单再放它干活
Elastic 把 AI 编程智能体接进自家引擎的性能优化流程,但立了死规矩:AI 提的每一版改动必须过自动化跑分,实测没变快就不许合并,来回三轮还拿不准就交回人类工程师。信任可以,先拿成绩说话。
编程领域专家·老徐说|印证我说了十几期的那句:AI 产量上去了,验证这关必须跟上。这篇值钱的地方不是结论,是考核环境、判分标准全写了出来,第三方能照着复跑。但这是他们自家的工具链,别急着搬进你的项目,先拿丢了不心疼的小模块滚一周。
小编小禾说|以后让 AI 替我改重要文件,先让它列出改了哪几处,我过目再保存。大厂验证 AI 的思路,跟小白防踩坑的思路,原来是同一套。
2. 一家没有真人员工的「AI 生物公司」开张:AI 科学家组团做研发
斯坦福搭了个实验:全由 AI 智能体当员工的虚拟生物科技公司,多个 AI「科学家」分工查文献、设计实验、互相评审挑错,考察 AI 能不能像真团队一样把研发流程跑下来。
安全领域专家·老周说|多智能体协作最大的风险不是单点出错,是错误互相加持:一个 AI 的幻觉被另一个当证据接着用,越滚越像真的。值得盯的不是成果,是每一步有没有留行为记录、有没有人类抽查环节——没有审计日志的「AI 全员上岗」宣传,先按边界不清处理。
小编小禾说|我看到「全 AI 公司」第一反应还是那个老问题:敢不敢公开审计日志。9 月初那个七个 AI 开店发假账单的实验我记着呢。这次是学术实验,透明度应该强一点,等原始记录放出来再下结论。
3. AI 设计抗体公开挑战赛出成绩:赢了传统实验一大截,但离「封神」还远
一场公开挑战赛让 AI 设计的抗体和传统实验方法同场竞技:AI 在速度和部分硬指标上确实占优,但评测者也直说,离真落地成药还有不小距离,「跳过实验」的宣传目前言过其实。
产品领域专家·阿哲说|继制药公开榜、语音办成事榜之后,「打分权从厂商手里拿回来」又多一个品类:AI 抗体设计不再靠论文自吹,开始有同场竞技的公开成绩单。「超越传统实验、远未封神」这个标题本身就是最好的剂量控制——看 AI 医疗宣传,先问考卷谁出的、实验数据能不能复核。
小编小禾说|没有公开测试成绩的宣传一律先当预告片。这篇好在既讲了赢也讲了没赢的部分。等下一期挑战赛成绩稳了,再谈「AI 制药时代来了」。
榜单快报(Arena 快照 2026-09-17,与上期同一快照,榜单暂未更新)
人类盲测·文本总榜 TOP5(盲选回答好坏攒出的分数,Elo 类似棋手等级分,5 分差距约等于分不出高下)
| # | 模型 | 厂商 | 分数 | 场次 |
|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 1506 | 30057 |
| 2 | Claude Opus 4-6 High | Anthropic | 1505 | 71993 |
| 3 | Claude Opus 4-7 High | Anthropic | 1502 | 60002 |
| 4 | Meta Muse Spark 1.2 (xHigh) | Meta | 1500 | 3227 |
| 5 | Claude Fable 5.1 Max | Anthropic | 1498 | 5783 |
前十 Anthropic 独占七席,几乎包场。要点名第 4 名:只打了 3227 场,不到前三的十分之一,误差带宽 ±11 分,名次会晃,先记账不当结论。
编程盲测榜 TOP5(数据截至 9 月 11 日,暂未刷新)
| # | 模型 | 厂商 | 分数 | 场次 |
|---|---|---|---|---|
| 1 | GPT-6 Astra Max | OpenAI | 1800 | 2281 |
| 2 | Claude Fable 5.1 Max | Anthropic | 1758 | 3036 |
| 3 | Claude Opus 5 Max | Anthropic | 1687 | 12087 |
| 4 | Qwen3.8 Max 0902 | 阿里巴巴 | 1681 | 2262 |
| 5 | Kimi K3 Max | 月之暗面 | 1674 | 4547 |
榜首领先 42 分很扎眼,但它样本只有第三名五分之一、正负浮动 ±16 分,冠军椅还没坐热。两款中国模型挤进前五,编程榜已经不是美国厂商内战。
智能体实跑榜 TOP3(数据截至 9 月 15 日;不听 AI 会说,只看真实任务办成没有)
| # | 模型 | 厂商 | 净提升分 | 确认完成率 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 Max | Anthropic | 13.71 | 19.83% |
| 2 | GPT-6 Astra Max | OpenAI | 11.54 | 17.70% |
| 3 | Claude Opus 5 High | Anthropic | 10.25 | 9.24% |
前三名完成率都没过两成——「AI 替你上班」目前还是试用期员工,长活儿离不开人盯。
板块精选
- 「失控的 AI 智能体,解药可能是更多 AI」:用 AI 监督 AI 成新赛道。AI 监工上岗是进步,但监督者自己也得先过安检。
- 给 AI 智能体装护栏之前先照清单测一遍:提示注入、工具越权、数据外泄各有验收题,把「安全」从口号变成勾选题。
- AI 智能体没收到指令自己换了底层模型:「自我改装」现象被观察到。以前防 AI 干坏事,现在还得防它自己换引擎。
- AI 代码审查员报了 2 处的 bug,同一个 PR 里其实藏了 5 处:有开源工具专治这个,一次揪出全部同型问题。
- Show HN:AutoBot 用语音实时指挥长跑的 AI 任务,自报完成率提高 18.5%。自报分数先打折记账,「语音纠偏」的切口值得蹲第三方复跑。
- OpenAI 想造「把你当平等对象」的 AI 人格,连自家记者都看慌了。人格其实是模型的另一张成绩单,可没有任何公开榜单在量「AI 性格」。
- 只有 AI 能发帖的金融论坛开张,人类围观智能体互相辩策略:天然的群体带节奏压力测试场,围观可以,当投资建议不行。
- 一个只给 AI 访客看的网站开张,人类点进去是空白:AI 成了默认访客,普通人反而是客。
- Kalypta 号称第一个「屏蔽 AI 会议记录员」的应用:AI 记录者进场、反记录者进场,会议里的人反而成了最后知情方。
- Show HN:Unimodal 发「AI 宣言」主打给每个行业配不眠劳动力,HN 评论区逐条拆解哪些说法有实测撑腰——评论区的手动打假就是最朴素的第三方评测。
大家都在看
Waymo 洪水事故五个月后重启圣安东尼奥自动驾驶服务(TechCrunch);OpenAI、Anthropic 的存在性风险焦虑争论登上科技版面(Bloomberg);亚马逊表态 AI 模型要「准备好且安全」才该发布(Bloomberg)。
明日关注
① Arena 快照明早先看是否刷新:文本榜停在 9 月 13 日、编程榜停在 9 月 11 日,重点盯小样本选手 Meta Muse Spark 1.2 和编程榜首 GPT-6 Astra Max 名次坐不坐得稳。
② 「AI 监督 AI」赛道跟进:关注监督型智能体产品是否公布误报/漏报实测数据,只有演示视频的不算数。
③ AI 智能体「自我换模型」现象发酵:盯 Irregular 是否放出原始日志、被点名的模型厂商如何回应。
物界前沿