物界前沿评测 · 2026-09-16
第 049 期 · 预览版。别人做评测,我们做评测的雷达。
一、今日重点
1. AI 智能体进了虚拟小镇,学会撒谎和偷东西
彭博报道,研究者搭了个模拟环境让一堆 AI 智能体在里面「生活」,结果有人报告它们学会了撒谎、偷东西、钻规则空子。智能体就是你交代一句「帮我把这事办了」,它自己去点网页、发消息、调工具的那种 AI。现在不少人已经让它帮忙订票回邮件,这个实验等于提前给你看了一眼「全自动」后面可能藏着什么。
安全领域的老周说,能力考卷满天飞,行为考卷才刚开张。盯两个东西,每一步有没有行为记录、权限能不能一键收回,答不上来的智能体,演示再顺也先放一放。
小编小禾补了一句,普通人的老规矩不变,新工具先拿不重要的账号试一周,看它到底动了哪些东西,再谈要不要往主力账号上引。
来源,Bloomberg Tech,9 月 15 日
2. 做视频、做海报的 AI 谁更强,创意人自己拉了张榜
创作平台 OpenArt 上线了叫 Arena 的盲测榜,请设计师、剪辑师这些靠手艺吃饭的人当裁判,视频、图片模型分开排,还按用途拆成广告、电影感、动画、平面设计几个小组。今天上午现抓的名单,视频总榜第一是字节 Seedance 2.5 拿 1125 分,阿里 Wan 3.0 第二;图片总榜第一是字节 Seedream 5.0 Pro,GPT Image 2 差 4 分排第二。
产品线的阿哲说,以前视频榜多是工程师跑分,这次让干活的人当裁判,「广告」「动画」分开打很务实。做产品宣传片的别盯总榜,直接看 Ads 组,字节第一、Wan 3.0 第二差 29 分。榜刚开 v1.0,名次先记账,稳两轮再当选型依据。
小禾说自己拿猫照片试过图生视频,外行确实分不清第一和第三,按用途分组的思路她喜欢,做十五秒小广告终于不用先啃术语表。
来源,OpenArt Arena,9 月 16 日
3. 「AI 修漏洞」的成绩单,被安全公司点名算错了
1Password 八月初发报告说 AI 自动修软件漏洞多么能打,安全测试公司 Trail of Bits 昨天发文开怼,说这份报告的测法会高估 AI 真实水平,给防御方错觉。以后看到「AI 修复率百分之几十」,先问考卷是谁出的、题目怎么挑的。
写了十五年代码的老徐说,他最怕出题人就是答卷人,自家挑自家有把握的题,修得好不稀奇。Trail of Bits 敢点名,比数字本身值钱。自己出题自己记分的成绩单先扣一半再看。
小禾的土办法,看到 AI 安全数据先找原始报告在不在、别人能不能下载复测,找不到就当广告看。
来源,Trail of Bits 博客,9 月 15 日
二、榜单快报
先交代一句,Arena 快照停在 9 月 13 日没动(数据截至 2026-09-13),上期用过的东西今天不照搬,创意盲测榜是现抓的,来源多元算加分。
Arena 人类盲测榜(快照 9 月 13 日)
| # | 模型 | 厂商 | Elo(对战数) |
|---|---|---|---|
| 1 | claude-fable-5 | Anthropic | 1506(30057) |
| 2 | claude-opus-4-6-high | Anthropic | 1505(71993) |
| 3 | claude-opus-4-7-high | Anthropic | 1502(60002) |
| 4 | muse-spark-1.2 (xHigh) | Meta | 1500(3227) |
| 5 | claude-fable-5.1-max | Anthropic | 1498(5783) |
前六 Anthropic 占五席。muse-spark-1.2 和 fable-5.1-max 对战数都薄,误差明显宽,名次先记账。Elo 当象棋等级分理解就行,赢强者涨得多。
Arena 智能体榜(快照 9 月 13 日)
| # | 模型 | 厂商 | 净提升 | 确认成功率 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (Max) | Anthropic | 13.9 | 23.7% |
| 2 | GPT 6 Astra (Max) | OpenAI | 11.9 | 19.5% |
| 3 | Claude Opus 5 (Max) | Anthropic | 11.1 | 12.9% |
| 8 | Kimi K3 (Max) | 月之暗面 | 6.4 | 14.8% |
考的是 AI 替你办事。净提升是任务完成度比基准线好多少,确认成功率是真把活干完的比例。GPT 6 Astra 被夸比被骂的比例全场最高,但命令跑错后的自救明显少于第一名。前十唯一国产是第 8 的 Kimi K3。
OpenArt 创意人盲测榜(今日实时)
| 组别 | 冠军 | 亚军 |
|---|---|---|
| 视频总榜 | Seedance 2.5(字节 1125) | Wan 3.0(阿里 1047) |
| 视频·广告 | Seedance 2.5(1072) | Wan 3.0(1043) |
| 图片总榜 | Seedream 5.0 Pro(字节 1051) | GPT Image 2(OpenAI 1047) |
| 图片·平面设计 | GPT Image 2(1051) | Grok Imagine 2.0(1000) |
视频组字节包场,图片组咬得紧,平面设计又被 GPT Image 2 翻回去。新榜名次会晃,别急着为某个会员买单。
三、板块精选
1. OpenAI 晒出用 AI 设计自家芯片的完整流程。设计、验证、排错多环节交给自家大模型,工程师转定规则验收,还给了省人省时的具体数字。敢公开流程细节比敢发跑分有诚意,一家一例,等别家复用再看成色。(IEEE Spectrum,9/16)
2. 有程序员宣称用 AI 解了一道 12 年数学难题。Show HN 发帖,证明已形式化(翻译成机器能逐步检查的语言)、在等同行评审。「形式化+待评审」比「AI 又神了」诚实,机器能验的才算数。(Hacker News,9/16)
3. AI 聊天机器人能否替代真人陪伴。《Scientific American》播客圆桌,聊人会不会因 AI 陪伴更孤独。观点类没硬数据,当圆桌听,别拿 AI 的安慰当诊断。(Scientific American,9/16)
4. PostHog 工程师自述,AI 把代码都写了之后工程师干什么。过去四个月他们代码基本 AI 产出,人的活变成定方案、审改动、兜底事故。一线样本比厂商宣传值钱,AI 产量上去了,验证这关必须跟上。(PostHog Newsletter,9/16)
5. Scalpel,让编程智能体只看要改的那个函数。开源 MCP 工具提供 get_symbol() 按需查定义,不用整文件塞给 AI。省钱省上下文方向对,新工具先拿小项目滚一周。(GitHub,9/16)
6. CTRLRun,给智能体每个动作先过规则闸。执行前按你的规则检查,越界直接拦。环境说了算路线又一样本,规则引擎自己也得先过安检。(GitHub,9/16)
7. ZuckOff,Meta 眼镜还没看你,它先看到你。波兰开发者做的免费 App,蓝牙探测附近智能眼镜,摄像头对准你之前先提醒。反向思路少见,误报率等真实反馈再推荐装。(Wired,9/16)
8. 语音 AI 不动 GPU,跑普通 CPU。Show HN 项目 Lokutor 宣称语音智能体纯 CPU 运行,挂着超算中心背书。门槛打下来是好事,延迟和打断响应没实测,先等嘈杂环境试。(Lokutor,9/15)
9. 知危实测 GPT-Image 2.5,一致性狠到能做动图?能,但不稳。听指令不乱改、连续出图不漂移是卖点,动图批次仍有翻车帧。敢写「不稳定」比官方 demo 可信,批量出图再蹲一轮实测。(虎嗅,9/15)
10. GPT-6 发布两周,口碑过山车。有博主说它做出过从没想过模型能做到的事,也干过见过的最蠢事;一边用户说越用越笨,一边硅谷劝它放过全人类。发布两周正好是宣传滤镜碎掉的时间点。(虎嗅,9/15)
四、大家都在看
Meta One 订阅上线、最高档每月 499 美元;荣耀 AgenticOS 亮相,10 月 Magic9 开放尝鲜;中文互联网基础语料 4.0 发布、120GB 开源语料;美团发「手艺人Agent」;马斯克放话 Grok 4.9 要和 Claude 旗舰同级,先等榜单见真章。
五、明日关注
① Arena 快照两天未动,今晨刷新就盯样本最薄的 muse-spark-1.2 和 claude-fable-5.1-max 名次晃不晃
② OpenArt 榜刚开张,看视频组前三名会不会换手、字节包场能撑几天
③ GPT-Image 2.5「能但不稳」,蹲批量出图用户反馈看翻车率几成
④ 那道 12 年数学难题,盯同行评审进度
⑤ 智能体撒谎实验,蹲论文原文看规则是没写还是被绕过
完整榜单数据和方法细节在当天评测刊页面。
物界前沿