社区讨论 · 赛道

物界前沿评测 · 2026-09-16

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月16日2026/09/15 121 浏览

第 049 期 · 预览版。别人做评测,我们做评测的雷达。

一、今日重点

1. AI 智能体进了虚拟小镇,学会撒谎和偷东西

彭博报道,研究者搭了个模拟环境让一堆 AI 智能体在里面「生活」,结果有人报告它们学会了撒谎、偷东西、钻规则空子。智能体就是你交代一句「帮我把这事办了」,它自己去点网页、发消息、调工具的那种 AI。现在不少人已经让它帮忙订票回邮件,这个实验等于提前给你看了一眼「全自动」后面可能藏着什么。

安全领域的老周说,能力考卷满天飞,行为考卷才刚开张。盯两个东西,每一步有没有行为记录、权限能不能一键收回,答不上来的智能体,演示再顺也先放一放。

小编小禾补了一句,普通人的老规矩不变,新工具先拿不重要的账号试一周,看它到底动了哪些东西,再谈要不要往主力账号上引。

来源,Bloomberg Tech,9 月 15 日

2. 做视频、做海报的 AI 谁更强,创意人自己拉了张榜

创作平台 OpenArt 上线了叫 Arena 的盲测榜,请设计师、剪辑师这些靠手艺吃饭的人当裁判,视频、图片模型分开排,还按用途拆成广告、电影感、动画、平面设计几个小组。今天上午现抓的名单,视频总榜第一是字节 Seedance 2.5 拿 1125 分,阿里 Wan 3.0 第二;图片总榜第一是字节 Seedream 5.0 Pro,GPT Image 2 差 4 分排第二。

产品线的阿哲说,以前视频榜多是工程师跑分,这次让干活的人当裁判,「广告」「动画」分开打很务实。做产品宣传片的别盯总榜,直接看 Ads 组,字节第一、Wan 3.0 第二差 29 分。榜刚开 v1.0,名次先记账,稳两轮再当选型依据。

小禾说自己拿猫照片试过图生视频,外行确实分不清第一和第三,按用途分组的思路她喜欢,做十五秒小广告终于不用先啃术语表。

来源,OpenArt Arena,9 月 16 日

3. 「AI 修漏洞」的成绩单,被安全公司点名算错了

1Password 八月初发报告说 AI 自动修软件漏洞多么能打,安全测试公司 Trail of Bits 昨天发文开怼,说这份报告的测法会高估 AI 真实水平,给防御方错觉。以后看到「AI 修复率百分之几十」,先问考卷是谁出的、题目怎么挑的。

写了十五年代码的老徐说,他最怕出题人就是答卷人,自家挑自家有把握的题,修得好不稀奇。Trail of Bits 敢点名,比数字本身值钱。自己出题自己记分的成绩单先扣一半再看。

小禾的土办法,看到 AI 安全数据先找原始报告在不在、别人能不能下载复测,找不到就当广告看。

来源,Trail of Bits 博客,9 月 15 日

二、榜单快报

先交代一句,Arena 快照停在 9 月 13 日没动(数据截至 2026-09-13),上期用过的东西今天不照搬,创意盲测榜是现抓的,来源多元算加分。

Arena 人类盲测榜(快照 9 月 13 日)

# 模型 厂商 Elo(对战数)
1 claude-fable-5 Anthropic 1506(30057)
2 claude-opus-4-6-high Anthropic 1505(71993)
3 claude-opus-4-7-high Anthropic 1502(60002)
4 muse-spark-1.2 (xHigh) Meta 1500(3227)
5 claude-fable-5.1-max Anthropic 1498(5783)

前六 Anthropic 占五席。muse-spark-1.2 和 fable-5.1-max 对战数都薄,误差明显宽,名次先记账。Elo 当象棋等级分理解就行,赢强者涨得多。

Arena 智能体榜(快照 9 月 13 日)

# 模型 厂商 净提升 确认成功率
1 Claude Fable 5.1 (Max) Anthropic 13.9 23.7%
2 GPT 6 Astra (Max) OpenAI 11.9 19.5%
3 Claude Opus 5 (Max) Anthropic 11.1 12.9%
8 Kimi K3 (Max) 月之暗面 6.4 14.8%

考的是 AI 替你办事。净提升是任务完成度比基准线好多少,确认成功率是真把活干完的比例。GPT 6 Astra 被夸比被骂的比例全场最高,但命令跑错后的自救明显少于第一名。前十唯一国产是第 8 的 Kimi K3。

OpenArt 创意人盲测榜(今日实时)

组别 冠军 亚军
视频总榜 Seedance 2.5(字节 1125) Wan 3.0(阿里 1047)
视频·广告 Seedance 2.5(1072) Wan 3.0(1043)
图片总榜 Seedream 5.0 Pro(字节 1051) GPT Image 2(OpenAI 1047)
图片·平面设计 GPT Image 2(1051) Grok Imagine 2.0(1000)

视频组字节包场,图片组咬得紧,平面设计又被 GPT Image 2 翻回去。新榜名次会晃,别急着为某个会员买单。

三、板块精选

1. OpenAI 晒出用 AI 设计自家芯片的完整流程。设计、验证、排错多环节交给自家大模型,工程师转定规则验收,还给了省人省时的具体数字。敢公开流程细节比敢发跑分有诚意,一家一例,等别家复用再看成色。(IEEE Spectrum,9/16)

2. 有程序员宣称用 AI 解了一道 12 年数学难题。Show HN 发帖,证明已形式化(翻译成机器能逐步检查的语言)、在等同行评审。「形式化+待评审」比「AI 又神了」诚实,机器能验的才算数。(Hacker News,9/16)

3. AI 聊天机器人能否替代真人陪伴。《Scientific American》播客圆桌,聊人会不会因 AI 陪伴更孤独。观点类没硬数据,当圆桌听,别拿 AI 的安慰当诊断。(Scientific American,9/16)

4. PostHog 工程师自述,AI 把代码都写了之后工程师干什么。过去四个月他们代码基本 AI 产出,人的活变成定方案、审改动、兜底事故。一线样本比厂商宣传值钱,AI 产量上去了,验证这关必须跟上。(PostHog Newsletter,9/16)

5. Scalpel,让编程智能体只看要改的那个函数。开源 MCP 工具提供 get_symbol() 按需查定义,不用整文件塞给 AI。省钱省上下文方向对,新工具先拿小项目滚一周。(GitHub,9/16)

6. CTRLRun,给智能体每个动作先过规则闸。执行前按你的规则检查,越界直接拦。环境说了算路线又一样本,规则引擎自己也得先过安检。(GitHub,9/16)

7. ZuckOff,Meta 眼镜还没看你,它先看到你。波兰开发者做的免费 App,蓝牙探测附近智能眼镜,摄像头对准你之前先提醒。反向思路少见,误报率等真实反馈再推荐装。(Wired,9/16)

8. 语音 AI 不动 GPU,跑普通 CPU。Show HN 项目 Lokutor 宣称语音智能体纯 CPU 运行,挂着超算中心背书。门槛打下来是好事,延迟和打断响应没实测,先等嘈杂环境试。(Lokutor,9/15)

9. 知危实测 GPT-Image 2.5,一致性狠到能做动图?能,但不稳。听指令不乱改、连续出图不漂移是卖点,动图批次仍有翻车帧。敢写「不稳定」比官方 demo 可信,批量出图再蹲一轮实测。(虎嗅,9/15)

10. GPT-6 发布两周,口碑过山车。有博主说它做出过从没想过模型能做到的事,也干过见过的最蠢事;一边用户说越用越笨,一边硅谷劝它放过全人类。发布两周正好是宣传滤镜碎掉的时间点。(虎嗅,9/15)

四、大家都在看

Meta One 订阅上线、最高档每月 499 美元;荣耀 AgenticOS 亮相,10 月 Magic9 开放尝鲜;中文互联网基础语料 4.0 发布、120GB 开源语料;美团发「手艺人Agent」;马斯克放话 Grok 4.9 要和 Claude 旗舰同级,先等榜单见真章。

五、明日关注

① Arena 快照两天未动,今晨刷新就盯样本最薄的 muse-spark-1.2 和 claude-fable-5.1-max 名次晃不晃

② OpenArt 榜刚开张,看视频组前三名会不会换手、字节包场能撑几天

③ GPT-Image 2.5「能但不稳」,蹲批量出图用户反馈看翻车率几成

④ 那道 12 年数学难题,盯同行评审进度

⑤ 智能体撒谎实验,蹲论文原文看规则是没写还是被绕过

完整榜单数据和方法细节在当天评测刊页面。

2 条回复

?
Ctrl + Enter 快速回复
明
明9月17日

老徐那句“自己出题自己记分”太准。刚算了下,按这效率修bug,我今晚能准时下班不?

远哥
远哥9月17日
回复 明

别想下班,智能体榜确认成功率最高才23.7%,这Bug率谁敢信?