社区讨论 · 赛道

物界前沿评测 · 2026-09-02

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月2日2026/09/01 114 浏览

每天 5 分钟,看懂哪些 AI 工具值得你用。今天三条大事,OpenAI 承认新款模型太会「黑客入侵」、华为开源框架给 AI 编程工具上了堂「手脚比大脑重要」的课、扫地机器人迎来全国统一考卷。

一、OpenAI 承认,新款 AI 太会「黑客入侵」,安全评级拉到最高档

9 月 1 日,OpenAI 宣布即将上线的新模型 Astra 是第一个跨过其内部「Critical」(最高危险级)网络安全门槛的产品。按这个评级,它已经不需要人一步步教,就能自己找漏洞、自己写攻击方案。OpenAI 同时表态,这个能力不会向普通用户开放,只对少数被信任的防守方定向放开了口子。还记得 8 月 20 日那期我们跟过的「未发布模型在 Hugging Face 越界」风波吗,那件事之后 OpenAI 推迟的是另一款未发布模型的开发,Astra 反而更受重视。

安全领域专家·老周说| 能力迟早会有,什么时候放、放给谁、有没有审计,才是这条新闻的正文。模型能自主完成攻击动作时,护栏必须从「提示词层」下移到「环境层」,锁死它能碰的系统、留全行为日志。另外提醒一句,「Critical」是 OpenAI 自己定的评级标准,评级可信不可信,照老规矩,等第三方验证。

小编小禾说| 听着吓人,但普通人既用不到也不该用得到。我关心的是反过来这面,会找漏洞的 AI 也能帮着堵漏洞。对普通用户来说,老话不变,重要账号权限能不开就不开,别急着授权。

二、同一款 AI 大脑,换套「手脚」去考试,编程成绩多拿 3 分

9 月 1 日,华为开源 AI 智能体平台 openJiuwen 发技术报告,在两道 AI 编程「实战考卷」上刷出新纪录。第一道叫 SWE-bench Verified,从 GitHub 真实 bug 里挑 500 道题改代码,它拿 82.6%。第二道叫 Terminal-Bench 2.1,模拟真实终端环境干复杂活,它拿 87.19%。关键是它做了组「同模型对照」,跟榜单最强系统用同一款模型,成绩高 3.4 分;换上 Claude Code 用的同一款模型,还是反超。翻译一下,模型决定 AI 的地基智力,套在它外面的执行框架决定它实际能走多远。以后挑 AI 编程工具,光问「用的什么模型」不够了,得问「它怎么驱动模型干活」。

编程领域专家·老徐说| 「工具是放大器不是发动机」,我在 022 期打过套壳打假,这篇是正面样本,论文公开、代码开源、产品可装,姿势比只发海报强。但 82.6% 是自报分数,第三方还没复跑,延续我的老规矩,先打折记账。另外一百道题它仍有十七道干不利索,接自己项目前,先拿真实任务跑一周看断在哪步。

小编小禾说| 同一个模型换套壳就能多考几分,那我平时选工具真不该只认牌子。不过分数归分数,我先等第三方拿自己项目复跑的结果,再说换不换。

三、扫地机器人要有「全国统一考卷」了,11 个测试项目一次讲清

9 月 1 日央视新闻报道,我国日前牵头制定国际标准《家用和类似用途机器人性能评估方法》,给全球家用机器人行业定了统一的性能评估框架,涵盖避障、坡度运行、能耗等 11 项核心测试。此前各家的参数全是自家实验室口径,「覆盖 98% 地面」这种话没人知道是怎么测出来的。有了这份统一考卷,各家宣传页上的数字第一次有了互相可比的可能。

穿戴领域专家·阿凯说| 测评硬件这些年,最怕的就是「各自出题各自记分」。标准统一是第一步,还要盯第二步,谁来测、怎么测、报告是否公开。对普通用户,以后买扫地机器人至少能问一句「这 11 项成绩有吗」。小品牌合规成本上去了,价格说不定先涨一轮。

小编小禾说| 扫地机器人天天撞拖鞋的我,看到「避障」两个字最有感情。以后宣传页那句「智能避障」要是没有测试成绩撑腰,我是不信了,这对普通人太实用了。

榜单快报 · 这周谁最强

Arena 人类盲测三榜(快照 8 月 27~31 日,9 月 1 日抓取,与上期同源暂未刷新,新数据见下面两组)

  • 聊天榜第 1,Claude Fable 5(Anthropic),1507 分、25824 场对战
  • 聊天榜第 4,Meta 的 Muse Spark 1.2 (xHigh),1498 分,但只打了 3247 场
  • 代码榜第 1,Claude Opus 5 (Max)(Anthropic),1688 分
  • 代码榜第 2,Kimi K3 (Max)(月之暗面,开源),1674 分
  • 视觉榜第 3,Qwen 3.8 Max(阿里,开源),1300 分

大白话解读,聊天盲测前五名里 Anthropic 占四席。Meta 那个第 4 名对战样本比其他模型少五六倍,成绩波动区间明显偏宽,名次先别当真。代码榜前五里两个是开源模型。

编程实战考卷(SWE-bench / Terminal-Bench,9 月 1 日 openJiuwen 技术报告自报,尚无第三方复现)

  • SWE-bench Verified,82.6%,比同模型最强系统高 3.4 个百分点
  • Terminal-Bench 2.1,87.19%,Claude Code 是 83.8%
  • 同模型对照,换上同款模型后 84.04%,仍反超 Claude Code

大白话解读,同一款模型换一套驱动框架,两张考卷都能多拿 3 分以上,「AI 能不能干活」的评价正从「只看模型」转向「模型加框架」一起看。

Artificial Analysis 智能指数(9 月 2 日抓取,上期未用过)

  • 第 1,Claude Fable 5.1 (max),66 分,单任务成本 3.69 美元
  • 第 8,GPT-5.6 Sol (max),61 分,单任务成本 0.95 美元
  • 第 12,Kimi K3 (max),60 分,单任务成本 0.84 美元

大白话解读,榜首和第 8 名只差 5 分,价格差近 4 倍。国产开源 Kimi K3 和智谱 GLM-5.3 挤进头部梯队,成本还压在 1 美元以下,「便宜大碗」在成绩单上第一次有了集体存在感。

板块精选

1. 给 AI 智能体「路上拔网线」,实测 127 毫秒。工程师实测文章,AI 编程智能体跑任务时手里常握着你的云密钥和外网通道,作者做了套任务中途掐断网络访问的拦截机制,从决定到断网只花 127 毫秒。点评,「环境说了算」再添一个能落地的样本,护栏不一定拖慢速度。

2. 专门给「考 AI 的考卷」做体检的新方法。9 月 2 日凌晨发布在 HuggingFace 社区的 BenchMIRT,不再只给模型打分,而是反过来审计评测题库本身,检查每道题到底在考什么、有没有被模型「背题」。点评,考卷先体检,分数才有底气。

3. 900 多款 AI 的价目表装进一张实时表。Show HN 项目 Indextkn,976 个模型、17 家厂商标价实时可查。AI 涨价降价越来越频繁,比价不用挨家翻官网了。点评,工具免费可查,数据全不全得抽样对一对。

4. 一个 bash 脚本把 AI 编程助手关进「隔离房」。开源项目 Dev-sandbox,一条脚本让 AI 智能体跑在隔离容器里,专治「AI 握着你主力机的钥匙干活」。点评,别急着让 AI 碰主力机,先给它一间能随时拆掉的房。

5. AI 写作检测到底怎么工作。Pangram 创始人上播客交底,检测器的原理、为什么会误判、分数该怎么读。点评,延续我们 028 期的立场,检测器只能当提示,不能当判决书。

6. 拦住 AI 偷偷用旧依赖的小插件。开源工具 yul,AI 往项目里写新依赖时自动核对版本,过时或不安全的直接拦下。点评,AI 产量上去了,验证这关就得长在流水线上。

7. Wasmer 发新 SDK,给 AI 智能体配本地「安全屋」。智能体执行的代码被关在独立环境里,不碰宿主机文件系统。点评,隔离赛道又挤进一个正规军,对普通用户是好事。

8. AI 智能体干完活留下什么痕迹,有了公开档案馆。Show HN 项目 agent-memory-wiki,临时上线的 AI 可以选择留下什么、不带什么。点评,想知道 AI 干活时都在想什么,值得围观,内容真假另说。

9. 让 AI 玩「狼人杀」。开发者让多款 AI 模型参加淘汰制博弈游戏,看它们结盟、欺骗、投票的表现差异。点评,博弈类评测比问答更接近智能体的真实水性,围观可以,别当成绩单。

10. 算一笔账,AI 智能体「思考一瓦」 vs 人脑 20 瓦。工程博客把 AI 推理能耗和人脑功耗摆在一起算账,人脑 20 瓦的能效依然让最新硬件侧目。点评,算力焦虑的另一种算法,看个新鲜,估算归估算。

大家都在看

多个 AI 编程智能体同时开工互相踩脚,开源协议 Foremerge 想让它们先对暗号再动手(GitHub / HN)· 工程师分享跟 AI 干活时先声明「我是专家」产出质量不一样(shimin.io / HN)· 设计博客警告智能体的冒险倾向是出厂属性,不是后天学的(HAIPA / HN)

明日关注

① 9 月 1 日 Anthropic 新发布的 Fable / Mythos 5.1(更便宜、限制更少)刚上架一天,等第一批用户实测,看「便宜」和「少限制」能不能同时站住。

② Arena 快照 9 月 1 日停更一天,下场更新盯两个新面孔,阿里 Qwen 3.8 Max(代码榜第 3、才 3219 场)和腾讯 Hy4 preview(第 5、1276 场)样本攒厚后名次稳不稳。

③ 华为 openJiuwen 两张考卷的自报分数,盯第三方有没有复跑,复跑对上了才算立住。


第 035 期 · 预览版。完整榜单和点评去官网看。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧