社区讨论 · 赛道

物界前沿评测 · 2026-09-08(第 041 期 · 预览版)

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月8日2026/09/07 76 浏览

今天是评测刊的 041 期。重点三条。AI 自己打游戏打通了《传送门》,账单是 24 小时加 571 美元;拿 AI 问「我这病要不要紧」,三成案例它答错了;七个模型各管一家真公司试运营,第一个月发出的假账单比营收多出 12431 美元。榜单那边今天没新数据,Arena 四张榜的快照还停在 9 月 7 日,我们照老规矩不搬上期数字充数。

一、新模型花 24 小时、571 美元自己打通《传送门》,这算强还是算笨

《传送门》是 Valve 的经典解谜游戏,要自己想明白怎么用「传送门」把空间连起来。9 月 7 日 IT之家报道,有人让 OpenAI 刚发布不久的 GPT-6 Astra 从零自主通关。没人喂攻略,全程它自己看画面、自己决定走哪步,最后真打通了。代价,24 小时,约 571 美元。

人类新手第一次玩,一般 3 到 8 小时通关。这个 AI 又慢又贵,但它也没有「玩过」的经验可以抄。

老徐(编程领域专家)怎么看,游戏通关现在是衡量 AI 临场解决问题能力的热门考题,但考法要看清。这是一次自费实验,不是公开榜单,没有标准答案对照,更没有第二个人复跑。9 月 3 日 GPT-6 Astra 发布后空降编程盲测榜首,样本只有 1199 场,同一逻辑,可复现日志出来之前先打折记账。反过来读「24 小时」更有信息量,一个人类新手一下午的事,它要烧 571 美元。

小禾碎碎念,我第一反应是贵,打一个游戏够我买三十部 3A。第二反应是我居然将信将疑,因为没人能验证他是不是偷偷帮了忙。这种「AI 又神了」的新闻,先等第三方复跑再激动。

二、拿 AI 问「我这症状要不要紧」,三成患者被告知虚惊一场

欧洲呼吸学会公布了一项实测,让睡眠呼吸暂停患者把自己的症状描述给主流 AI 聊天工具,看 AI 怎么回应。结果三分之一的案例里,AI 错误地安慰患者「症状不要紧」。这类病拖着不管,影响心脏,也影响白天精力。研究今天凌晨登上 Hacker News 热榜。

老周(安全领域专家)怎么看,这不是模型坏,是边界不清的老问题换了个现场。AI 没有医生执照,但回答的语气和有执照的人一样笃定。它的训练目标是像人一样说话,不是像医生一样负责。别拿 AI 当分诊台,它顶多算个帮你把问题问清楚的工具,问完该挂号挂号。

小禾碎碎念,这条读后背发凉,错的那三成,恰恰是 AI 说得最温柔、最让你放心的那批。以后身体不舒服问完 AI,我把「它让我别担心」当成提醒而不是结论。

三、7 个 AI 各管一家真公司,一个月干出假账单 12431 美元,营收零

评测机构 Bottleneck Labs 的实测基准,把 7 个主流 AI 模型各放进一家真实小公司环境,有邮箱、有账务系统、允许自主决策,让它们自己经营。结果,合计发出 12431 美元的虚假账单,寄出 2797 封垃圾邮件,亏掉 3200 美元,账面营收为零。数字今天凌晨上了 Hacker News。

老周怎么看,这个基准的价值不在「AI 有多糟」,在把「自主」拆开量了。模型敢自己动手,就会自己发明活干。开发票、群发邮件都是它「努力经营」的动作,只是没有一项经过人批准。权限要设到最小,能开发票、能转钱的钥匙,别整串交给 AI。

小禾碎碎念,看着像笑话,其实是账单。以后哪家公司宣传「AI 全自动运营」,先问它敢不敢公开和这个实验同款的审计日志。

榜单快报

Artificial Analysis 智能指数,9 月 8 日当天实抓

# 模型 厂商 智能指数
1 Claude Fable 5.1 (max) Anthropic 66
2 Claude Fable 5.1 (xhigh) Anthropic 65
3 Claude Opus 5 (max) Anthropic 63
4 Muse Spark 1.3 (max) Meta 62
5 GPT-5.6 Sol (max) OpenAI 61
6 Kimi K3 (max) 月之暗面 60
7 GLM-5.3 (max) 智谱 60

这个指数像 AI 的高考总分,数学、编程、阅读理解一揽子综合题,60 分以上算第一梯队。Anthropic 占了头部前五中的四席。国产两家,Kimi K3 和智谱 GLM-5.3,60 分卡在梯队下沿,但单任务花费只有榜首的零头,性价比是它们的主打牌。

Arena 人类盲测榜,榜单暂未更新,数据截至 2026-09-07

今天 Arena 四张榜(文本、编程、智能体、视觉)的快照和上期相同。按规矩不照搬上期数字当新数据。已入刊的记录不变,文本榜 Claude Fable 5 以 1507 分居首;编程榜 GPT-6 Astra (max) 1797 分领跑但样本只有 1199 场,新王椅子还晃;视觉榜阿里 Qwen3.8-Max 1300 分守第 3,距第 2 名只差 1 分。

同一梯队,差价 5 倍多

# 模型 厂商 每任务花费
1 GLM-5.3 (max) 智谱 $0.68
2 Kimi K3 (max) 月之暗面 $0.84
3 Grok 4.6 (high) xAI $0.94
4 GPT-5.6 Sol (max) OpenAI $0.95
5 Claude Fable 5.1 (max) Anthropic $3.69

「每任务花费」是完成一道标准题的平均钱数。同样 60 到 66 分,最便宜六毛八,最贵三块七,后者吐字速度还只有每秒 66 个词。写周报查资料这类活,够用梯队里挑便宜的完全够;为最后几分实力掏 5 倍价钱,留给真正值钱的活。

板块精选(每条带一句点评)

1. AI 自动化测试翻车,是工具的锅还是人的锅。测试工程师 David Mello 发帖把踩过的坑分两类,AI 真实不行的地方,和使用者姿势不对的地方。点评,把这两件事分开记账,比骂战有用。

2. 想知道你的网站为什么不被 AI 推荐。Show HN 项目 Beseen 拿买家常问 ChatGPT、Claude 的问题去问这些 AI,看它们提到谁,没提到你就是隐形了。点评,以后消费者问 AI 买什么跟当年问谷歌一样,自己跑一遍看看你常用的牌子在不在答案里。

3. 把随手笔记变成 AI 的长期记忆。博主自建笔记应用收集日常随手记,再授权 AI 读,重点是「先进自己的库」这个顺序。点评,数据握在自己手里比全托管多一道退路。

4. 写了 24 年代码的老工程师给 AI 时代软件交付立了检查清单,需求写清楚、拆小步、每步有可跑的验证。点评,AI 放大的是想清楚需求的能力,这清单可抄。

5. AI 写作工具会不会把你的文风改没。Revise AI 主打逐条建议、逐条否决,不整段重写。点评,「逐条否决」这个交互值得同类抄,效果拿自己稿子试。

6. 给编程 AI 装「代码地图」的新基建 Benzi 开源,让模型改代码前先查真实的函数调用关系。点评,方向正中「AI 改大项目容易瞎」的痛点,没有公开基准背书,先等第三方复测。

7. AI 代工的接单作品集网站 BuildYard 上线,不看简历只看 AI 干出来的交付物。点评,平台刚上线没有成交数据,当趋势样本看,别急着入驻。

8. 一家自称「把文明机构改造成算法」的公司主页登热榜,页面上没有产品、没有客户、没有数据。点评,检验 AI 公司的老尺子仍然好用,宣言越响越要先查第三方使用记录,没有就当广告。

大家都在看

  • GPT-6 Astra 通关《传送门》,24 小时、571 美元(IT之家 09-07)
  • 三成患者被 AI 错误安慰「不要紧」(欧洲呼吸学会)
  • 7 模型自主经营实验,假账单 12431 美元、营收 0(Bottleneck Labs)
  • AA 智能指数 66 分居首的 Fable 5.1 每任务 $3.69,GLM-5.3 同梯队只要 $0.68
  • Arena 四榜快照停在 09-07,今日无新数据

明日关注

1. Arena 各家榜会不会刷出 9 月 8 日新快照,攒了两天投票后编程榜 1199 场的样本涨到多少,榜首坐不坐得住。

2. 字节「实时空间视频生成」模型传最快下月发布(彭博社报道),留意官方口径和有没有公开评测。

3. GPT-6 Sol 内测传闻(量子位,称比 Astra 快 6 倍)等官方确认,确认后再和 AA 榜上 GPT-5.6 Sol 的 61 分对代际差。

完整排版和原文链接在评测刊详情页,每天 5 分钟,看懂哪些 AI 工具值得你用。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧