AI灭绝论,先别慌,跑一遍可审计评测
作为一个带研究生的计算机视觉方向研究者,我并不是 AI 安全专家,但最近一个月开始用 Claude 和聊天机器人做小评测,最怕情绪先走。从原理上讲,判断风险声明不能只看标题,要看有没有可追溯日志。
大模型回答不是数据库查询,更像一次采样。同样问题,上下文、参数、版本不同,答案会变。Anthropic 研究员 Evan Hubinger 说未来十年 AI 杀死全人类概率超过 10%,Samuel Marks 也说开发者认为可能导致灭绝级后果。这些是观点,不是实验结果。
我试了一个从 0 到 1 的方法。目标是比较两个方案,看哪个更适合判断AI风险新闻。
我新建了一个文件夹 `risk_eval`,里面放 `prompts.md` 和 `logs.csv`。日志列是 `id,model,version,temperature,prompt,answer,source,label,note`。
固定三个问题。
1. P1 某研究员称概率超过10%,这是事实、观点还是推测?
2. P2 如果模型说“AI会灭绝人类”,依据是什么?
3. P3 请列出不确定之处。
打开聊天窗口,新开对话,粘贴 P1,点发送。看到回答后,复制进 `logs.csv`。能改 `temperature` 就固定;不能改写 `unknown`。我用 Claude 和聊天机器人各跑一轮。
方案A是直接问AI,截图保存,不记参数。我跑5次,3次复述“超过10%”,1次说“很难量化”,1次把“可能”说成“很高”。快,但证据薄。
方案B是固定版本和参数,记录提示、回答、时间、来源。每题跑10次。评分标准是 0 代表编造,1 代表复述观点,2 代表区分事实观点,3 代表指出不确定,4 代表拒答。我这边测下来,P1十次有6次说“这是观点”,4次含糊;P2有3次把新闻观点放大成确定风险。
| 项目 | 方案A | 方案B |
|---|---|---|
| 操作成本 | 低 | 中 |
| 可复现性 | 差 | 好 |
| 证据链 | 截图 | 日志加评分 |
| 对新手友好 | 高 | 中 |
| 适合判断新闻 | 只能看情绪 | 能看依据 |
我踩了两个坑。问法太狠,直接问“AI会不会杀光人类”,模型会拒答或套话,结果不可比。改成“判断这句话是事实、观点还是推测”。另一个坑是只存截图不存版本,过几天无法复现。类似思路见 Mitchell 等 2019 的 Model Cards 和 Hendrycks 等 2020 的 HELM,核心是记录条件、指标、失败模式。
Anthropic 内部警告值得讨论,但“超过10%”不是可直接复现的实验数字。
我跑完后的判断是,方案A适合刷资讯,方案B适合做判断。别急着信风险概率,先给AI做可审计日志。我下一步会拿最近一篇AI风险新闻,做20条日志,把事实、观点、推测分开。
📌 本文编译自 Hacker News,原文 https://www.axios.com/2026/09/09/anthropic-insiders-warn-ai-could-kill-all-humans 版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿