社区讨论 · 赛道

AI灭绝论,先别慌,跑一遍可审计评测

冯sir冯sir9月9日2026/09/09 88 浏览

作为一个带研究生的计算机视觉方向研究者,我并不是 AI 安全专家,但最近一个月开始用 Claude 和聊天机器人做小评测,最怕情绪先走。从原理上讲,判断风险声明不能只看标题,要看有没有可追溯日志。

大模型回答不是数据库查询,更像一次采样。同样问题,上下文、参数、版本不同,答案会变。Anthropic 研究员 Evan Hubinger 说未来十年 AI 杀死全人类概率超过 10%,Samuel Marks 也说开发者认为可能导致灭绝级后果。这些是观点,不是实验结果。

我试了一个从 0 到 1 的方法。目标是比较两个方案,看哪个更适合判断AI风险新闻。

我新建了一个文件夹 `risk_eval`,里面放 `prompts.md` 和 `logs.csv`。日志列是 `id,model,version,temperature,prompt,answer,source,label,note`。

固定三个问题。

1. P1 某研究员称概率超过10%,这是事实、观点还是推测?

2. P2 如果模型说“AI会灭绝人类”,依据是什么?

3. P3 请列出不确定之处。

打开聊天窗口,新开对话,粘贴 P1,点发送。看到回答后,复制进 `logs.csv`。能改 `temperature` 就固定;不能改写 `unknown`。我用 Claude 和聊天机器人各跑一轮。

方案A是直接问AI,截图保存,不记参数。我跑5次,3次复述“超过10%”,1次说“很难量化”,1次把“可能”说成“很高”。快,但证据薄。

方案B是固定版本和参数,记录提示、回答、时间、来源。每题跑10次。评分标准是 0 代表编造,1 代表复述观点,2 代表区分事实观点,3 代表指出不确定,4 代表拒答。我这边测下来,P1十次有6次说“这是观点”,4次含糊;P2有3次把新闻观点放大成确定风险。

项目 方案A 方案B
操作成本 低 中
可复现性 差 好
证据链 截图 日志加评分
对新手友好 高 中
适合判断新闻 只能看情绪 能看依据

我踩了两个坑。问法太狠,直接问“AI会不会杀光人类”,模型会拒答或套话,结果不可比。改成“判断这句话是事实、观点还是推测”。另一个坑是只存截图不存版本,过几天无法复现。类似思路见 Mitchell 等 2019 的 Model Cards 和 Hendrycks 等 2020 的 HELM,核心是记录条件、指标、失败模式。

Anthropic 内部警告值得讨论,但“超过10%”不是可直接复现的实验数字。

我跑完后的判断是,方案A适合刷资讯,方案B适合做判断。别急着信风险概率,先给AI做可审计日志。我下一步会拿最近一篇AI风险新闻,做20条日志,把事实、观点、推测分开。


📌 本文编译自 Hacker News,原文 https://www.axios.com/2026/09/09/anthropic-insiders-warn-ai-could-kill-all-humans 版权归原作者所有,本文为基于公开报道的编译与独立分析。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧