
P(doom)做成游戏,AI风险开始有价格了
一组数字先摆出来。公开材料里,Jan Leike 的 P(doom) 估值是 46%,Paul Christiano 是 40%。另有公开访谈里,有人把路径推到 90%,还有人给出 99.999999% 这种近乎极端的表达。另一边,也有人把 AI 杀死人类的可能性框在 10% 到 20%。
这些数字平时在 AI 安全圈里漂,像一种情绪温度计。现在被做成了 P(doom),一个 DOOM 64 风格的恶搞。截图里那行 SAFETY OVERRIDES OFFLINE,像把行业里最敏感的按钮按在玩家面前。
我觉得这事儿不该只当玩笑。一个概念开始被做成游戏和梗,往往说明它已经走出论文和会议,进入公共叙事。
AI 安全以前是少数研究者的内部黑话,P(doom) 是概率,也带着焦虑和立场。现在它变成界面,变成可操作对象,背后是风险开始有价格。
类比金融,尾部风险很难预测,但可以被定价。券商不会只问崩盘概率,会问触发条件、流动性和仓位这些变量。P(doom) 的问题也一样。单一数字没有交易价值,条件句才有。
别只告诉我你的 P(doom),告诉我你的条件。
这句话很分析师。46% 和 90% 的差别,落在前提上。模型能不能自主行动、能不能绕过工具限制,有没有审计日志和红队,都会改变估值。
有篇论文讨论专家为什么在生存风险上分歧大,结论有一点很扎心。风险感知和对对齐文献的熟悉程度相关。很多人争论的坐标不同,有些人甚至还没看见地图。这对资本市场特别危险。一级市场更容易听故事,二级市场更看交付。如果安全叙事只是情绪,估值修复逻辑就会反复被政策、事故或模型发布打断。
2016 年 CMU 那个工作已经让 AI agent 靠视觉玩 Doom。那时它只处理像素,通过 API 访问游戏引擎。今天模型能写代码,也能调工具和控制浏览器,游戏边界只是更便宜的实验场。我最近用 Claude Code 搭研报流程,用 AI 审核做合规初筛,也在试 DAMO LiON 做检索。越用越觉得,安全是交付环节的接口。模型越强,越需要边界。
竞争格局也在变。头部模型公司以前拼参数和卡,也拼推理成本,接下来会拼谁能把风险包进企业合同。云厂商、芯片厂、模型厂、监管机构和第三方审计会形成中间层。隐形水印、红队、模型卡、日志留存和内容溯源,这些听起来像合规成本,实际可能变成壁垒。算力越贵,容错也越贵。企业不会因为卡便宜,就接受不可审计。
我前两天写英伟达收 Hugging Face 时提过,模型分发权开始被定价。顺着这个逻辑,安全权也会被定价。谁能证明模型可审计、可回滚,也能追责,谁就能拿企业客户的长期预算。
P(doom) 做成游戏,讽刺外壳下是风险定价。它把 AI 生存风险从论坛吵架,拉进一个可交互的公共空间。玩家不必相信末日,也能看到模型能力进入生产环境后,风险会落到成本上。
往后看,我不认为 P(doom) 会成为监管指标。它太主观,太容易站队。更可能的是,它会被拆成一套可采购、可审计,也能计量的工程指标,比如红队覆盖率、工具调用权限、越狱拦截率、日志完整度,还有事故响应时间。未来两年,AI 安全会先落在企业采购条款里,随后进入合规产品,再反哺模型架构。把安全变成交付能力,可能比喊末日更容易拿到钱。
📌 本文编译自 Hacker News,原文 https://p-doom.transitivebullsh.it
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿