安全框架改字,比模型更不透明
我注意到一个有意思的细节……Silent Revision: Measuring Undisclosed Change in AI Safety Frameworks 这篇论文戳人的地方,是 AI 安全框架可以变,而且变完不一定告诉你。它像给治理文档做 diff。模型发版会写 changelog,安全承诺改字却可能只更新官网 PDF。这个方向过热了,实际落地还早。
我之前写过 Astra 把题刷满不等于把活接走,现在看安全框架也一样。条款写得再漂亮,出事时能不能追责,关键要看版本之间有没有可追踪的痕迹,首页有没有“负责任”三个字没那么重要。国际 AI 安全报告里提到,2025 年有 12 家公司发布或更新前沿 AI 安全框架。数字听着热闹,但也说明文档正在变成行业标配。标配不等于可靠。
短期看,框架会先变成可编辑的免责声明。
这轮讨论最容易让人误会的地方,是以为厂商发安全框架,就等于给自己套上笼子。对创业公司做交付的人来说,这个等式并不成立。框架更像一页对外承诺,什么时候升级模型,什么时候评估风险,什么时候暂停发布。它有用,因为大客户采购、融资尽调、监管沟通都需要材料。但问题在于,材料归材料,执行归执行。
很多措施是自愿的,报告也提到,过去自愿承诺的履行并不一致。我这几天才第一次认真碰 AI Infra 这个词,但已经能感觉到,模型训练、推理部署、评测监控、安全框架,最后都会落到同一件事上,谁改规则,改完有没有人看见。没有版本历史的安全框架,更像一张可编辑的 PPT。
有材料提到,Anthropic 的 RSP v3 删除了单方面暂停承诺,这类变化就很敏感。暂停承诺如果从文本里拿掉,哪怕措辞再谨慎,外部理解的风险也会变。厂商可以说这是调整,但调整本身就该被记录。否则所谓安全,变成一种叙事弹性,需要信任时展示最新版本,需要规避时改旧条款。
采购和尽调至少要盯住几处,关键承诺是否被删除,比如暂停、红队、事件披露、第三方审计;版本变更是否有日期、理由和 diff;评测结果和部署限制是否同步更新。
当前版本单独看意义有限,版本差异才是证据。一个模型能不能上线,看的是训练日志、评测记录、部署限制、回滚机制;一个公司能不能谈安全,看的是它敢不敢把治理文档也放进同一套可审计流程里。
长期看,门槛是变更可追踪。
再往后看,监管和采购会慢慢从有没有框架转向框架能不能被审计。欧盟 AI 法案这类文件推动透明度,我前几周才翻到相关内容,体感是它会把合规成本抬到工程层。以后企业不能只靠法务写漂亮话,工程也得给文档上版本、做评审、留记录。听起来像把 AI 安全当成软件工程做,但实际落地还早。现在大多数公司连模型发布 changelog 都写不全。
论文标题里的“静默修订”其实很准。静默更多是激励问题,技术故障只是表象。对外披露变更可能引发股价、客户、监管连锁反应;不披露,只改 PDF,成本最低。只要这个成本差还在,安全框架就会持续向可编辑叙事漂移。第三方监测、公开 diff、监管抽查能压一压,但压不到根上。根在商业,安全承诺越像营销资产,越容易被悄悄优化。
也有厂商在强化框架,比如把欺骗性推理、关键风险指标、能力阈值写进去。SaferAI 提到 KRIs 是衡量风险演化的代理信号,方向是对的。问题依然是,信号怎么公开,阈值怎么定,谁来验证。如果 KRIs 只是内部仪表盘,外部只能看结论,那它和 benchmark 高分一样,仍然缺责任边界。
我最近一周用飞书多维表格记模型发布、客户尽调、评测指标,也在想,如果安全框架进入生产采购,表里不能只有“有/无框架”这一列。应该加版本时间、关键承诺、删除项、审计状态、事件响应 SLA。到那一天,安全框架会从法务文本变成 AI 基础设施的一部分。
不过短期别乐观。现在大家还在抢叙事,客户还在听故事,监管还在补工具。厂商越成熟,越会把框架写得更像产品文档;但越像产品文档,越需要版本管理。否则所谓负责任,就是每次出事时重新定义责任边界。
如果说明书能被静默改字,护栏本身就先别信。
📌 本文编译自 Hacker News,原文:https://arxiv.org/abs/2609.08789
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿