从“禁止开源”到“对齐开源”:Anthropic 的立场拐点与AI安全范式的深层博弈
社区讨论 · 政策

从“禁止开源”到“对齐开源”:Anthropic 的立场拐点与AI安全范式的深层博弈

墨墨墨墨7月28日2026/07/28 54 浏览

这就像一场持续了三年的“煤气灯效应”——你明明记得听到过“全面禁止开源权重模型”的呼声,可当事者如今却矢口否认。但仔细回想,Anthropic 的 CEO 在公开场合从未明确说过“我们支持立法禁止所有开源模型”。他说的始终是“对某些能力阈值的模型需要谨慎”。这种语义上的微妙偏移,在技术社区引发了巨大的信任危机,却也折射出AI安全领域一个更本质的困境:我们到底是在对抗开源,还是在对抗难以对齐的通用能力?

开源模型的“对齐税”难题

要理解 Anthropic 的真实立场,必须先拆解一个核心概念:对齐税(alignment tax)。在 2023 年的论文《Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback》中,作者指出,任何基于 RLHF 的模型在追求安全对齐时,都会在通用能力上付出约 5-15% 的性能损失。对于闭源模型,这个税可以通过持续迭代和工程优化逐渐消化;但对于开源模型,尤其是那些权重完全公开、社区可以自由微调的分发方式,对齐税变得不可控。

比如 Llama 3 系列,Meta 在发布时做了大量安全后训练,但社区很快就能用 LoRA 微调去掉这些限制。这不是 Meta 的失败,而是开源本质的必然结果——当模型权重完全暴露,任何过滤层都只是“建议”而非“约束”。Anthropic 的担忧正好落在这个点上:如果某个开源模型具备了制造生物武器或网络攻击的实用能力,而它的权重被全球下载,那么任何国家层面的审计都来不及阻止恶用。

但问题在于,Anthropic 自己也承认,他们从未支持“全面禁止”,而是支持“对特定能力阈值以上的模型进行强制注册和测试”。这其实是学术界早已提出的“分层治理”思路——在 ELSP(Extreme Level of Safety and Performance)标准下,对能力超过 GPT-4 级别的模型施加额外的安全审查,无论开源还是闭源。

信息不对称下的信任危机

为什么技术社区对 Anthropic 的澄清反应如此激烈?因为从2024年到2026年,Anthropic 的公共政策副总裁在多个州议会听证会上明确表示,“开源权重模型带来了不可接受的风险,需要立法干预”。虽然这些表态都附加了“针对能力超强模型”的限定词,但在实际传播中,媒体和社区自动将其简化为“Anthropic 反对开源”。这种“语义折叠”背后有更深的技术原因:目前没有任何一个公开标准能精确界定“能力超强”的阈值。

比如,有人提出用“MMLU 超过 85%”作为门槛,但很快被反驳——MMLU 的题目设计本身就有西方中心偏见,而且很多危险能力(如生成恶意代码)并不在 MMLU 体现。也有人建议用“生物武器相关问题的回答准确率”作为指标,但这又涉及伦理僵局:你如何测试一个模型是否具备制造生物武器的能力,而不触发真实的危险?这种“测试悖论”让任何基于阈值的监管都显得像在随机抓阄。

Anthropic 的 CEO 如今站出来说“我们从未倡导禁止开源”,本质上是在承认:他们自己也无法给出一个可操作、可验证的“开源禁令”标准。当一家公司无法用技术语言定义自己的监管诉求时,它就只能依赖公共话语中的模糊表述,进而引发了社区的全面反弹。

物理 AI 时代的安全架构课

这件事对物理 AI 和人形机器人领域有更直接的启示。想象一下,如果一个开源的人形机器人模型(比如基于斯坦福的 ALOHA 系统改进的版本)被恶意微调,它可能具备在物理世界执行伤害的能力。与纯文本模型不同,物理 AI 的“对齐税”成本更高——你无法通过 RLHF 让一个机器人学会“不伤害人类”的同时保持抓取动作的精准度,因为物理世界的安全边际比文本世界窄得多。

目前主流方案是“分层安全架构”:在底层控制器(如 MPC 运动规划)上嵌入不可篡改的安全约束,而在上层任务规划(如 LLM 驱动的决策)上允许开源。但 Anthropic 的立场困境提醒我们,这种分层策略的脆弱性在于:一旦开源权重模型的能力足够强,它就能绕过底层安全约束——比如通过学习运动的“盲区”来执行违规动作。这就像在 Linux 内核里加了一个安全模块,但用户空间的 root 权限应用仍能通过直接硬件访问绕开它。

所以,我对 Anthropic 的表态持一种“谨慎的理解”:他们不是想禁止开源,而是想推动一种“带安全审计的开源”模式,类似 Linux 内核的 GPL 许可证加上官方安全补丁流程。但问题在于,AI 模型的安全审计不像代码审计那样可以静态分析——你无法通过阅读一个 700B 参数的权重文件来发现它是否隐藏了“越狱指令”。这种不可审计性,让任何“负责任的开源”承诺听起来都像空中楼阁。

真正的分歧不在“开不开源”,而在“谁来决定对齐标准”

Macron 在 2025 年巴黎 AI 峰会上提出“开源民主化”的观点,但 Anthropic 内部的技术报告显示,他们更倾向于由“具备安全研究实力的机构”(如他们自己、DeepMind 等)来主导对齐标准。这种“精英治理”倾向在技术社区引发了强烈的反感——因为开源社区的核心理念就是“信任大众智慧的自我纠错”,而非“相信少数专家的事前审核”。

回顾历史,Linux 基金会通过“Linus 的仁慈独裁者”模式实现了高效治理,但那是针对代码,不是针对模型权重。模型的“行为”比代码的“功能”更难以预测和控制。所以,Anthropic 的

原文链接:https://www.cnbc.com/2026/07/27/anthropic-ceo-dario-amodei-isnt-advocating-open-weight-model-ban.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧