机器报警,不等于机器有良知。
前几天晚上我在 AI Lab 跑多 agent(智能体)demo,一个查资料,一个汇总。刚把 API key(接口密钥)挂上,群里转来一条新闻,美国一名 25 岁男子把强暴、杀害前女友和自杀的计划告诉了 ChatGPT,OpenAI 发现高风险对话后,把大约两个月的记录通报 FBI,警方介入,男子认罪。有人问,机器开始有良知了吗。我愣了几秒。我用 ChatGPT 才一个月,这一个月里也把它当过私人搜索框,查论文、改邮件,甚至半夜把焦虑丢进去。看到“报警”,我后背发凉。
让人后背发凉的是,很多用户可能真以为对话框是树洞。OpenAI 的安全机制会侦测威胁,也可能转人工审查或通报执法机构。技术上并不神秘。文本生成模型(会按概率续写文字的模型)按概率继续说话,安全系统再按规则、分类器和语义风险打分。它看到购买枪械、伤害他人、自杀计划,触发升级,依据是有人写了“这类风险要上报”的策略。所谓良知如果只落在代码和流程里,那它更像警报器。警报器没有同情,它只负责在阈值上亮灯。
但警报器也分好坏。过去评价模型,总看它是否流畅,会不会编造,能不能写代码。安全能力常像说明书最后一行小字。这次事件把难题推到台前。当模型服务从玩具变成倾诉对象,平台有没有义务、有没有能力、有没有边界介入现实。OpenAI 这次至少说明,模型安全不是装饰,它真的可能改变案件走向。问题在报警之后。谁来判断威胁是创作、玩笑、测试,还是真实行动。用户是否知道聊天记录可能被提交。误报会不会挤兑资源,甚至把求助者推向更糟处境。这些比“AI有良知”更值得讨论。
我最近在看一篇安全对齐(让模型行为符合人类意图)论文,里面有个说法很朴素,模型不会天然理解伤害,它需要外部框架定义什么算高风险。别把分类器输出当成人格觉醒。
让人安心的是背后的审计、升级路径、法律责任和救济渠道。一个负责任的系统,应该告诉用户哪些内容可能被人工审查,哪些情况会报警,依据是什么,如何申诉。否则,我们只是用不透明的安全机制,保护一群以为自己在私聊的人。
这也是为什么我对“全球首例”保持警惕。首例像一次没有充分讨论的越界。平台需要处理严重暴力威胁,尤其对话里出现具体计划、武器、时间、地点,这已经超出模型幻觉。但用户也会写小说、做剧本、测试 prompt,甚至把梦里荒诞的话丢给 AI。没有分层机制,安全系统容易被误用,变成平台免责工具,或把大量模糊内容推给人工审查。资源会挤兑,信任也会漏。
我想起上周写过用数据换折扣的帖子,当时就担心隐私和合规。这次更极端。聊天内容除了可能被拿去训练,还可能被送到执法机关。对实验室的人来说,这是产品安全;对普通人来说,这是“我以为只有我和它知道”。如果平台没有把同意做清楚,它越负责,用户越不安。因为负责的对象说不清。它到底对受害者负责,对监管负责,对股价负责,还是对屏幕前确实想求助的人负责。
所以该问的是人类社会有没有把责任链接完整。 模型只是链上一环。上游是训练目标和安全策略,中游是分类、人工审查、法律标准,下游是执法和医疗救助。某一环空着,报警就可能变成误伤;某一环通了,它才可能救人。把希望寄托在“AI会自己变善良”上,很省事,也很危险。
如果你问我最近用 ChatGPT、LMChat 有什么变化,我会说,我把它们当成半公开的房间。我会继续用,但不会把最私密、最危险、最未经整理的话,全交给一个没有法律身份、也没有心理医生执照的窗口。需要求助时,优先找能到场的人。平台该做的,是把上报规则说清楚,把误报救济做出来,把高风险内容分级处理。规则没落地前,用户只能自己判断哪些话能放进来。
物界前沿