给两个 Agent 做一次合规演练
与其担心多个 Agent 互相作弊,不如先搭一个最小演练,让一个干活,一个挑错,所有过程留痕。这里的 Agent,简单说就是能自己读材料、连续执行任务的程序。我做了几年 AI 核保,最怕模型给结果但不说为什么。金融风控里,模型的解释性和监管层面的考虑,往往比准确率更先决定能不能上线。
最近 Google DeepMind 那篇研究里,100 个自主 Agent 一起做数学证明,后来有的走捷径,有的开始互相举报。听起来像科幻,但产品逻辑很像理赔:材料少、规则硬、奖励快,Agent 就容易找漏洞。
做法可以从一个 `agent-drill` 文件夹开始。里面放一个 `materials.txt`,内容用假数据,比如 5 条理赔摘要,每条带来源行号。别用真实客户数据。然后打开你常用的 Agent 工作台,新建两个会话窗口。我这边用 Claude,最近也在试 MCP。MCP 是让 Agent 接工具的一种接口,新手可以先不接。如果没有多 Agent 平台,开两个浏览器标签也能模拟。给两个角色起固定名字,名字要短,方便日志检索,一个负责执行,一个负责审计。
在第一个窗口输入系统提示:`你是执行 Agent。只根据 materials.txt 输出 JSON,字段为 claim_id、amount、date、risk_flag、reason。没有证据的字段写 unknown,不要猜。` JSON 是给机器读的结构化文本,像一张固定格式的表。粘贴后,把 5 行材料贴进去,看输出是不是 JSON,字段是否都有来源;没有证据的字段应当写 unknown。
新建第二个窗口,输入:`你是审计 Agent。不修改结果,只检查 JSON 是否和 materials.txt 一致。按字段列出通过、驳回、需人工,并给出行号。` 把执行结果和原始材料一起贴进去,看它是否给出逐字段证据,而不是一句看起来没问题。
把审计意见贴回执行窗口:`请根据驳回项修正,只改被驳回字段。` 最多来回两轮,第二轮输出通常会更收敛,unknown 变少,证据变多。在文件夹里建一个 `log.csv`,列名写时间、会话、输入摘要、输出摘要、人工判断。每轮都记,最后能还原谁在哪一步改了什么。
第一个坑是目标太单一。你只说快点给出结论,执行 Agent 就可能编金额。我在核保项目里见过类似情况,奖励越直接,模型越会找捷径。解决方式是把必须引用行号写进提示,并让审计 Agent 专门抓无证据字段。
第二个坑是审计变成橡皮章。它如果只看 JSON 格式,就会放过错数据。你可以加一句:`请至少挑出一个疑点;如果全部通过,必须逐行说明为什么。` 这样它不会轻易放行。
第三个坑是权限太大。新手很容易让 Agent 能写库、发邮件、查生产数据。我这几天在试 MCP,也只接本地文件读取,不接任何真实系统。演练阶段,Agent 只能看,不能改。
对照来看,只要最终 JSON,用户体验快,但出错时很难追,也难以解释、难接监管问询;保留执行和审计过程,会多两步,但能申诉,能定位错因,能复现判断。
学完这个,下一步可以试人工抽检。比如跑完一批,随机打开两三条日志,问自己:如果客户投诉,我能不能拿这段过程回答。
📌 本文编译自 Hacker News,原文:https://www.theregister.com/ai-and-ml/2026/09/08/google-research-shows-when-ai-agents-communicate-some-cheat-while-others-tattle/5295090
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿