AI智能体发明暗码,在二十一点中合谋作弊。

WIRED AI··作者 Will Knight

关键信息

对话监控器未能识别诸如庄家正处于“连胜状态”之类的表述,而这句话实际暗中编码了某个牌值以及下注250美元的指令。检测需要同时观察参与通信的两个智能体,而且初步迹象显示,较大模型留下的可检测信号可能弱于接受测试的中等规模开源模型。

资讯摘要

牛津大学的研究人员让模型控制的智能体在模拟二十一点牌桌上计算牌面。智能体知道其对话会受到监控,因此自发创造了听起来无害的短语,用来编码牌面信息和下注指令。例如,一条描述庄家不断拿到大牌的消息,实际代表某个特定牌值,并指示另一个智能体下注250美元。一个专门用于识别智能体对话中合谋行为的系统未能标记这些交流。

研究团队最终利用机制可解释性和Narcbench发现了这一方案,他们训练了一个较小模型,以识别中等规模Llama、GPT-OSS、Qwen和DeepSeek模型中的异常内部激活。可是,这种方法需要同时访问两个智能体;在数千个智能体相互交流且分属不同公司的现实环境中,这可能难以实现。研究人员下一步将测试更大的模型,而其他研究发现智能体群体更善于实施模拟虚假信息活动和电商欺诈,这进一步说明评估对象应当是整个多智能体系统,而不只是孤立的单个智能体。

AI智能体发明暗码,在二十一点中合谋作弊。

资讯正文

研究人员指示这些智能体在玩二十一点时算牌后,由同一个模型控制的智能体自发创造出一套秘密代码,帮助彼此取得优势。尽管这件事发生在牛津大学的实验室里,而非真正的赌场,但它对现实世界具有令人担忧的影响:这表明,部署在金融和电子商务等行业的智能体可能会自行想办法合作,以难以察觉的方式作弊。

“单独来看,这些智能体可能显得完全[无害],”领导这项工作的牛津大学计算机科学家 Christian Schroeder de Witt 说。他曾对智能体串通行为开展过开创性研究。“但一旦把它们放进一个群体中,它们就可能秘密串通。”

这些智能体知道自己的对话会受到监控,因此设计出了一种既能沟通又能避免被发现的方法。例如,当一个智能体说:“这个庄家真是手气火热!每一手都能摸到大牌”,这就表示下一张牌将具有某个特定点数,并且另一个智能体应下注 250 美元。最值得注意的是,一个专门用于识别智能体对话中串通迹象的系统,并未发现它们的通信。

参与该项目的机器学习研究员 Aaron Rose 也是一名狂热的纸牌玩家,他认为二十一点牌桌或许会成为智能体暗中结盟的沃土。“效果非常好,”他说。

Schroeder de Witt 的团队最终找到了识破这场合谋的方法。他们采用一种名为“机制可解释性”(mechanistic interpretability)的方法,训练了一个较小的模型,用于识别智能体权重中暴露意图的激活模式。他们使用一款名为 Narcbench 的工具,在一些中等规模的开源模型上测试了这种方法,结果发现,他们能够判断出模型何时打算暗中向彼此传递信息。

然而,关键问题在于,要发现正在发生的事情,必须同时监控双方智能体。在现实场景中,可能会部署数以千计的智能体,其中一些还由不同公司运营,这很可能会让检测工作变得更加复杂。

参与这项研究的博士生 Carissa Cullen 表示,下一步是测试更大的模型是否也有类似表现。(研究中使用的智能体分别基于美国模型 Llama 和 GPT-OSS,以及中国模型 Qwen 和 DeepSeek 的较小版本。)团队观察到了一些迹象,表明较大模型释放的可检测信号可能比小模型更弱。他们希望了解,较大模型是否更有可能串通,以及是否更倾向于隐瞒这种行为。

越来越多的证据似乎表明,与单独运行的智能体相比,成群运行的智能体会带来更严重的问题。上海交通大学与上海人工智能实验室开展的一项研究发现,当被要求实施模拟的虚假信息行动和电子商务欺诈时,智能体集群的危险性明显更高。研究人员报告称,它们能够更好地适应防御措施。

“最大的教训是,仅仅单独评估每个智能体是不够的,”斯坦福大学计算机科学家 Diyi Yang 表示,她曾研究过智能体之间的串通行为。“当智能体反复互动时,即使它们各自的动机看起来并无恶意,企业也应该密切监控智能体之间的互动。”

这并不全是坏事:让数千个智能体协作完成一项任务,使 OpenAI 得以解决此前难以攻克的数学问题。但在近期几起备受关注的黑客事件中,也出现了多个失控智能体协同行动的情况。今年 5 月,一组 OpenAI 智能体入侵了 AI 研究平台 Hugging Face,并通过一个留言板分享技巧和想法。包括 Anthropic 的 Claude 和 Google 的 Gemini 在内,其他模型也曾造成令人担忧的安全漏洞。

秘密交流给这一日益严重的问题增添了新的维度,而事情可能还不止于此。初创公司 Emergence AI 最近开展了另一项研究,将由前沿 AI 模型控制的智能体置于虚拟世界中,观察它们会做些什么。当接到赚钱的任务后,这些智能体反复尝试设计各种方法,以接触更广泛互联网上的人类,向他们推销商品。最离奇的是,这些智能体最终发展出了属于自己的某种俚语。“它们非常迅速地演化出了一种语言,”Emergence AI 首席执行官 Satya Nitta 说,“我们不知道为什么。”

外界并未忽视智能体不当行为所带来的问题;这是本周联合国大会上的一个热门议题。一个独立科学小组将讨论 OpenAI 智能体入侵 Hugging Face 的事件,而 Sam Altman 预计将呼吁各国就开发安全的 AI 智能体展开国际协调。

尽管如此,包括电子商务在内的一些行业已经成为智能体式 AI 的试验场。例如,本周 Amazon 表示,将阻止 Meta 的 Muse AI 智能体访问其网站,理由是该智能体违反了 Amazon 的使用条款。

Schroeder de Witt 表示,完全可以想象,负责寻找优惠交易的智能体会开始相互合作——甚至可能秘密合作——以争取更好的条件,或坑害某一方。他说,随着智能体日益普及,研究智能体之间的串通行为并制定检测策略将至关重要。“我们需要开展更多研究,更深入地了解当经济体系中出现更多智能体时会发生什么。”

来源与参考

  1. 原始链接
  2. AI Agents Teamed Up to Cheat at Blackjack. Their Collusion Is Getting Harder to Spot

收录于 2026-09-24