OpenAI挫败了一场协同模型蒸馏行动。

OpenAI News··作者 OpenAI News

关键信息

OpenAI称,相关活动始于7月1日,并在7月24日至25日出现高峰,超过4,000名用户发出了16,000次符合提取模式的请求;进一步调查发现,相关活动涉及超过15,000名用户,并于7月28日前被全面阻断。这些数字代表提取尝试,并不意味着提取一定成功;OpenAI还表示,操作者没有破解其加密机制,也没有访问数据库或已存储的用户对话。

资讯摘要

OpenAI报告称,其发现并挫败了一场协同对抗性蒸馏行动,最早观察到的活动出现在2026年7月第一周。操作者试图让受保护的模型推理内容变得可见,其中一种方式是从一次对话中复制加密推理,再要求另一次对话中的模型对其进行解密和转录。相关活动起初规模较小,但在7月24日至25日显著激增,OpenAI记录到来自超过4,000名用户的16,000次相关请求。进一步调查将类似提示模式关联到一个超过15,000名用户的集群,OpenAI表示已于7月28日前全面阻断这些活动。

尽管该公司无法认定所有操作者均属于同一个行为主体,但其将一个核心活动集群归因于与Kimi开发商Moonshot AI有关联的人员。OpenAI采取的措施包括处置相关账户、加强注册和基础设施控制、扩大监测范围、关闭可用于重放加密推理的路径,以及增加能够拦截潜在推理泄露流式输出的检查。该公司还通过Frontier Model Forum和政府信息共享渠道通报调查结果,并继续改进工具防御、分类器覆盖、模型拒绝机制以及合作伙伴托管部署的保护措施。

资讯正文

了解 OpenAI 如何挫败一场提取受保护模型推理能力的行动,并加强针对对抗性蒸馏的防御。

来源与参考

  1. 原始链接
  2. Disrupting a coordinated model-distillation campaign

收录于 2026-10-01