护栏让LLM文本更易被检测

The Decoder··作者 Matthias Bastian

关键信息

Emi 的论点核心是“模式坍塌”,也就是后训练规则会减少模型可生成文本的多样性,使其输出更窄、更可预测。文章还指出,这一说法只适用于未加水印的 AI 文本,因为水印被认为即使在模型输出更具多样性的情况下也应当保持可检测。

资讯摘要

这篇文章提出,大型语言模型理论上可以像人类一样写出多样化文本,但现实中后训练会让它们更容易被识别。Pangram 首席技术官 Bradley Emi 认为,像 ChatGPT、Claude 和 Gemini 这样的系统在预训练之后,会加入安全护栏和行为规则。按照他的说法,这些约束会缩小模型愿意使用的表达范围,从而产生他所说的“模式坍塌”。他表示,Pangram 的检测方法对基础模型不太敏感,因为这些原始模型具有更多语言多样性。

Emi 还说,只在有限领域上训练的特化微调模型,例如只学 Hemingway 风格文本或某些 subreddit 数据的模型,也可能因为同样原因而不容易被检测。对他来说,破损或不连贯的文本也属于另一类,因为它们偏离了典型的 AI 生成模式。文章强调,这一说法只适用于未加水印的 AI 文本。最后,文章指出,水印是另一回事,即使模型输出更具多样性,它们也可能仍然有效。

护栏让LLM文本更易被检测

资讯正文

大语言模型(LLMs)理论上可以像人类一样写出风格多样的文本,但事实并非如此。AI 文本检测公司 Pangram 的 CTO Bradley Emi 在一篇博客文章中表示,经过后训练和安全护栏后,它们的文本就会变得可检测。像 ChatGPT、Claude 或 Gemini 这样的系统会学习行为规则,以避免输出危险内容或审查某些政治表述。这会大幅缩小它们的表达范围,这种效应被称为“模式坍塌”(mode collapse)。

Emi 说,所谓基础模型(base models)——也就是后训练之前的原始模型——写作风格更为多样,因此不会被 Pangram 的检测机制标记。仅针对海明威或某些 subreddit 文本进行训练的、范围很窄的微调模型,以及像语义混乱这类损坏的输出,也同样如此。不过,这只适用于没有水印的 AI 文本。即便基础模型具有更高的多样性,水印技术也很可能始终有效。

来源与参考

  1. 原始链接
  2. LLMs could write like humans but post-training guardrails make their text detectable

收录于 2026-08-21