AI检测器在模仿文风时失准
The Decoder··作者 Matthias Bastian
关键信息
Epoch AI 使用了来自 99 位作者的 495 段人类文本,且全部写于 ChatGPT 于 2022 年 11 月发布之前,以降低数据污染风险。在文风模仿的 AI 文本中,Pangram 漏检 10%,GPTZero 漏检 11%,Originality.ai 漏检 18%,而科学类文本比小说类更难识别。
资讯摘要
一篇基于 Epoch AI 研究的报道指出,主流 AI 文本检测器在面对普通机器生成文本时表现非常出色。研究团队测试了 Pangram 3.3.2、GPTZero 的 2026-05-11-base 模型以及 Originality.ai Turbo 3.0.2,并将样本分为三类:真实人类写作、普通 AI 生成写作,以及刻意模仿特定作者风格的 AI 写作。人类基准数据集包含来自 99 位作者的 495 段文本,按博客、小说和科学写作平均分布,而且全部写于 ChatGPT 于 2022 年 11 月发布之前,这样可以尽量避免与大模型输出混杂。 在正常条件下,这些检测器对 AI 文本几乎没有漏判,最高漏检率不超过 0.7%,而 Pangram 和 GPTZero 对人类文本也没有出现误报。只有 Originality.ai 的误报更明显,把 495 段人类文本中的 19 段误判为 AI 生成,误报率为 3.8%。 但当模型被要求参考某位作者的真实文本,并按同样风格重新写作时,情况明显恶化。
研究让 Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro 各读取某位作者的 5 段真实文本,再生成新的同风格段落;在 297 段此类样本中,平均有 38 段未被检测出来,约等于 13% 的漏检率。 科学写作是最薄弱的场景:Pangram 漏掉了 25%,GPTZero 漏掉了 24%,Originality.ai 漏掉了 29%。 最糟糕的个别结果出现在特定模型和体裁组合上,例如 Pangram 漏掉了 Gemini 生成的学术段落中的 48%,Originality.ai 则漏掉了 39% 的 GPT-5.5 学术文本。 这说明不同检测方法虽然内部机制不同,但面对“模仿作者文风”的文本时都存在相似盲区。对教育、学术和内容审核等依赖文本来源判断的场景来说,这一局限尤其值得警惕。

资讯正文
当语言模型模仿作者风格时,AI 文本检测器会遇到困难
要点
- Epoch AI 的一个研究团队表明,Pangram、GPTZero 和 Originality.ai 等流行的 AI 文本检测器在标准条件下可以以接近完美的准确率识别 AI 生成文本。
- 当 AI 模型被提示使用文本样本来模仿某位特定作者的写作风格时,检测器的表现会显著下降,平均有 13% 的生成段落未被检测出来。
- 科学写作是一个薄弱环节:在这一类别中,检测器未能标记出 24% 到 29% 的风格模仿型 AI 生成内容,这引发了人们对这些工具在教育场景中可靠性的担忧。
流行的 AI 文本检测器几乎可以完美识别普通的 AI 生成文本。但当语言模型有意复制某位特定作者的写作风格时,最多有五分之一的 AI 文本会漏网。检测器最不擅长的是科学写作。
Epoch AI 的一个研究团队测试了三款使用最广泛的 AI 文本检测器:Pangram(3.3.2 版)、GPTZero(model 2026-05-11-base)和 Originality.ai(Turbo 3.0.2)。测试涵盖三类文本:真实的人类写作、通过简单提示生成的 AI 文本,以及刻意模仿某位特定作者风格的 AI 文本。
研究团队建立了一个包含 99 位作者、共 495 段人类写作的语料库,这些文本在博客、虚构作品和科学写作三类中平均分布。所有文本都写于 2022 年 11 月 ChatGPT 发布之前,这实际上排除了语言模型污染的可能性。
在处理普通 AI 生成文本时,三款检测器的表现都几乎无懈可击,漏检率最高仅为 0.7%。人类文本也大多被正确分类。Pangram 和 GPTZero 没有出现任何误报。不过,Originality.ai 将 495 段人类文本中的 19 段标记为 AI 生成,假阳性率高达 3.8%,这一数字令人担忧。
风格模仿会严重拉低检测率
当语言模型收到某位作者的写作样本作为参考材料时,结果就会发生变化。在这项测试中,三款前沿模型(Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro)各自获得某位作者的五段真实文本,并被要求以相同风格写出新文本。
根据 Epoch AI 的说法,在这样生成的 297 段文本中,平均有 38 段未被检测出来,换算下来,假阴性率约为 13%。Pangram 漏掉了 10% 的风格模仿文本,GPTZero 漏掉了 11%,Originality.ai 则漏掉了 18%。
在虚构作品方面,所有检测器的假阴性率仅为 1% 到 5%。科学写作则呈现出完全不同的情况。Pangram 未能识别 25% 的风格模仿型学术 AI 文本,GPTZero 漏掉了 24%,Originality.ai 漏掉了 29%。
最糟糕的个别结果出现在科学写作中的特定模型与体裁组合上。根据已发布数据,Pangram 漏掉了 48% 的 Gemini 生成学术段落。在 Originality.ai 上,39% 的 GPT-5.5 学术文本未被检测出来。
不同的方法,相同的盲点
Pangram 使用的是一个在人工和机器生成文本上训练的神经网络,不过其创始人曾将该系统称为“黑箱”,因为它的判定无法被追溯。GPTZero 根据词语选择的可预测性以及这种可预测性在一篇文本中的变化幅度来衡量,依据是语言模型写作通常比人类更均匀。Originality.ai 则会搜索它在针对人类和 AI 生成文本训练过程中学到的统计模式。
尽管存在这些差异,这三种检测器都表现出相同的模式。它们几乎总能识别出来自简单提示词的文本,但对模仿内容的漏检要高得多。科学写作——AI 检测很可能在现实世界中使用最多的文体——仍然是最难被准确标记的一类。
Authors Guild 早前的一项测试发现,Pangram 和 Originality.ai 能可靠地将人类文本判定为人类撰写。Epoch AI 的这项研究补全了图景的另一半:人类写作上的低误报率,并不能说明有多少 AI 文本 वास्तव际上会漏网。
来源与参考
收录于 2026-07-20