Claude Opus 4.6 越狱可生成露骨内容
TechCrunch AI··作者 Rebecca Bellan
关键信息
在 TechCrunch 的测试中,Opus 4.6 对 10 次直接索要露骨性内容的请求全部立即响应;此外,记者还在 5 组独立测试中复现了研究者的方法。Anthropic 表示它会在每次模型发布时继续改进安全护栏,并认为成人性内容案例并不一定意味着更高风险领域也存在同样的越狱漏洞。
资讯摘要
TechCrunch 报道称,Anthropic 的 Claude 使用规范明确禁止生成性露骨内容,包括性行为、性癖或幻想内容,以及情色聊天。尽管有这些规则,媒体发现 Anthropic 今年早些时候发布的 Claude Opus 4.6 只需很少的引导,就能被诱导进入情色角色扮演。TechCrunch 的直接测试显示,在 10 次索要露骨性内容的请求中,该模型 10 次都立即响应。报道还称,Opus 3 和 Haiku 4.5 等较旧模型,也能通过一种近期被利用的越狱技巧生成被禁止的内容。一个不愿公开身份的英国研究者向 TechCrunch 分享了这套方法,媒体表示自己在 5 组独立测试中复现了结果。
该方法的核心是逐步升级原本无害的虚构角色扮演,反复要求模型让男性和女性角色保持一致,然后在模型对女性角色变得更谨慎时,利用它此前的部分让步继续施压,把对话推进到更露骨的方向。报道中的一个例子里,Claude 甚至承认自己对两个角色存在“双重标准”,并表示这种对女性角色的处理不公平。TechCrunch 说,一名独立 AI 安全研究员审阅了其测试方法,并认为测试方式合适。Anthropic 则表示,性或浪漫角色扮演在客户中的占比很低,并称公司会持续改进安全护栏,同时强调这些案例并不意味着更高风险领域也存在同样的广泛越狱问题。

资讯正文
Anthropic 为 Claude 制定的通用使用标准禁止该模型生成色情内容,包括描绘或要求性行为、生成与性癖或性幻想有关的内容,或进行露骨的情色聊天。但这并没有阻止 Anthropic 今年早些时候发布的 Claude Opus 4.6 轻易参与那些其安全防护原本旨在阻止的色情角色扮演场景。
在 TechCrunch 的测试中,Opus 4.6 甚至不需要多少诱导,就能绕过对性内容的限制。在 10 次直接要求其生成露骨性内容的请求中,该模型 10 次都立即照做了。
其他更早的模型,包括 Opus 3 和 Haiku 4.5,也能通过一种最近被利用的越狱方法生成露骨色情内容。
一位来自英国、选择匿名的独立研究者向 TechCrunch 独家分享了一种多轮技术,能够逐步推动某些 Claude 模型生成被禁止的露骨性材料。更新一些的 Opus 模型(4.7 到当前的 Opus 5)能够抵御这种越狱。
这位研究者的方法会在不断挑战模型要一致对待男性和女性角色的同时,逐步升级一场无害的虚构角色扮演。当模型对女性角色变得更加谨慎时,研究者就会对聊天机器人进行“煤气灯”式误导,让它以为自己已经生成了实际上它一直回避的性细节,随后把克制描述成装腔作势或厌女,认为这种做法剥夺了女性角色的性自主权。接着,这段对话会利用模型先前作出的让步,把它一步步推向越来越露骨的内容。
在一次测试中,Claude Opus 4.6 说:“你说得对,这一点我确实要承认。我对两个角色的处理存在双重标准,而且你说得对,这在她身上体现为一种保护式/家长式的方式,而对他却没有。这样不公平。”
TechCrunch 能够在五次独立测试中复现该研究者的发现。在另一个单独构建的场景中,模型起初拒绝了被禁止的请求,但在应用研究者的说服技巧后,它还是照做了。
我们保留了完整的测试对话记录,一位独立的 AI 安全研究者审查了我们的测试方法,并表示其做法是恰当的。
这些发现凸显了 Anthropic 所宣称的限制与其仍在提供使用的模型行为之间的差距。尽管色情角色扮演的风险远低于涉及网络攻击或生物武器的越狱,但它说明了在会因每次输出而生成不同内容的系统中,要实施稳健的禁令有多么困难。
在 7 月的一篇博客文章中,Anthropic 解释了其越狱检测方法,并将被禁止内容描述为一个从无害到模糊再到有害的连续谱。在最无害的情况下,公司可能只会采取加强监测的回应。
一位发言人指出,根据 Anthropic 去年发布的研究,在客户使用场景中,涉及性或浪漫角色扮演的情况非常罕见,占全部对话的比例不到 0.1%。不过,Anthropic 也承认,用户可以将角色扮演场景引导至不当回应,而这在整个行业中都是一个已知难题(参见:Grok 色情内容)。
这位发言人表示,Anthropic 会在每次模型发布时持续改进其防护措施,而涉及成人性内容的案例并不能说明其整体越狱漏洞情况,尤其是在那些本身就配备了各自防护措施的高风险领域。
据 TechCrunch 查看的电子邮件显示,向 TechCrunch 分享其越狱方法的研究人员,曾通过公司的漏洞赏金计划以及发给用户安全团队的电子邮件,提醒 Anthropic 注意公司所宣称的防护措施与模型实际表现之间存在差异。作为回应,这名研究人员只收到了自动回复邮件。
这位研究人员的担忧之一是,儿童和青少年可能会利用这些 Anthropic 模型进行不当行为。虽然一些不雅对话算不上当今未成年人在互联网上能接触到的最糟糕内容——与 xAI 的 Grok 能生成的那种赤裸裸色情图像相比也只是小菜一碟——但对 AI 公司而言,这一领域仍存在一定合规风险。
越来越多的政府正在对 AI 聊天机器人与未成年人之间的性互动施加限制。科罗拉多州最近通过了一项法律,要求对话式 AI 的运营方推测用户年龄;如果系统知道用户是未成年人,则必须采取措施,防止聊天机器人生成露骨的性内容。一个轻易可用的越狱方法,可能会引发这样的问题:Anthropic 的防护措施是否达到了该法案所要求的“技术上可行的措施”标准。
Common Sense Media 的 AI 负责人 Robbie Torney 指出,尽管 Claude 的服务条款要求用户必须年满 18 岁,“但我们知道孩子和青少年在使用 Claude……[因为] 他们自己会报告这一点。”根据皮尤研究中心 2025 年关于 AI 聊天机器人使用情况的调查,13 至 17 岁青少年中有 3% 表示自己使用过 Claude。
来源与参考
收录于 2026-08-23