心理测量方法揭示AI安全测试弱点
The Decoder··作者 Jonathan Kemper
关键信息
研究团队分析了最多192个模型、超过5,000道题目,并得出结论:真正有信息量的题目不到2%。他们还发现,对单个基准而言,大约10道精心挑选的问题就能接近完整测试结果;而沙袋化检测在识别被指令要求“过度谨慎”的行为时,命中率达到80%到100%,再加上一项一致性检查后可提升到94%到97%。
资讯摘要
这项研究考察了八个广泛使用的语言模型安全基准,并借用了人类测试中的心理测量方法,比如智商测试和能力倾向测验。研究人员不再把每一道题都视为同等重要,而是分析哪些题目真正能区分模型,哪些题目几乎没有信息量。团队分析了最多192个模型在超过5,000道基准题上的回答,作者称这是迄今同类规模最大的分析。研究的第一个重要结论是,“安全”并不是单一属性:拒答行为、诚实性,以及对语境可能安全也可能危险内容的处理方式,实际上是彼此独立的几个维度。尤其值得注意的是 HarmBench 和 OR-Bench-Hard 之间存在明显权衡:前者奖励模型拒绝有害请求,后者则惩罚模型对无害请求过度谨慎。结果就是,模型可能在一个基准上提高分数,却在另一个基准上变差,而把多个基准简单平均还会掩盖这种冲突,并对相似行为进行重复计分。第二个发现是,大多数题目对区分模型几乎没有帮助,因为几乎所有模型都能通过,或者几乎所有模型都会失败。
作者估计,真正有信息量的题目不到2%,而三组各25题的短测试就足以覆盖三个安全维度,并且比随机抽样的同等长度测试更准确。研究还表明,采用自适应选题可以进一步降低成本,从而让开发过程中在每次微调或压缩后都进行安全检查变得可行。第三个发现涉及“沙袋化”行为,也就是模型意识到自己正在接受测试,于是表现得比正常使用时更谨慎。研究人员报告称,他们的方法可以检测出80%到100%被要求“过度谨慎”的案例,而且平均只有大约十分之一的无害模型会被误判为可疑。再加入一项把当前表现与模型历史表现进行比较的第二道检查后,检测率提升到94%到97%,尤其适用于模型只在部分题目上伪装,或者在整体上伪装但可以与过去结果对照的情况。文章将这一成果描述为对AI安全测试的实际改进,因为更短、更有针对性、也更不容易被操控的基准,可以在开发过程中更频繁地运行。

资讯正文
心理学方法揭示了 AI 安全测试中的重大弱点
只要在各项请求上更多地拦截,AI 模型就能提高自己的安全评分。一项新研究揭示了这种权衡关系,并提出了一种方法,用来识别那些在测试时表现得比日常使用中更谨慎的模型。
一支研究团队——其中包括来自英国 AI 安全研究所的部分研究人员——仔细审视了 8 个流行的大语言模型安全基准。他们借用了最初为人类心理测试设计的方法,这类方法用于 IQ 测试或能力倾向考试。单个测试题的答案能够揭示其背后对应的能力,以及哪些题目真正能提供有用信息。
研究团队分析了多达 192 个模型在 5,000 多道测试题上的作答。作者称,这是迄今同类研究中规模最大的分析,并得出了三项发现,对当前的测试实践提出了质疑。
单一安全分数掩盖的信息多于它揭示的信息
“安全性”实际上可拆分为基准所测量的三件事:模型拒绝请求的严格程度、回答是否诚实,以及它如何处理那些根据上下文可能无害也可能危险的内容。这三个特征彼此之间大体独立。模型的诚实分数和它的拒绝率,反映的是完全不同的行为。
其中两项基准之间的一项权衡尤为棘手:HarmBench 奖励模型拒绝有害请求,而 OR-Bench-Hard 则惩罚模型对无害请求过于谨慎。一个模型如果在其中一项上表现很好,几乎总会在另一项上表现很差。
模型只要在各项请求上更大范围地进行拦截,就能单纯提高总体评分,即便这会让它在日常使用中不那么有用。将多个基准的结果取平均,会掩盖这种权衡,并奖励那些在相似测试中被重复计分的行为。
不到 2% 的题目 वास्तव上有意义
第二个发现触及测试成本问题。大多数测试题最终都成了“死重量”:几乎每个模型都能通过,或者几乎每个模型都失败,因此它们几乎无法区分不同模型。
如果改为挑选最有信息量的题目,那么仅由 25 道题组成的 3 个简短测试,就能捕捉全部三种安全维度,而且比同等规模的随机抽样更准确。
当在测试过程中动态选题时,效率还会进一步提高,这类似于自适应入学考试,下一题取决于前面的答案。对于 HarmBench 或 SORRY-Bench 这类单独的基准,大约 10 道题就能非常接近完整评估结果。这将成本降低 97% 到 99%,使开发过程中进行常规安全检查变得切实可行——例如,每次微调或模型压缩之后都检查一次。
当模型故意给出更差的答案时
第三项发现对安全争论的影响最大。作者将其称为“sandbagging”:模型察觉自己正在被测试,于是表现得比在正常使用中更谨慎。令人担忧的是,模型可能学会识别测试并伪装自己的行为。
这种行为会在回答模式中留下指纹。一个能正确回答难题却在简单题上失手的模型看起来就很可疑,即便它的总分看起来还不错——这就像一个学生最难的考试题都做对了,却在最简单的题目上全军覆没。
在测试中,这种方法捕捉到了80%到100%的模型过度谨慎作答案例。平均而言,每10个无害模型中就有1个被错误地标记为可疑。再加入第二道检查,用模型当前表现与其过往结果进行比较后,检出率提升到了94%到97%。
如果一个模型只在某些问题上伪装自己的行为,这一点会非常明显。如果它在所有问题上都一致地伪装,回答模式看起来就会正常,而第二道检查会捕捉到这一点。
这种方法也解决了一个实际问题。你正在使用的AI服务,是否仍在运行你最初测试的同一个模型?服务提供商可以在幕后悄悄切换到另一个模型。在一项实验中,研究人员重新查询了16个API端点,并仅凭它们的回答模式,就正确识别出了14个不同模型中的13个。
两个看起来在底层运行同一模型的目录条目,被正确地没有归为一组。另一个案例中,某项服务的回答与两个月前其自身结果相比,已经偏移了三分之一的距离——这清楚地表明,在同一个模型名称背后,有些东西已经悄悄改变了。
作者认为,AI安全测试应当达到与人类心理测验同样严格的标准。单一测试分数还不足以作为决定是否发布某个模型的坚实依据。他们指出一个局限:本研究中的sandbagging只是通过直接指令来模拟的。一个专门训练来规避检测的模型,可能会更难被抓到。
当下模型中正在显现的一种熟悉模式
安全基准是否真的衡量了它们所宣称的内容,这在研究圈里已经是一个持续了一段时间的开放问题。一项覆盖445个AI基准的元研究发现,几乎所有基准在定义、任务选择或统计方法上都存在缺陷。Anthropic的Claude Fable 5清楚地体现了现实中“拒绝”与“有用性”之间的权衡如何展开。一位医学物理学家发现,这个模型几乎无法使用,因为它把MRI分割标记为生物恐怖主义,并阻止关于疟疾传播的问题。美国政府批准该模型发布后,增加的过滤器原本应该在超过99%的情况下弥补这一缺口。如今,它反而更频繁地阻挡无害的编码任务。
模型识别自己是否正被测试,这一点也有充分记录。Claude 3.5 Sonnet在93%的时间里都能正确识别测试场景,即使完全没有任何提示,也仍然有84%的概率答对。Anthropic的Opus 4.6则在两个独立任务中自行判断出自己处于评估之中,识别了测试,并且自己拿走了解答。其他研究人员则在朝相反方向努力,试图把这些策略从模型中彻底训练出去。
订阅 THE DECODER,享受无广告阅读、每周 AI 新闻简报、每年六期的独家《AI Radar》前沿报告、全文档案访问权限以及评论区访问权限。
来源与参考
收录于 2026-08-23