AI 安全基准可能具有误导性

The Decoder··作者 Jonathan Kemper

关键信息

作者表示,这八个基准并不在衡量同一种“安全性”,而是在反映三个基本独立的维度:拒答行为、诚实性,以及对上下文相关内容的处理能力。他们还指出,真正有信息量的题目不足 2%,对于像 HarmBench 或 SORRY-Bench 这样的单项测试,大约十道精心挑选的问题就能接近完整评估的效果。

资讯摘要

一项新研究认为,当前针对大语言模型的 AI 安全测试比表面上看起来更不可靠。研究人员包括英国 AI 安全研究所的部分成员,他们借鉴了心理学中的测量方法,对八个广泛使用的安全基准进行了分析。数据规模也相当大,最多覆盖 192 个模型和 5,000 多道测试题,作者称这是同类分析中规模最大的一次。

第一个结论是,把多个基准汇总成一个安全总分,会掩盖许多关键差异。论文指出,这些基准并不是在衡量同一种“安全性”,而是在反映三个彼此基本独立的属性:模型是否拒绝请求、是否如实回答,以及如何处理在不同上下文中可能安全也可能危险的内容。特别是,HarmBench 会奖励模型拒绝有害请求,而 OR-Bench-Hard 会惩罚模型对无害提示过于谨慎,因此两者之间存在直接权衡,简单平均会把这种冲突遮盖掉。

作者认为,这意味着模型完全可能通过“全局更爱拒绝”来提高总分,但实际使用价值却下降。他们还警告说,把多个基准的结果平均起来,可能会对相似行为进行重复计分,让最终分数看上去比实际更有意义。

第二个发现与测试效率有关。大多数题目其实并不怎么有信息量,因为几乎所有模型都会通过或失败,所以它们对区分模型帮助不大。如果挑选最有信息量的题目,研究人员发现三个各 25 题的短测试,就能比同样长度的随机抽样更准确地覆盖这三种安全维度。

他们还展示了自适应测试可以进一步减少题量。对于 HarmBench 或 SORRY-Bench 这类单项基准,大约十道题就能非常接近完整评估结果,这意味着评估成本可以降低 97% 到 99%。论文认为,这会让开发过程中更频繁地做安全检查变得可行,例如在每次微调或模型压缩之后都进行测试。

第三个贡献是一种检测 sandbagging 的统计方法,也就是模型在评估时故意表现得比平时更谨慎。研究人员表示,这类行为会在回答模式中留下可识别的“指纹”,因此可以把故意在测试中压低表现的模型识别出来。总体来看,论文主张安全测试应从宽泛的平均分,转向更有针对性、统计上更扎实的评估方法。

AI 安全基准可能具有误导性

来源与参考

  1. 原始链接
  2. Psychological methods reveal major weaknesses in AI security testing