DeepMind试点双盲AI模型评测
Google DeepMind News··作者 William Isaac, Sol Messing and Kristian Lum
关键信息
DeepMind将这一系统描述为一个密码学“盒子”,可防止外部评测材料在之后被重复利用来优化模型表现。公司还表示,虽然仍会使用内部测试,但也依赖外部合作伙伴来进行压力测试,发现内部评测可能忽略的盲点。
资讯摘要
DeepMind表示,它正在试点世界上首次针对专有前沿级AI模型的双盲评测。公司把这一问题比作学生提前看到了考试题目:如果模型事先接触过测试问题,那么分数就不再能干净地反映真实能力。DeepMind称,这种新方法把外部评测限制在一个密码学安全环境中,因此提示词和基准内容不能在之后被拿去调优或优化模型。此次试点使用的是一个Gemini Flash Lite模型和保密基准,并与新加坡AI安全研究院、OpenMined、AVERI和MLCommons合作开展。
DeepMind表示,它在模型开发和部署过程中已经使用了多种内部评测,但不会只依赖内部测试。公司还与外部研究实验室、公民社会组织以及国家级AI安全与安全研究机构合作,以发现内部评测可能遗漏的盲点。随着模型能力不断增强,DeepMind认为必须确保模型在评测前没有见过题目,这对建立可信的基准测试至关重要。公司还指出,尽管零日志和严格合同条款长期以来一直用于保护测试提示词的机密性,但加入技术和密码学保障,标志着安全模型评测向前迈出了重要一步。
资讯正文
通过加密安全环境为专有模型基准测试建立信任
设想一名学生要参加一场高风险考试。如果他不小心提前看到了试题,那么即便最后拿到满分,这个成绩也会受到已知题目影响,因此毫无意义。要真正衡量他知道多少,就必须在考试开始前完全看不到试题。这正是行业在评估先进 AI 模型时面临的挑战。如果某个模型已经见过测试题——这一问题被称为基准污染——那么评测结果就只能在一定程度上被信任。
今天,我们推出了全球首个针对专有、前沿级 AI 模型的双盲评估,该评估将外部测试限制在一个加密“盒子”中,使这些测试结果之后无法被模型用于在测试前优化性能。我们正与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在一个保护隐私的环境中,用机密基准测试 Gemini Flash Lite 模型,从而提高评测的完整性。
在 Google,我们在模型开发和部署的整个过程中,使用广泛的评估来衡量我们的 AI 系统,但我们并不只依赖内部测试。为了识别潜在的盲点,我们与多样化的外部合作伙伴合作,包括专门研究实验室、公民社会组织以及国家级 AI Safety and Security Institutes(AISIs),借助他们独特的专业能力对我们的模型进行压力测试。
随着 AI 模型能力越来越强,确保模型事先没有见过测试题或提示词至关重要,因为这会扭曲结果。政策制定者、研究人员和企业都需要相信,AI 基准测试能够准确反映模型真实的能力与安全性;但如果模型能够提前“偷看”评估题目,就可能人为抬高分数,并破坏这种信任。
尽管零日志协议和严格的合同保障长期以来一直能让外部测试提示词保持机密,但引入技术和加密层面的保障,标志着安全模型评估向前迈出了重要一步。
双盲评估如何运作
来源与参考
收录于 2026-08-28