Google试点双盲AI基准评测
The Decoder··作者 Maximilian Schreiner
关键信息
Google 表示,这项试点使用了 Google Cloud 机密计算产品中的 Confidential Space,以加密方式验证外部评测数据和专有模型都只对各自所有者可见。公司将其描述为一种避免旧有取舍的方法:要么向厂商暴露提示词,要么向评测方暴露模型权重。
资讯摘要
Google DeepMind 表示,AI 基准测试之所以存在信任问题,是因为模型可能在评测前就已经见过测试题目,从而出现基准污染。若发生这种情况,即使分数很高,也未必能真实反映模型能力,因为模型可能已经在训练阶段接触过这些题目。为了解决这个问题,DeepMind 说它正在启动首个针对专有前沿 AI 模型的双盲评测。此次试点中,Gemini Flash Lite 系列中的一个模型正在接受机密基准测试。该评测的设计目标是把外部测试数据锁在加密“盒子”里,避免模型后来专门针对这些题目进行优化。
DeepMind 表示,该方案使用了 Google Cloud 机密计算产品中的 Confidential Space,从加密层面证明评测方看不到 Gemini 的权重,而 Google 也看不到测试提示词。公司认为,这比以往仅靠零日志协议和合同保密条款的做法更进一步。Google 还表示,这种方法对网络安全或政府机构执行的高敏感度评测尤其有价值,因为独立机构可以在不放弃数据主权和安全性的前提下测试先进模型。DeepMind 认为,这一做法有望成为模型监管的新标准,并让 AI 评测结果更可靠、更值得信任。

资讯正文
AI基准测试存在信任问题,Google想要解决它
Google DeepMind 想用一种密码学方法,阻止 AI 模型提前看到测试题。与新加坡 AI Safety Institute 及其他合作伙伴开展的一项试点项目,正在对 Gemini 模型进行双盲测试。
如果答题者提前知道题目,即便考满分也毫无意义。Google DeepMind 用这个形象化的说法来描述评估 AI 模型时的一个核心问题:基准污染。如果一个模型在训练过程中已经见过测试题,那么你就只能在有限程度上相信测试结果。
为防止这种情况,Google DeepMind 表示,它正在启动首个针对专有前沿 AI 模型的双盲评估。外部测试会被锁在一个密码学“盒子”里,这样模型之后就无法利用这些题目,专门针对测试进行优化。
在这项试点中,Google 正在用 Gemini Flash Lite 系列中的一个模型对保密基准进行测试。
这种方法要解决的取舍
DeepMind 表示,以前进行高度敏感的外部评估时,往往需要在两种方案中作出妥协:要么评估方交出测试提示词,让模型提供方提前看到题目;要么提供方交出模型权重,并冒着知识产权泄露的风险。最近的一个例子是 Anthropic 的 Fable 5 在 ARC-AGI 基准上的延迟评估,因为这家 AI 公司对其最强模型实行 30 天的数据保留政策。
双盲评估的目的就是消除这种取舍。Google 通过 Google Cloud 的机密计算产品组合中的 Confidential Space 来实现这一点。该设置会以密码学方式验证外部测试数据和模型都只对各自所有者保持私密。评估方永远看不到 Gemini 的权重,Google 也永远看不到测试提示词。
到目前为止,零日志协议和合同保障一直用于保持外部提示词的机密性。公司表示,增加技术和密码学保护是安全模型评估向前迈出的重要一步。
为什么这对敏感领域最重要
这种密码学证明旨在防止污染并保护敏感数据。DeepMind 表示,这对高度敏感的评估最为重要,例如网络安全,或者由政府机构开展的测试。独立组织可以在不放弃数据主权或安全性的前提下,对先进模型进行严格测试。
Google 希望这一努力能为模型监督树立新标准,并帮助行业构建更可靠、更值得广泛信任的 AI 系统。Google 在一份技术报告中详细说明了方法和结果。
来源与参考
收录于 2026-08-29