
AI基准正在遭遇一场“开卷考试”危机:模型可能在训练阶段看过题目,供应商也可能根据外部评测定向优化。Google DeepMind启动面向专有前沿模型的双盲评测试点,让模型方看不到测试提示,评测方也看不到模型权重,双方只在经过密码学验证的隔离环境中完成运行。
如果研究机构把完整测试集交给模型公司,题目可能进入日志、调试或后续训练,下一版模型的高分就难以判断是真能力还是见过答案。如果模型公司交出权重,核心知识产权和安全控制又会暴露。保密协议与零日志能降低风险,却仍主要依赖组织承诺。
双盲方案把这个信任关系改成技术约束。测试数据和专有模型分别由所有者加密提交,在Confidential Space的GPU隔离环境内运行。远程证明用于确认执行的是约定代码和配置,评测者无法读取Gemini权重,Google也无法查看原始测试提示,最终只释放允许的结果。
典型流程中,双方先约定评测容器、模型版本、输入输出字段和允许导出的统计量,再分别核验机密环境的证明。只有证明匹配,密钥才会释放给受保护的工作负载。运行结束后,原始输入、权重和中间状态不应被带出,外部获得的是聚合分数、失败类别或经过约束的样本摘要,而不是另一方的完整资产。
Google DeepMind与新加坡AI安全研究机构、OpenMined、AVERI和MLCommons合作,用保密基准测试Gemini Flash Lite。不同伙伴分别提供评测方法、隐私技术和标准化经验,目标是让外部机构在不牺牲数据主权的前提下,独立压力测试专有模型。
对企业,这种模式同样适用于不能离开内网的合同、客服记录、医疗样本或安全事件。采购方可以用真实但脱敏后的任务检验供应商模型,又不必把完整业务样本交给对方。模型供应商则能接受严格测试,而不需要交付权重或开放内部推理系统。
这会改变模型采购中的证据结构。过去供应商带着公开榜单和演示进入会议室,客户很难用真实数据反驳;双盲环境允许双方在不交换核心资产的前提下,用客户自己的高价值任务比较模型、版本和安全配置,验收结果也能与具体运行证明绑定。
隔离环境能证明双方没有直接看到对方资产,却不能证明题目本身代表真实工作,也不能自动消除数据偏差、评分器波动和样本泄漏到其他渠道。若测试集早已公开传播,或评价指标只看答案而不看工具轨迹,双盲仍可能得到一份精确但无用的分数。
这也只是早期试点,目前围绕一个Gemini Flash Lite模型展开。机密计算的性能开销、GPU支持、可重复性、故障排查和第三方审计还需要更多数据。企业若把全部判断押在一次密封评测上,仍可能忽略延迟、成本、权限拒绝和线上漂移。
FDE团队可以借鉴双盲思路,把高价值验收集与日常开发数据分开。题库应记录来源、版本、哈希、适用范围和负责人,开发人员只能看到任务结构,不能看到全部答案;上线门槛则同时包含正确率、工具轨迹、人工介入率、P95延迟和单位成功任务成本。
每次模型升级都在同一隔离流程里复测,结果与环境证明一并归档;出现低分时,可通过最小化失败样本进入受控调试区,而不是把整套题库倒回训练管线。安全、业务和平台团队还要共同决定哪些结果可导出、谁能解锁失败样本,以及题库多久轮换一次,防止“保密基准”逐渐变成人人都看过的练习册。
Google的试点还没有给行业一把万能尺,却把一个重要原则落成了工程:真正可信的评测,不应要求任何一方先交出最敏感的资产。只有把题库、模型和执行环境都纳入可验证的控制面,企业才有可能把采购演示升级为可复核的生产验收。
