Tech Shots
AI与机器人快讯
中文
模型

DeepMind 试点前沿 AI 双盲评估

Google DeepMind 于 8 月 27 日表示,正在试点其所称的首个针对专有前沿模型的双盲评估:外部测试在加密的 Confidential Space 环境中运行,评估方看不到 Gemini 权重,谷歌也看不到评估方的提示词。合作伙伴包括新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,首先在保密基准上测试一个 Gemini Flash Lite 模型。目标是减少基准污染,并增强对敏感安全测试的信任;这不是 Gemini 的新消费级功能,不是 Omni 视频,也不是 Gemini 加密货币交易所。

来源: Google DeepMind

由 AI 辅助翻译。