0票数
谷歌试点全球首个双盲AI评估
新加坡·
DoseFix Editorial多来源综合报道
谷歌DeepMind与新加坡AI安全研究所、OpenMined、AVERI和MLCommons合作,试点运行了全球首个专有前沿级AI模型的双盲评估。该评估使用谷歌云的Confidential Space创建一个加密安全环境,外部评估者无法看到模型权重,谷歌也无法看到评估者的测试提示。这防止了基准污染(即模型可能提前看到测试问题),并增强了AI基准的完整性。试点测试了Gemini Flash Lite模型,针对保密基准进行,标志着安全模型评估和建立AI系统信任的重要一步。
文 自动翻译 · EN
●新加坡
⬡
已知信息
Google DeepMind 推出了全球首个对专有前沿级 AI 模型的双盲评估。
▤ 1 来源›
试点项目针对 Gemini Flash Lite 模型进行了机密基准测试。
▤ 1 来源›
合作伙伴包括新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons。
▤ 1 来源›
该评估使用加密安全环境来保持外部评估的机密性。
▤ 1 来源›
该方法防止基准污染并保护敏感数据。
▤ 1 来源›
来源透明
GD打开任何来源以查看其原始语言、DoseFix接收时间及其支持的声明。
Google DeepMind Blog
独立↗Piloting the world's first double-blind AI evaluations
deepmind.google · EN · 发布于 · 接收时间实时报道
查看全部双盲 AI 评估的开发本地声音 · 新加坡
已核实›评论 0
在长期保留的讨论串中讨论此事件;实时聊天保持独立。
暂无评论,来发起讨论吧。