0票
Google、世界初の二重盲検AI評価を試験運用
シンガポール·
DoseFix Editorial複数情報源の統合記事
Google DeepMindは、シンガポールAI安全研究所、OpenMined、AVERI、MLCommonsと協力し、独自のフロンティアクラスAIモデルに対する世界初の二重盲検評価を試験運用しました。この評価では、Google CloudのConfidential Spaceを使用して、外部評価者がモデルの重みを見ることができず、Googleも評価者のテストプロンプトを見ることができない暗号的に安全な環境を作り出します。これにより、モデルが事前にテスト問題を見ていた可能性があるベンチマーク汚染を防ぎ、AIベンチマークの完全性を高めます。パイロットでは、Gemini Flash Liteモデルを機密ベンチマークに対してテストし、安全なモデル評価とAIシステムへの信頼構築における重要な一歩を示しました。
文 自動翻訳 · EN
●シンガポール
⬡
判明していること
Google DeepMindは、プロプライエタリなフロンティアクラスのAIモデルに対する世界初の二重盲検評価を導入しました。
▤ 1 ソース›
パイロットでは、Gemini Flash Liteモデルを機密ベンチマークに対してテストしました。
▤ 1 ソース›
パートナーには、シンガポールAI安全研究所、OpenMined、AVERI、MLCommonsが含まれます。
▤ 1 ソース›
この評価では、暗号学的に安全な環境を使用して、外部評価の機密性を保ちます。
▤ 1 ソース›
この方法は、ベンチマークの汚染を防ぎ、機密データを保護します。
▤ 1 ソース›
ソースの透明性
GD任意のソースを開いて、原文言語、DoseFixが受信した日時、裏付けとなる主張を確認できます。
Google DeepMind Blog
独立↗Piloting the world's first double-blind AI evaluations
deepmind.google · EN · 公開 · 受信日時ライブレポート
すべて見る二重盲検AI評価の開発ローカルボイス · シンガポール
検証済み›コメント 0
この出来事を保存されるスレッドで議論できます。ライブチャットとは別です。
まだコメントはありません。会話を始めましょう。