Google teste les premières évaluations d'IA en double aveugle au monde
Google DeepMind, en partenariat avec l'Institut de sécurité de l'IA de Singapour, OpenMined, AVERI et MLCommons, a piloté la première évaluation en double aveugle au monde d'un modèle d'IA propriétaire de classe frontière. L'évaluation utilise l'espace confidentiel de Google Cloud pour créer un environnement cryptographiquement sécurisé où les évaluateurs externes ne peuvent pas voir les poids du modèle et Google ne peut pas voir les invites de test des évaluateurs. Cela empêche la contamination des benchmarks, où les modèles pourraient avoir vu les questions de test à l'avance, et améliore l'intégrité des benchmarks d'IA. Le pilote a testé un modèle Gemini Flash Lite par rapport à des benchmarks confidentiels, marquant une étape importante dans l'évaluation sécurisée des modèles et renforçant la confiance dans les systèmes d'IA.
Ce que nous savons
Google DeepMind a introduit la première évaluation en double aveugle au monde d'un modèle d'IA propriétaire de classe frontière.
▤ 1 sources›
Le pilote a testé un modèle Gemini Flash Lite par rapport à des benchmarks confidentiels.
▤ 1 sources›
Les partenaires incluent le Singapore AI Safety Institute, OpenMined, AVERI et MLCommons.
▤ 1 sources›
L'évaluation utilise des environnements cryptographiquement sécurisés pour garder les évaluations externes confidentielles.
▤ 1 sources›
La méthode empêche la contamination des benchmarks et protège les données sensibles.
▤ 1 sources›
Ouvrez une source pour vérifier sa langue, quand DoseFix l’a reçue et les affirmations soutenues.
Piloting the world's first double-blind AI evaluations
deepmind.google · EN · Publié · ReçuRapports en direct
Tout voirCommentaires 0
Discutez de cet événement dans des fils persistants. Le direct reste séparé.
Aucun commentaire. Lancez la discussion.