Google test eerste dubbelblinde AI-evaluaties ter wereld
Google DeepMind heeft, in samenwerking met het Singapore AI Safety Institute, OpenMined, AVERI en MLCommons, de eerste dubbelblinde evaluatie ter wereld uitgevoerd van een propriëtair frontier AI-model. De evaluatie maakt gebruik van Google Cloud's Confidential Space om een cryptografisch beveiligde omgeving te creëren waarin externe evaluatoren de gewichten van het model niet kunnen zien en Google de testprompts van de evaluatoren niet kan zien. Dit voorkomt benchmarkvervuiling, waarbij modellen testvragen van tevoren zouden kunnen hebben gezien, en verbetert de integriteit van AI-benchmarks. De pilot testte een Gemini Flash Lite-model tegen vertrouwelijke benchmarks, wat een belangrijke stap markeert in veilige modelevaluatie en het opbouwen van vertrouwen in AI-systemen.
Wat we weten
Google DeepMind heeft 's werelds eerste dubbelblinde evaluatie van een propriëtair AI-model van frontier-klasse geïntroduceerd.
▤ 1 bronnen›
De pilot testte een Gemini Flash Lite-model tegen vertrouwelijke benchmarks.
▤ 1 bronnen›
Partners zijn onder meer het Singapore AI Safety Institute, OpenMined, AVERI en MLCommons.
▤ 1 bronnen›
De evaluatie maakt gebruik van cryptografisch beveiligde omgevingen om externe evaluaties vertrouwelijk te houden.
▤ 1 bronnen›
De methode voorkomt benchmarkvervuiling en beschermt gevoelige gegevens.
▤ 1 bronnen›
Google DeepMind introduceert, met partners, de eerste dubbelblinde evaluatie van een propriëtair frontier AI-model, met behulp van cryptografische omgevingen om benchmarkvervuiling te voorkomen.
Geverifieerd · 1 bronnenLive rapporten
Alles bekijkenReacties 0
Bespreek dit evenement in blijvende threads. Livechat blijft apart.
Nog geen reacties. Begin het gesprek.