Google sperimenta la prima valutazione AI in doppio cieco al mondo
Google DeepMind, in collaborazione con il Singapore AI Safety Institute, OpenMined, AVERI e MLCommons, ha sperimentato la prima valutazione in doppio cieco al mondo di un modello di intelligenza artificiale proprietario di classe frontiera. La valutazione utilizza Google Cloud's Confidential Space per creare un ambiente crittograficamente sicuro in cui i valutatori esterni non possono vedere i pesi del modello e Google non può vedere i prompt di test dei valutatori. Ciò previene la contaminazione dei benchmark, dove i modelli potrebbero aver visto in anticipo le domande di test, e migliora l'integrità dei benchmark di intelligenza artificiale. La sperimentazione ha testato un modello Gemini Flash Lite rispetto a benchmark riservati, segnando un passo significativo nella valutazione sicura dei modelli e nella costruzione della fiducia nei sistemi di intelligenza artificiale.
Cosa sappiamo
Google DeepMind ha introdotto la prima valutazione in doppio cieco al mondo di un modello di intelligenza artificiale proprietario di classe frontier.
▤ 1 fonti›
Il progetto pilota ha testato un modello Gemini Flash Lite rispetto a benchmark riservati.
▤ 1 fonti›
I partner includono il Singapore AI Safety Institute, OpenMined, AVERI e MLCommons.
▤ 1 fonti›
La valutazione utilizza ambienti crittograficamente sicuri per mantenere riservate le valutazioni esterne.
▤ 1 fonti›
Il metodo previene la contaminazione dei benchmark e protegge i dati sensibili.
▤ 1 fonti›
Apri qualsiasi fonte per ispezionare la lingua originale, quando DoseFix l'ha ricevuta e le affermazioni che supporta.
Piloting the world's first double-blind AI evaluations
deepmind.google · EN · Pubblicato · RicevutoReport live
Vedi tuttoCommenti 0
Discuti l’evento in thread permanenti. La chat dal vivo resta separata.
Nessun commento. Inizia la conversazione.