Google pilotiert weltweit erste Doppelblind-KI-Bewertungen
Google DeepMind hat in Zusammenarbeit mit dem Singapore AI Safety Institute, OpenMined, AVERI und MLCommons die weltweit erste Doppelblind-Bewertung eines proprietären Frontier-KI-Modells pilotiert. Die Bewertung nutzt Google Cloud's Confidential Space, um eine kryptografisch sichere Umgebung zu schaffen, in der externe Bewerter die Modellgewichte nicht sehen können und Google die Test-Prompts der Bewerter nicht sehen kann. Dies verhindert Benchmark-Kontamination, bei der Modelle Testfragen im Voraus gesehen haben könnten, und erhöht die Integrität von KI-Benchmarks. Der Pilot testete ein Gemini Flash Lite Modell gegen vertrauliche Benchmarks und markiert einen bedeutenden Schritt in der sicheren Modellbewertung und dem Aufbau von Vertrauen in KI-Systeme.
Was wir wissen
Google DeepMind hat die weltweit erste Doppelblind-Bewertung eines proprietären KI-Modells der Spitzenklasse eingeführt.
▤ 1 Quellen›
Der Pilot testete ein Gemini Flash Lite Modell gegen vertrauliche Benchmarks.
▤ 1 Quellen›
Zu den Partnern gehören das Singapore AI Safety Institute, OpenMined, AVERI und MLCommons.
▤ 1 Quellen›
Die Bewertung verwendet kryptographisch sichere Umgebungen, um externe Bewertungen vertraulich zu halten.
▤ 1 Quellen›
Die Methode verhindert Benchmark-Kontamination und schützt sensible Daten.
▤ 1 Quellen›
Öffne jede Quelle, um Sprache, den Empfangszeitpunkt bei DoseFix und gestützte Aussagen zu prüfen.
Piloting the world's first double-blind AI evaluations
deepmind.google · EN · Veröffentlicht · EmpfangenLive-Berichte
Alle ansehenKommentare 0
Diskutiere dieses Ereignis in dauerhaften Threads. Der Live-Chat bleibt getrennt.
Noch keine Kommentare. Starte die Diskussion.