Google pilotiert weltweit erste Doppelblind-KI-Bewertungen
Google DeepMind hat in Zusammenarbeit mit dem Singapore AI Safety Institute, OpenMined, AVERI und MLCommons die weltweit erste Doppelblind-Bewertung eines proprietären Frontier-KI-Modells pilotiert. Die Bewertung nutzt Google Cloud's Confidential Space, um eine kryptografisch sichere Umgebung zu schaffen, in der externe Bewerter die Modellgewichte nicht sehen können und Google die Test-Prompts der Bewerter nicht sehen kann. Dies verhindert Benchmark-Kontamination, bei der Modelle Testfragen im Voraus gesehen haben könnten, und erhöht die Integrität von KI-Benchmarks. Der Pilot testete ein Gemini Flash Lite Modell gegen vertrauliche Benchmarks und markiert einen bedeutenden Schritt in der sicheren Modellbewertung und dem Aufbau von Vertrauen in KI-Systeme.
Was wir wissen
Google DeepMind hat die weltweit erste Doppelblind-Bewertung eines proprietären KI-Modells der Spitzenklasse eingeführt.
▤ 1 Quellen›
Der Pilot testete ein Gemini Flash Lite Modell gegen vertrauliche Benchmarks.
▤ 1 Quellen›
Zu den Partnern gehören das Singapore AI Safety Institute, OpenMined, AVERI und MLCommons.
▤ 1 Quellen›
Die Bewertung verwendet kryptographisch sichere Umgebungen, um externe Bewertungen vertraulich zu halten.
▤ 1 Quellen›
Die Methode verhindert Benchmark-Kontamination und schützt sensible Daten.
▤ 1 Quellen›
Google DeepMind führt mit Partnern die erste Doppelblind-Bewertung eines proprietären KI-Modells der Spitzenklasse ein, wobei kryptographische Umgebungen verwendet werden, um Benchmark-Kontamination zu verhindern.
Verifiziert · 1 QuellenLive-Berichte
Alle ansehenKommentare 0
Diskutiere dieses Ereignis in dauerhaften Threads. Der Live-Chat bleibt getrennt.
Noch keine Kommentare. Starte die Diskussion.