Google menguji coba evaluasi AI double-blind pertama di dunia
Google DeepMind, bekerja sama dengan Singapore AI Safety Institute, OpenMined, AVERI, dan MLCommons, telah menguji coba evaluasi double-blind pertama di dunia dari model AI kelas frontier proprietary. Evaluasi ini menggunakan Confidential Space dari Google Cloud untuk menciptakan lingkungan yang aman secara kriptografis di mana evaluator eksternal tidak dapat melihat bobot model dan Google tidak dapat melihat prompt tes evaluator. Ini mencegah kontaminasi benchmark, di mana model mungkin telah melihat pertanyaan tes sebelumnya, dan meningkatkan integritas benchmark AI. Uji coba ini menguji model Gemini Flash Lite terhadap benchmark rahasia, menandai langkah signifikan dalam evaluasi model yang aman dan membangun kepercayaan pada sistem AI.
Yang kita tahu
Google DeepMind telah memperkenalkan evaluasi double-blind pertama di dunia untuk model AI kelas frontier yang bersifat proprietary.
▤ 1 sumber›
Pilot menguji model Gemini Flash Lite terhadap benchmark rahasia.
▤ 1 sumber›
Mitra termasuk Singapore AI Safety Institute, OpenMined, AVERI, dan MLCommons.
▤ 1 sumber›
Evaluasi ini menggunakan lingkungan yang aman secara kriptografis untuk menjaga kerahasiaan evaluasi eksternal.
▤ 1 sumber›
Metode ini mencegah kontaminasi benchmark dan melindungi data sensitif.
▤ 1 sumber›
Google DeepMind, bersama mitra, memperkenalkan evaluasi double-blind pertama untuk model AI frontier proprietary, menggunakan lingkungan kriptografis untuk mencegah kontaminasi benchmark.
Terverifikasi · 1 sumberLaporan langsung
Lihat semuaKomentar 0
Diskusikan peristiwa ini dalam utas permanen. Obrolan langsung tetap terpisah.
Belum ada komentar. Mulai percakapan.