Google pone a prueba las primeras evaluaciones de IA de doble ciego del mundo
Google DeepMind, en colaboración con el Instituto de Seguridad de IA de Singapur, OpenMined, AVERI y MLCommons, ha puesto a prueba la primera evaluación de doble ciego del mundo de un modelo de IA fronteriza propietario. La evaluación utiliza el Espacio Confidencial de Google Cloud para crear un entorno criptográficamente seguro donde los evaluadores externos no pueden ver los pesos del modelo y Google no puede ver las indicaciones de prueba de los evaluadores. Esto previene la contaminación de los puntos de referencia, donde los modelos podrían haber visto las preguntas de prueba con anticipación, y mejora la integridad de los puntos de referencia de IA. La prueba evaluó un modelo Gemini Flash Lite contra puntos de referencia confidenciales, marcando un paso significativo en la evaluación segura de modelos y generando confianza en los sistemas de IA.
Lo que sabemos
Google DeepMind ha presentado la primera evaluación de doble ciego del mundo de un modelo de IA propietario de clase fronteriza.
▤ 1 fuentes›
El piloto probó un modelo Gemini Flash Lite contra puntos de referencia confidenciales.
▤ 1 fuentes›
Los socios incluyen el Instituto de Seguridad de IA de Singapur, OpenMined, AVERI y MLCommons.
▤ 1 fuentes›
La evaluación utiliza entornos criptográficamente seguros para mantener confidenciales las evaluaciones externas.
▤ 1 fuentes›
El método previene la contaminación de los puntos de referencia y protege datos sensibles.
▤ 1 fuentes›
Abre cualquier fuente para revisar su idioma original, cuándo la recibió DoseFix y las afirmaciones que respalda.
Piloting the world's first double-blind AI evaluations
deepmind.google · EN · Publicado · RecibidoReportes en vivo
Ver todoComentarios 0
Debate este evento en hilos permanentes. El chat en vivo es independiente.
Aún no hay comentarios. Inicia la conversación.