Google testa primeiras avaliações de IA duplo-cegas do mundo
O Google DeepMind, em parceria com o Singapore AI Safety Institute, OpenMined, AVERI e MLCommons, testou a primeira avaliação duplo-cega do mundo de um modelo de IA proprietário de classe de fronteira. A avaliação usa o Confidential Space do Google Cloud para criar um ambiente criptograficamente seguro onde avaliadores externos não podem ver os pesos do modelo e o Google não pode ver os prompts de teste dos avaliadores. Isso evita a contaminação de benchmark, onde os modelos podem ter visto as perguntas do teste com antecedência, e aumenta a integridade dos benchmarks de IA. O piloto testou um modelo Gemini Flash Lite contra benchmarks confidenciais, marcando um passo significativo na avaliação segura de modelos e na construção de confiança em sistemas de IA.
O que sabemos
O Google DeepMind apresentou a primeira avaliação duplo-cega do mundo de um modelo de IA proprietário de classe de fronteira.
▤ 1 fontes›
O piloto testou um modelo Gemini Flash Lite contra benchmarks confidenciais.
▤ 1 fontes›
Os parceiros incluem o Singapore AI Safety Institute, OpenMined, AVERI e MLCommons.
▤ 1 fontes›
A avaliação usa ambientes criptograficamente seguros para manter as avaliações externas confidenciais.
▤ 1 fontes›
O método previne a contaminação de benchmarks e protege dados sensíveis.
▤ 1 fontes›
Abra qualquer fonte para inspecionar seu idioma original, quando o DoseFix a recebeu e as afirmações que ela apoia.
Piloting the world's first double-blind AI evaluations
deepmind.google · EN · Publicado · RecebidoRelatos ao vivo
Ver tudoComentários 0
Discuta este evento em tópicos permanentes. O chat ao vivo permanece separado.
Ainda não há comentários. Inicie a conversa.