Google, 세계 최초 이중 맹검 AI 평가 시범 운영
Google DeepMind는 싱가포르 AI 안전 연구소, OpenMined, AVERI 및 MLCommons와 협력하여 독점 프론티어급 AI 모델에 대한 세계 최초의 이중 맹검 평가를 시범 운영했습니다. 평가는 Google Cloud의 Confidential Space를 사용하여 외부 평가자가 모델 가중치를 볼 수 없고 Google이 평가자의 테스트 프롬프트를 볼 수 없는 암호화된 안전 환경을 만듭니다. 이는 모델이 사전에 테스트 질문을 보았을 수 있는 벤치마크 오염을 방지하고 AI 벤치마크의 무결성을 향상시킵니다. 파일럿은 기밀 벤치마크에 대해 Gemini Flash Lite 모델을 테스트하여 안전한 모델 평가와 AI 시스템에 대한 신뢰 구축에 중요한 진전을 의미합니다.
알려진 사실
Google DeepMind는 독점 프론티어급 AI 모델에 대한 세계 최초의 이중 맹검 평가를 도입했습니다.
▤ 1 소스›
파일럿에서는 Gemini Flash Lite 모델을 기밀 벤치마크에 대해 테스트했습니다.
▤ 1 소스›
파트너로는 싱가포르 AI 안전 연구소, OpenMined, AVERI, MLCommons가 포함됩니다.
▤ 1 소스›
이 평가는 외부 평가의 기밀성을 유지하기 위해 암호학적으로 안전한 환경을 사용합니다.
▤ 1 소스›
이 방법은 벤치마크 오염을 방지하고 민감한 데이터를 보호합니다.
▤ 1 소스›
소스를 열어 원어, DoseFix가 수신한 시기, 그리고 지지하는 주장을 확인하세요.
Piloting the world's first double-blind AI evaluations
deepmind.google · EN · 게시 · 수신됨라이브 보도
모두 보기댓글 0
지속되는 스레드에서 이 사건을 토론하세요. 실시간 채팅과는 별도입니다.
아직 댓글이 없습니다. 대화를 시작하세요.