DeepMind testa avaliações duplo-cegas de IA de fronteira
O Google DeepMind disse em 27 de agosto que está testando o que chama de primeira avaliação duplo-cega de um modelo de fronteira proprietário: testes externos executados dentro de uma caixa criptográfica do Confidential Space, de modo que os avaliadores não veem os pesos do Gemini e o Google não vê os prompts dos avaliadores. Entre os parceiros estão o Instituto de Segurança de IA de Singapura, a OpenMined, a AVERI e a MLCommons, começando por um modelo Gemini Flash Lite em benchmarks confidenciais. O objetivo é reduzir a contaminação de benchmarks e reforçar a confiança em testes de segurança sensíveis; não é um novo recurso de consumo do Gemini, nem Omni vídeo, nem a corretora de criptomoedas Gemini.
Traduzido com ajuda de IA.