Tech Shots
Noticias de IA y robótica
Español
Modelos

DeepMind prueba evaluaciones doble ciego de IA de frontera

Google DeepMind dijo el 27 de agosto que está probando lo que llama la primera evaluación doble ciego de un modelo de frontera propietario: pruebas externas ejecutadas dentro de una caja criptográfica de Confidential Space, de modo que los evaluadores no pueden ver los pesos de Gemini y Google no puede ver los prompts de los evaluadores. Entre los socios figuran el Instituto de Seguridad de IA de Singapur, OpenMined, AVERI y MLCommons, empezando con un modelo Gemini Flash Lite sobre benchmarks confidenciales. El objetivo es reducir la contaminación de benchmarks y reforzar la confianza en pruebas de seguridad sensibles; no es una nueva función de consumo de Gemini, ni Omni video, ni el exchange de criptomonedas Gemini.

Fuente: Google DeepMind

Traducido con ayuda de IA.