Tech Shots
Notizie su IA e robotica
Italiano
Modelli

DeepMind sperimenta valutazioni in doppio cieco dell'IA di frontiera

Il 27 agosto Google DeepMind ha dichiarato di sperimentare quella che definisce la prima valutazione in doppio cieco di un modello di frontiera proprietario: test esterni eseguiti all'interno di un ambiente crittografico Confidential Space, così i valutatori non vedono i pesi di Gemini e Google non vede i prompt dei valutatori. Tra i partner ci sono il Singapore AI Safety Institute, OpenMined, AVERI e MLCommons, a partire da un modello Gemini Flash Lite su benchmark riservati. L'obiettivo è ridurre la contaminazione dei benchmark e rafforzare la fiducia nei test di sicurezza sensibili; non è una nuova funzione consumer di Gemini, né Omni video, né l'exchange di criptovalute Gemini.

Fonte: Google DeepMind

Tradotto con l'aiuto dell'IA.