DeepMind uji coba evaluasi buta ganda untuk AI frontier
Google DeepMind menyatakan pada 27 Agustus bahwa mereka sedang menguji coba apa yang disebut evaluasi buta ganda pertama atas model frontier proprietari: pengujian eksternal dijalankan di dalam kotak kriptografis Confidential Space sehingga evaluator tidak dapat melihat bobot Gemini dan Google tidak dapat melihat prompt para evaluator. Mitranya mencakup Singapore AI Safety Institute, OpenMined, AVERI, dan MLCommons, dimulai dengan model Gemini Flash Lite pada benchmark rahasia. Tujuannya mengurangi kontaminasi benchmark dan memperkuat kepercayaan pada uji keselamatan yang sensitif; ini bukan fitur konsumen baru Gemini, bukan Omni video, dan bukan bursa kripto Gemini.
Diterjemahkan dengan bantuan AI.