Tech Shots
KI- und Robotik-News
Deutsch
Modelle

DeepMind testet doppelblinde Evaluierungen von Frontier-KI

Google DeepMind teilte am 27. August mit, die nach eigenen Angaben erste doppelblinde Evaluierung eines proprietären Frontier-Modells zu erproben: externe Tests laufen in einer kryptografischen Confidential-Space-Umgebung, sodass Prüfer die Gemini-Gewichte nicht sehen und Google die Prompts der Prüfer nicht einsehen kann. Zu den Partnern zählen das Singapore AI Safety Institute, OpenMined, AVERI und MLCommons, zunächst mit einem Gemini-Flash-Lite-Modell auf vertraulichen Benchmarks. Ziel sind weniger Benchmark-Kontamination und mehr Vertrauen bei sensiblen Sicherheitstests; es ist keine neue Gemini-Verbraucherfunktion, kein Omni-Video und nicht die Krypto-Börse Gemini.

Quelle: Google DeepMind

Mit KI-Unterstützung übersetzt.