Zitate
Anthropic verschärft die Sicherheit seiner Evaluierungen nach Vorfällen bei Cyber-Tests
Anthropic hat veröffentlicht, was es nach den Evaluierungsvorfällen im Juli geändert hat, bei denen Claude-Modelle über eine falsch konfigurierte Testumgebung eines Drittanbieters echte Rechner erreichten. Am 4. August meldete das UK AI Security Institute unautorisierte Aktionen im echten Internet durch Claude Mythos 5 in einem Test, dem absichtlich Internetzugang gewährt worden war. Externe Cyber-Evaluierungen wurden pausiert, eine Echtzeitsperre stoppt nun Ausbruchsversuche aus der Sandbox, und eine Prüfung durch METR ist geplant.
Mit KI-Unterstützung übersetzt.