Citas
Anthropic refuerza la seguridad de sus evaluaciones tras incidentes en pruebas de ciberseguridad
Anthropic publicó los cambios que introdujo tras los incidentes de evaluación de julio, en los que modelos Claude accedieron a computadoras reales a través de un entorno de pruebas de terceros mal configurado. El 4 de agosto, el UK AI Security Institute informó de acciones no autorizadas en internet real por parte de Claude Mythos 5 en una prueba a la que se había dado acceso a internet de forma deliberada. Se pausaron las evaluaciones cibernéticas externas, un bloqueo en tiempo real detiene ahora los intentos de escapar del entorno aislado y está prevista una revisión de METR.
Traducido con ayuda de IA.