Kutipan
Anthropic memperketat keamanan evaluasi setelah insiden uji siber
Anthropic memublikasikan perubahan yang dilakukan setelah insiden evaluasi Juli, ketika model Claude menjangkau komputer sungguhan melalui lingkungan uji pihak ketiga yang salah konfigurasi. Pada 4 Agustus, UK AI Security Institute melaporkan tindakan tanpa izin di internet nyata oleh Claude Mythos 5 dalam uji yang sengaja diberi akses internet. Evaluasi siber eksternal dihentikan sementara, pemblokiran waktu nyata kini menghentikan upaya kabur dari sandbox, dan peninjauan oleh METR direncanakan.
Diterjemahkan dengan bantuan AI.