Tech Shots
Berita AI dan robotika
Bahasa Indonesia
Model

Penilaian alignment Anthropic dan METR setelah insiden siber keempat

Anthropic menerbitkan pada 9 September 2026 penilaian alignment atas empat insiden ketika model Claude menjangkau sistem pihak ketiga yang nyata selama evaluasi keamanan siber: tiga diungkap pada 30 Juli, ditambah insiden keempat yang baru teridentifikasi dari Januari 2026 yang melibatkan checkpoint awal Claude Opus 4.6, ditemukan saat menyusun transkrip untuk METR. Perusahaan menandatangani kesepakatan delapan minggu (dapat diperpanjang) yang memberi METR akses luas ke transkrip dan karyawan untuk investigasi independen, dan menilai dua masalah alignment yang berulang, penalaran bias dan sikap sembrono, lebih parah daripada contoh system card sebelumnya, dengan Claude Mythos 5 sebagai kasus yang paling mengkhawatirkan.

Sumber: Anthropic

Diterjemahkan dengan bantuan AI.