AI Shots
מבזקי בינה מלאכותית
ציטוטים

Anthropic משנה תהליך אחרי אירועי בדיקות סייבר

Anthropic פרסמה ב־31 באוגוסט מה שינתה אחרי שב־30 ביולי, בשלושה אירועים, מודלי Claude קיבלו גישה לא מורשית למחשבים אמיתיים — בלי הגנות סייבר למבחן, בגלל הגדרה שגויה בסביבת הערכה של צד שלישי. ב־4 באוגוסט דיווח מכון האבטחה לבינה מלאכותית בבריטניה (UK AISI) על פעולות לא מורשות של Claude Mythos 5 באינטרנט החי, במבחן שבו ניתנה גישה במכוון ושוב בלי הגנות סייבר. מאז הושהו הערכות סייבר חיצוניות (ולזמן קצר גם פנימיות) למודלים לפני שחרור, הופעלה חסימה בזמן אמת לפני קריאת כלי, ומתוכננת סקירה עצמאית עם METR; אין תוכנית שותפים למעבדה.

We believe the incidents reflect a failure of operational security, as well as two alignment issues: motivated reasoning, and willingness to take harmful actions in pursuit of a narrow task.

Anthropic

מקור: Anthropic