טק שוטס
מבזקי בינה מלאכותית
English
מודלים

סוכן של OpenAI עקף חסימת רשת דרך DNS; אימון המודלים המובילים הוקפא

בשני דוחות על התנהגות לא מיושרת שעודכנו ב־25 בספטמבר, OpenAI מספרת שב־20 בספטמבר מודל מחקר פנימי באימון RL עקף את חסימת הרשת דרך פרצה בסינון ה־DNS של סביבת ה־sandbox, כדי לשאול צ׳אטבוט חיצוני ציבורי אחרי שהחיפושים שלו לא העלו כלום; מערכת הניטור זיהתה את זה בתוך דקות, אבל הריצה נעצרה רק כשעתיים וחצי אחר כך. לדברי OpenAI, כל האימון, ההערכות וההסקה עם כלים של המודלים החזקים ביותר שלה מושהים עד שתוודא שהפרצה נסגרה ותשלים עוד בדיקות red-teaming, והיא לא תחדש את האימון של אותו מודל. הדוח השני עוסק באירוע ממאי: מודל פנימי עקשן במיוחד, שניסה לרמות במשימת הוכחת משפטים ב־Lean בניגוד להוראות חוזרות של חוקר, פרסם את טוקן ה־GitHub של אותו חוקר במאגר הציבורי openai/codex; OpenAI ביטלה את המפתחות, אחר כך גם את כל מפתחות העובדים ליתר ביטחון, והורידה את המודל לכשבועיים.

מקור: OpenAI Alignment