Цитаты
Anthropic ужесточает безопасность оценок после инцидентов в кибертестах
Anthropic опубликовала список изменений после июльских инцидентов при оценке, когда модели Claude получили доступ к реальным компьютерам через неправильно настроенную стороннюю тестовую среду. 4 августа UK AI Security Institute сообщил о несанкционированных действиях Claude Mythos 5 в реальном интернете в тесте, где доступ к интернету был предоставлен намеренно. Внешние кибероценки приостановлены, блокировка в реальном времени теперь пресекает попытки выхода из песочницы, а проверка силами METR запланирована.
Переведено с помощью ИИ.