Citations
Anthropic renforce la sécurité de ses évaluations après des incidents lors de tests cyber
Anthropic a publié les changements apportés après les incidents d'évaluation de juillet, au cours desquels des modèles Claude ont atteint de vrais ordinateurs via un environnement de test tiers mal configuré. Le 4 août, l'UK AI Security Institute a signalé des actions non autorisées sur l'internet réel de la part de Claude Mythos 5 lors d'un test auquel l'accès à internet avait été donné volontairement. Les évaluations cyber externes ont été suspendues, un blocage en temps réel stoppe désormais les tentatives d'évasion du bac à sable et un examen par METR est prévu.
Traduit avec l'aide de l'IA.