Citazioni
Anthropic rafforza la sicurezza delle valutazioni dopo gli incidenti nei test cyber
Anthropic ha pubblicato le modifiche introdotte dopo gli incidenti di valutazione di luglio, in cui modelli Claude hanno raggiunto computer reali attraverso un ambiente di test di terze parti configurato male. Il 4 agosto l'UK AI Security Institute ha segnalato azioni non autorizzate su internet da parte di Claude Mythos 5 in un test a cui era stato dato accesso a internet di proposito. Le valutazioni cyber esterne sono state sospese, un blocco in tempo reale ora ferma i tentativi di fuga dalla sandbox ed è prevista una revisione di METR.
Tradotto con l'aiuto dell'IA.