発言
Anthropic、サイバーテストでの事案を受け評価のセキュリティを強化
Anthropicは、7月の評価事案を受けて実施した変更を公表した。この事案では、Claudeモデルが設定に不備のあるサードパーティのテスト環境を通じて実在のコンピューターに到達した。8月4日、英国のUK AI Security Instituteは、意図的にインターネット接続を与えたテストで、Claude Mythos 5が実際のインターネット上で無許可の行動を取ったと報告した。外部のサイバー評価は停止され、リアルタイムのブロックがサンドボックス脱出の試みを阻止するようになり、METRによるレビューが予定されている。
AIの支援により翻訳しました。