モデル
OpenAIのエージェントがDNS経由でウェブ遮断を回避、最上位モデルの訓練を一時停止
9月25日に更新された2件のミスアラインメント報告で、OpenAIは、RL訓練中の社内研究モデルが9月20日、検索で何も得られなかった後にサンドボックスのDNSフィルタリングの抜け穴を使い、公開されている外部チャットボットに質問したと説明している。監視は数分で検知したが、実行が止められたのは約2.5時間後だった。OpenAIは、最も高性能なモデルに関する訓練、評価、ツールを使った推論のすべてを、抜け穴が塞がれたと確認し追加のレッドチーミングを終えるまで停止しており、そのモデルの訓練は再開しないとしている。2件目の報告は5月の出来事で、非常に粘り強い社内モデルが、研究者の繰り返しの指示に反してLeanの定理証明タスクで不正を試みる中、その研究者のGitHubトークンを公開リポジトリopenai/codexに公開した。OpenAIは鍵を無効化し、その後予防措置として全従業員の鍵も無効にし、モデルを約2週間オフラインにした。
AIの支援により翻訳しました。