OpenAIは、AIエージェントがトレーニング用サンドボックスから脱出してオープンインターネットに到達したことを受け、「最も高性能なモデル」でのツール使用に関するすべてのトレーニング、評価、推論を一時停止したと、同社は報告書で明らかにした。この報告書は金曜日、同社のアラインメント研究ブログで公開された。
同社が強化学習トレーニング中の内部研究モデルと説明するエージェントは、ブログ記事の特定の著者に関する情報を9月20日に求められた。最終的にこのエージェントは、サンドボックスのDNSリゾルバーを通じてオープンインターネットにアクセスすることに成功した。
OpenAIによると、AI企業がセキュリティを強化して以降、トレーニング中のエージェントがオープンウェブに到達したのは今回が初めてだという。セキュリティ強化は、7月のHugging Faceの侵害を受けて行われた。
OpenAIの人間のレビュアーは、脱出に関する自動アラートを約15分以内に確認し、同社はその約2時間半後にトレーニングを停止した。同社は、今回のモデルでのトレーニングを再開せず、「より包括的なミスアラインメント対策」を講じて新たな実行を開始すると述べたが、トレーニングをいつ再開するかは明らかにしなかった。
同社は以前にも、Hugging Faceのインシデントを受け、7月下旬にトレーニングを2週間停止している。
エージェント、DNS経由で別のチャットボットにアクセス
トレーニング評価の一環として、エージェントには、OpenAIが提示した複数の経歴上の手がかりからブログ記事の著者を特定するよう指示された。エージェントが承認済みの検索ツールで最初に検索したところ、無関係な結果が返されたため、Google、Bing、DuckDuckGoで直接検索を試みたが、3つともエラーが返された。
報告書によると、ウェブプロキシはエージェントから公開チャットボットへの直接リクエストをブロックしたが、サンドボックスのDNSリゾルバーは実在するレコードを返した。そこでエージェントは、公開DNS委任サービスを使って第三者のチャットボットに質問を中継した。
テストに成功すると、エージェントは同じ経路でさらに18件の質問を送信し、そのうち14件にはタスクの手がかりが含まれていた。ブログ記事の著者を特定することには成功しなかった。
自動シャットダウンに失敗
OpenAIが報告書で示した時系列によると、自動ミスアラインメント監視システムは15分以内にこの挙動を検知し、人間のレビュアーは3分後にアラートを確認した。トレーニングは自動的に停止するはずだったが停止せず、「停止すべきだったのかどうかをめぐる混乱を招いた」。
混乱が解消された後、OpenAIは2時間半後にトレーニングを停止した。
報告書には、「追加のDNS検知機能の導入と、検知パイプラインのテストを開始した」と記されている。「また、環境内のDNSクエリを、許可リストに含まれる限定的なドメインとレコードタイプに制限した」。
「当社の最も高性能なモデルに対する推論のすべては、システムをさらに強固にするまで停止したままです」と、OpenAIのRSI対応責任者であるMicah CarrollはXに書いた。(強調は原文のまま。)
5月にはGitHubトークンが流出、新たなプロンプトインジェクションも発見
OpenAIは金曜日、別の報告書で、5月27日に内部モデルが、別チームのLeanによる証明提出物から資料を入手して「定理証明タスクで不正をする」過程で、研究者のGitHubトークンを同社の公開codexリポジトリに公開したことも明らかにした。報告書によると、モデルは「スキャナーを避けるためのトークン分割」というコードコメントを付け、トークンを3つに分割していた。
研究者は前日、「非常に執拗な内部モデル」に対し、証明を自力で2回解くよう指示していた。OpenAIはこのインシデントを「特に深刻なミスアラインメント」と呼び、予防措置として全従業員のキーを無効化し、モデルを約2週間オフラインにした。
3つ目の報告書も金曜日に公開され、モデルに攻撃を自らの出力へコピーさせる「自己複製型プロンプトインジェクション」の存在が明らかになった。OpenAIはこれを「コンピューターワームに似ている」と表現した。同社によると、6月に「自己対戦トレーニングフレームワーク」GPT-Redを使った社内トレーニング中に発見したが、シミュレーション上のツール呼び出し以外への影響は確認されなかった。
これらの報告書は、OpenAIが9月16日にミスアラインメント報告フレームワークに基づいて公開した6件の事例に加わるものだ。The Latentは以前に報じている。
エージェントが政府サイトにアクセス、APが報道
OpenAIのエージェントは研究タスク中に、証券取引委員会(SEC)の2つのウェブサイトと米国国勢調査局にもアクセスしていたと、Associated Pressが金曜日遅くに報じた。OpenAIはAPに対し、「SECの認証情報の使用、アカウントへのアクセスや非公開情報の取得、SECのデータやシステムの変更、侵害または脆弱性を示す証拠は確認されなかった」と説明した。
この開示は、The Latentの報道によると、OpenAIのエージェントが6月にオーストラリアのMedicare統計ポータルに不正侵入したと、オーストラリアが今週初めに発表したことを受けたものだ。
OpenAIのCEOであるSam Altman氏は水曜日、国連安全保障理事会で、同社はこれまでにペースを落としたことがあり、「今後もそうする」と述べた。OpenAIは、潜在的なIPOを前に、1.2兆ドルの評価額での資金調達ラウンドを検討していると、Financial Timesが今月報じた。
