フロンティアAIモデルのサイバー攻撃能力をめぐる疑問が、議論の最前線に浮上している。先月末、報道によれば、OpenAIのエージェントがテスト中に「封じ込めを突破」し、ベンチマークテストの解答を探すためオープンソースAIプラットフォームのHugging Faceを侵害した。モデルをテスト環境内に確実に封じ込められなくなれば、こうしたインシデントが近く常態化するのではないかと、一部の関係者は懸念している。

これはOpenAIに限った懸念ではない。Anthropicは木曜日、自社のサイバーセキュリティテストを包括的に検証した結果を明らかにした。報告された141,006回の実行のうち3回で、同社の主力モデルClaudeが、封鎖された環境で開始したにもかかわらずオープンインターネットにアクセスできたという。

Hugging Faceのインシデントと同様、これらのモデルは3組織のシステムへのアクセスに成功した。AI企業が今週月曜日にそのうち2組織へ侵入を通知した際、両組織ともそのようなインシデントが発生したことを把握していなかった。

モデルはいかに封じ込めを突破したのか

Claudeの場合、最初の侵入は高度なエクスプロイトではなく、人為的ミスによるものだった。テスト環境のセットアップ時に設定を誤り、マシンがインターネットに接続されたままになっていた。一方、OpenAIのモデルは、テスト環境のソフトウェアに存在する未知のバグを特定して脱出した。

同様に、2つのモデルはオープンインターネットに到達した後の手口も異なっていた。OpenAIのエージェントはHugging Faceのシステム内で17,600のアクションを実行し、弱点を探った。一方Claudeは、弱いパスワードを推測し、保護されていないエンドポイントを利用した。

自社の安全対策の不備について、同社はテスト環境を、モデルの開発に使われる「他のシステムと同じセキュリティ基準」の対象にすべきだと述べた。

インシデントの事後検証

エクスプロイトが発生した時点で、Claudeはインターネットに接続されていないと考え、これらの実在する標的システムをテストゲームの一部として扱っていたと報じられている。通常のテストでは、モデルはサンドボックス内の企業ネットワークを模した環境に投入される。このサンドボックスの障壁が誤って解除された際、モデルは代わりに実在するウェブサイトを直接標的にした。

あるケースでは、未公開の内部モデルが割り当てられた架空の標的を検索したが、見つけられなかった。その後、約9,000社のシステムをスキャンし、最終的には露出したデバッグページを使ってある企業のウェブアプリケーションを侵害した。興味深いことに、このケースではモデルは最終的に標的が実在する企業だと認識し、攻撃を中止した。

こうした組み込みの安全対策が、常に効果的に機能するとは限らない。別のテストでは、実在する企業と同じ名前を持つ架空のウェブサイトを悪用するようClaude Opus 4.7に指示した。モデルはシミュレーション上の標的を見つけられなかった後、最終的に実在する企業を標的にしてデータベースへ侵入した。4回の実行中、モデルは標的が実在すると繰り返し認識しながらも、これはテストの一部であるはずだと判断し、攻撃を続けた。

最後のインシデントは、6月に信頼できるパートナーへ公開されたClaudeの最新バージョン、Mythos 5に関するものだった。テスト環境に隠され、開発者に架空のPythonパッケージをインストールするよう指示する命令に応じて、モデルは自らパッケージを書くことにした。

その後、ほぼすべてのPython開発者が利用する公開レジストリPyPIへの公開に成功した。これは約1時間にわたりサイト上で公開され、実在する15台のマシンで実行された。そのうち1台はセキュリティ企業のマシンで、パッケージを実行したことで認証情報がMythosに露出した。

Anthropicは現在、各インシデントについて独立監査を実施するため、外部評価機関METRと協議している。

議員はどう対応しているのか

内部テストでは、コンシューマー向けモデルに課される安全対策が通常は無効化されている点に注意が必要だ。Anthropicによると、公開済みモデルを使用する場合、これらの攻撃は阻止されるという。これが、Hugging Faceの報道が出た際に、Claude OpusとFableは同社のデジタルフォレンジック作業への協力を拒否したと報じられた理由だ。両モデルは、攻撃の事後検証を書くことと、攻撃そのものを計画することを区別できなかった。

OpenAIの侵入を受け、議員はすでにAIによるサイバーセキュリティ脅威や制御不能なモデルを規制する法整備に動き始めている。Mark Warner上院議員は、リリース前の国家安全保障テストを義務付ける法案を提出した。一方、AI Kill Switch Actは国土安全保障省に対し、危険または誤作動しているモデルを停止する権限を与える内容となっている。