今週水曜日、The Informationは報じた。これは、米国の最先端AIモデルが実在する企業に対して実際のサイバー攻撃を成功させたとの一連の報道に、新たな事例を加えるものだ。MetaのコーディングモデルMuse Spark 1.1は、第三者によるテスト中に、社名非公表の企業のシステムへ侵入したと報じられている。これは、OpenAIのエージェントが7月17日にHugging Faceを攻撃したこと、そしてClaudeが7月30日に公表された事例で3社に侵入したことに相次ぐものだ。
AnthropicとMetaの両方の事案の中心にいるのは、これらのテストを実施したイスラエルのセキュリティ企業Irregularだ。同社の請負業者はCNNの取材に対し、Metaの侵入は、1週間足らず前に発生したAnthropicの事案と「まったく同じ評価環境の問題」が原因だったと認めた。セットアップ時に重要な安全対策の設定を誤り、モデルがオープンインターネットにさらされたという。
テスト環境の不備により、Muse Spark 1.1がインターネットにアクセス
Irregularが構築したテスト環境は、完全にサンドボックス化された、つまりインターネットに接続されていない閉鎖システムであることを想定している。こうした環境内で、モデルには「キャプチャー・ザ・フラッグ」などの課題が与えられる。そこでは、人間から追加の指示を受けずに別のマシンから情報を取り出すことが求められる。
モデルが動作する環境は表向きには封鎖されているため、公開モデルに導入されている標準的な安全対策の一部は意図的に無効化されている。
重要なのは、タスクを実行するエージェントには、プロンプトの段階で環境上の制限が伝えられている点だ。Anthropicの事案では、エージェントが誤ってオープンインターネットへのアクセス権を与えられていることに気づいた場合もあったが、これはテストプロセスの意図された一部に違いないと判断していた。
テストエンジニアは、一部のテスト対象に実在する企業の名前も設定していた。そのため、インターネット上に放たれたモデルは、架空の企業ではなく実在する企業を標的にした。その結果生じた侵入の成功は、AIモデルによる複雑な作戦ではなく、セキュリティで保護されていないエンドポイントと脆弱な認証情報が原因だった。
初期報道によると、Metaの事案でも同様のことが起きたようだ。Muse Spark 1.1は誤ってインターネットへのアクセス権を与えられ、その後、第三者サービスのセキュリティ脆弱性を「悪用した」。
公式な事後検証を待つ間、詳細は依然として明らかになっていない
MetaのAIモデルがどの企業に侵入したのか、またその企業名が公表されることがあるのかは、依然として不明だ。同様に、現時点の報道では、その企業が自ら侵入を検知したのか、それともMetaによる開示が最初の把握だったのかも明らかになっていない。Anthropicの事案では、影響を受けた3社のうち2社が攻撃を検知していなかった。
Metaの広報担当者は、「すべての事実が明らかになった時点で、完全な回顧報告を公表する」と約束した。
今回の調査結果は、Meta自体よりもセキュリティ研究所Irregularにとって重要な意味を持つ可能性がある。同社は、昨年9月に4億5,000万ドルの評価額で8,000万ドルを調達し、米国の主要な最先端AI研究所すべてとリリース前テストの契約を結んだ後も、一般にはほとんど知られていなかった。しかし、1週間のうちに複数の侵入事案が公表されたことで、現在ではワシントンをはじめとする地域で、AIのサイバーセキュリティ対策をめぐる議論の中心となっている。
米政府は火曜日、最先端モデルのレビューフレームワークを公表した。これは、新モデルの一般公開に先立ち最大30日前に連邦当局がモデルを確認し、サイバー能力を評価できるようにすることを目的としている。こうした最近の展開を受け、テスト環境の安全性は、モデル自体の能力と同じくらい重要な議論のテーマになりつつある。
