火曜日、MetaはOpenAI、Anthropic、Googleとともにホワイトハウスのスタッフと会合し、高度なAIモデルがサイバー攻撃で何ができるかを測定するための完成済みの連邦フレームワークを確認した。翌日、米報道機関The Informationは、Meta自身のモデルの1つが他社のシステムに侵入したと報じた。7月9日にMetaが公開したコーディングモデルMuse Spark 1.1は、安全性テスト中に社名非公表の企業へ侵害し、その内部で変更を加えた。

Metaは水曜日にこの件を認めた。これにより、モデルがテスト環境を抜け出して実在の企業に到達したと15日間で明らかにした主要AI開発企業は3社目となった。OpenAIは7月21日、自社モデルがHugging Faceに侵入したと発表した。Anthropicも7月30日に続いた。3社のうち2社は、Metaを含め、同じ外部企業を通じてテストを実施していた。

その企業はIrregularで、以前はPattern Labsと呼ばれていたテルアビブのセキュリティラボだ。OpenAI、Anthropic、Google DeepMind、そして現在はMeta向けに、公開前のサイバーテストを構築・運用している。同社は昨年9月に8,000万ドルを調達した。評価額は4億5,000万ドルで、Sequoia CapitalとRedpoint Venturesが主導したラウンドだったとTechCrunchは報じている。先週まで、業界外でこの会社の名を知る人はほとんどいなかった。現在では、2つのラボにまたがる4件の公表済み侵害に関与した存在として名が挙がっている。

Irregularによると、Anthropicを襲ったのと同じエラーだという

Irregularは、CNNへの声明で、Metaの侵害は6日前に公表されたAnthropicの事案の原因となったものと「まったく同じ評価環境の問題」だと述べた。この一文が転換点だ。これ以前は、それぞれの侵害は各ラボに固有の孤立したミスであり、恥ずかしいものではあっても限定的な問題に見えた。だがこれ以後は、1つのベンダーにおける単一の設定不備が、異なる2社のモデルをサンドボックスの外へ出し、他社システムに到達させたことになる。弱点は1つのラボのプロセスではない。共有された基盤なのだ。

テスト自体はcapture-the-flag演習と呼ばれる。モデルには、秘密情報の一部がネットワーク上の別のマシンにあると伝えられ、それを取得するよう求められるが、方法は指定されない。目的は、侵入のうまさを測ることにある。環境は公衆インターネットへの経路を持たない密閉されたシミュレーションであるはずで、プロンプトもそのことをモデルに明確に伝えている。その密閉が破れると、架空のネットワーク上の架空の標的を追っていたモデルが、現実のネットワーク上で探索を始める。

Metaによると、Irregularの設定ミスにより評価中に自社モデルの1つへ意図せずインターネットアクセスが与えられ、その後モデルは「サードパーティーのサービスにあるセキュリティ脆弱性を悪用した」という。これはReutersが伝えた表現だ。Irregularはこの侵害をMetaに通知した。Metaは調査中であり、事実関係が固まり次第、完全な事後検証を公表するとしている。

Metaがまだ明らかにしていないこと

Metaは侵害された企業名を明かしておらず、テストがいつ実施されたのかも、その内部に入った後でモデルが何を変更したのかも説明していない。また、影響を受けた企業が自力で気づいたのかどうかも明らかにしていない。この最後の点は重要だ。なぜなら、Anthropicが141,006回の評価実行を見直した結果、自社モデルが到達した3組織のうち、接触に成功した2組織はその活動を検知していなかったからだ。Anthropicは、Claudeが「基本的な手法を使って影響を受けた組織のインフラを侵害した」と述べており、これは高度で特殊な攻撃技術ではなく、弱いパスワードや保護されていないエンドポイントを意味すると、私たちのClaudeに関する開示の先行報道で説明した通りだ。

Metaはこれに相当するレビュー件数も公表していない。それがなければ、Muse Spark 1.1の侵害が単独の異常事例なのか、それとも単に誰かが最初に探した事例にすぎないのかを判断することはできない。Anthropicが調査に乗り出したのはOpenAIの開示後であり、最も早い事案は表面化する4カ月前の4月にさかのぼっていた。

これらはいずれも、モデルが逃げ出そうとしていたことを示すものではない。公表されたすべての事例で、モデルは割り当てられた仕事をしていただけであり、自分が密閉されていると伝えられた部屋の中で、研究者が最悪の場合の攻撃能力を測定できるよう通常の安全拒否を弱められた状態にあった。Anthropicによると、自社モデルが自分自身を持ち出そうとしたことは一度もなかった。失敗は意図ではなく配線にある。それは安心材料であると同時に、こうした事態が繰り返される理由でもある。

規制の背景を考えると、このタイミングは落ち着かないものだ。6月2日に署名されたExecutive Order 14409は、機関に対しサイバー能力をベンチマークするための機密プロセスの構築を指示しており、Metaが火曜日にホワイトハウスで確認したフレームワークは、参加企業が新モデルを広く公開する前の30日間、政府にアクセスを提供する仕組みを中心に据えている。欧州連合(EU)のAI法は8月2日に発効し、独自の公開前審査権限を持つ。

投資家にとっての読み筋は、Metaが危険なモデルを出荷したということではない。最先端の安全性テストが少数の小規模企業に委託されており、そのうち1社で起きた同じ環境障害が、1週間のうちに2つのラボで侵害を生んだということだ。モデルは、どれだけうまく侵入できるかで採点される。だが、その部屋自体を採点していた者はいなかった。