米連邦政府は今週、最先端AIモデルのサイバー能力を評価する枠組みの最終調整を進めており、業界のリーダーやホワイトハウス当局者はその内容を議論するため、火曜日に会合を開く予定だ。この枠組みの中心となるのは任意参加の審査期間で、参加する開発者は新しいモデルを一般公開の最大30日前に政府機関へ提出する。

これは、OpenAIが発表してから3週間もたたないうちの出来事だ。OpenAIは、テスト中に同社のモデルの1つが「封じ込めを破り」、オープンソースAIプラットフォームのHugging Faceを侵害したと発表した。これは、この種の侵害として初めて公に記録されたものとなった。OpenAIは事後検証報告書で、「封じ込めアーキテクチャー自体が攻撃対象領域の一部になった」と指摘している。

このインシデントにより、AIモデルのサイバーセキュリティー対策、特に社内テスト中に設けられたガードレールの問題が大きく注目されることになった。Anthropicも後に、テストの設定時にサンドボックスのガードレールが不適切に構成されていたため、自社モデルが3社のシステムへの侵入に成功していたことを明らかにした

OpenAIはすでにここ数週間、枠組みの最終決定に先立ち、未公開のAstraモデルを連邦政府当局者に先行公開している。ホワイトハウスでの会合には、Anthropic、Google、Metaの代表者とともに出席すると見込まれている。

AIのサイバー脅威に対する議員の対応

米国では、議員らが州レベルと連邦レベルの両方で、AIがもたらす可能性のある脅威への対処を進めている。カリフォルニア州、ニューヨーク州、イリノイ州は、最先端AIの開発者にインシデントの報告を義務付ける法律を制定した。共和党所属の州司法長官15人も、消費者保護をめぐる主張を理由にOpenAIを提訴することを検討していると報じられている。

この新たな連邦審査枠組みの概要を示す指令であるExecutive Order 14409は、Anthropicが同社のMythosモデルのサイバー能力について主張したことを受け、6月2日に署名された。最先端AI研究所の代表者らは、枠組みの草案を確認する機会を得ており、修正要請を提出することもできたと報じられている。

正確な内容は公開されていないが、この命令は連邦機関に対し、新しいモデル向けのベンチマークテストを整備し、どのモデルが「対象となる最先端モデル」に該当するかについて明確な指針を策定するよう指示している。また、AIの支援を利用してソフトウェアの脆弱性を発見・修正するための、業界と政府による情報共有窓口も設置する。

政府が最先端モデルにアクセスすることは前例のないものではない。欧州連合(EU)のAI法では、欧州委員会が規制上の評価のため、汎用AIモデルへのアクセスを開発者に要求することができる。米国版では参加が明示的に任意とされ、新しいモデルの投入に際してライセンス取得を義務付けるものではないと記されている。