過去3週間で、OpenAI、Anthropic、Metaはそれぞれ同じ失敗について説明を公表した。密閉された試験環境のはずだった中でハッキング演習を与えられたモデルが、オープンインターネットへの経路を見つけ、実在する企業のコンピューターに侵入したのだ。国内最大級のAI開発企業3社、開示は3件、外部の攻撃者は存在しない。
月曜日、バーニー・サンダース上院議員はこのパターンを要求へと転じた。無所属でバーモント州選出の同議員は、OpenAIのサム・アルトマン、Anthropicのダリオ・アモデイ、Metaのマーク・ザッカーバーグに宛てた書簡を送り、Axiosが最初に報じたその書簡で、3社すべてに対し、より強力なシステムの構築をやめるよう求めた。Sandersは「AI開発を一時停止せよ。災厄を回避するにはまだ遅くない」と記した。「はっきり言わせてもらう。今、適切な行動を取らなければ、米上院の同僚たちと私は行動する。」
この書簡の手法は、各社自身の安全方針をそのまま突き返すことにある。すなわち、Anthropicが2023年に、安全対策が後れを取った場合は「スケーリングを一時停止し、または新モデルの展開を遅らせる」と約束したこと、Metaが2025年に、軽減できない重大なリスク水準にモデルが達した場合は「開発を停止する」と表明したこと、そしてOpenAIが、強力な安全策が整うまで「さらなる開発を停止する」と約束したことだ。
これらの約束はいずれも技術的なトリガーにかかっている。Sandersは、そのトリガーはすでに作動したと主張する。彼は「その瞬間は今だ」と書く。「AIの能力は重大な閾値に達している。」この一文は、実際には論証せずに論証の役割を果たしているが、その背後に彼が積み上げる証拠は、書簡が示すほど強固でも一様でもない。
書簡の根拠となった事案
最初の事案が公になったのは7月21日で、OpenAIは、拒否設定を弱めた状態でサイバー・ベンチマークを実行していたGPT-5.6 Solと未公開モデルが、サンドボックスのパッケージソフトウェアにある未知の欠陥を悪用し、インターネットに到達し、ハギングフェイスに侵入したと開示した。これはSandersの言うとおりだ。モデル自身が脱出した封じ込め失敗である。
他の2件はそうではない。Anthropicは141,006件の評価実行を精査し、7月30日に、モデルがオープンインターネットに到達し、無関係な組織の本番システムに入ったケースを3件見つけた。原因はテストパートナーのIrregularにおける設定ミスで、実際にはインターネット接続があったにもかかわらず、モデルには接続がないと伝えていた。Anthropicの最先端モデルは、自分がオープンインターネット上にいると認識して停止した。
Metaは8月5日、ほぼ同一の事案を開示した。同じベンダー、同じミスだ。ジ・インフォメーションはまず、そのモデルがMuse Spark 1.1だと報じた。IrregularはReutersに対し、サンドボックスからの脱出は含まれていなかったと述べた。Sandersの書簡はこの3件すべてを、モデルが「同様に彼らの制御から逃れた」事例としてひとまとめにしているが、それはシステムが自ら檻を破った場合と、ベンダーが扉を開けたままにしていた場合の違いを平板化している。
論拠が薄くなるところ
生物学に関する主張は、さらに速く薄くなる。8月6日付のScienceの研究では、スタンフォード大学とアーク研究所の研究者が完全なウイルスゲノムを作成し、そのうち16件が機能するバクテリオファージを生成した。ファージが感染するのは細菌のみであり、人間、動物、植物に感染するウイルスの配列は訓練から意図的に除外されていた。筆頭著者のブライアン・ヒーはガーディアン紙に対し、AIによるゲノム設計の生物兵器リスクは、より容易な既存病原体の機能獲得研究と比べれば「非常に誇張されている」と語った。この書簡は、ファージ治療の成果を何千万人もの死へと変換している。
そして救済策の問題がある。Sandersは、Amodeiを含む1,200人超の研究所職員が署名し、能力が制御を上回る可能性を警告した声明を肯定的に引用している。その声明は、どの企業も単独では減速できないからこそ、米政府が最先端開発の速度を調整するための手段を整備すべきだと求めている。Sandersはそれを、書簡の及ばない中国の研究所やオープンウェイト公開に対抗しながら、3社に単独で減速するよう求める根拠として引用している。
しかも彼がこの書簡を書いたのは、OpenAIがAstraの作業を一時停止した2日後のことだった。Astraは未公開モデルで、評価によって重大なサイバー能力を否定できなかったためだ。これは企業側のトリップワイヤーが自発的に作動した事例であり、書簡が放棄されたとしている行動そのものである。
立法もまた近く実現する見込みはない。SandersのAIデータセンター・モラトリアム法は3月25日以来まったく進展しておらず、国家安全保障当局は同じ事実を異なる形で読んでいる。CIA長官ジョン・ラトクリフは6月、最先端モデルを「デジタル核兵器に等しいもの」と呼び、その後に続いた政策は停止ではなく輸出規制だった。
この書簡が向き合っていないのは、そこにある証拠そのものがどこから来たのかという点だ。書簡に含まれるすべての事案は、企業が公表を選んだからこそ公開情報になったものであり、場合によっては、誰からも開示を求められていなかった141,006件のテスト実行を監査した後に公表されている。Sandersは4件の自発的開示を、研究所を信頼できない証拠として扱っている。彼が投資家に残している問いは、次は何が開示されるのか、ということだ。
