AIの安全性テストにより、生物兵器や暗殺に関する要求からMoonshotのKimiモデルを守る安全策に不備があることが明らかになった。

AIシステムの脆弱性を検証するMindgardはBBCに対し、同社の研究者が7月にKimi K2.6とK3 Swarmを脱獄させたと語り、両モデルからこれらの話題に関する助言を引き出した。このプロセスでは、開発者が設定した安全上の制限を回避するかどうかを検証するため、AIモデルに複雑な指示を連続して入力する。

同社によると、7月27日にMoonshotへ脆弱性についてメールを送り、約1週間後に再度連絡したうえで、9月12日にブログ記事を公開した。Mindgardによれば、Moonshotが連絡を取ってきたのは最近になってからで、BBCが同社にコメントを求めた後だった。

MoonshotはBBCに対し、外部からの精査を「より優れた、より安全なAIを構築するための重要な柱」として歓迎すると述べ、Mindgardと調査結果について協議していると明らかにした。BBCが入手した、MoonshotがMindgardに送ったメールで、中国の開発企業は、社内評価において自社モデルは通常、「この種の要求に対して高い拒否率」を示していると述べた。

「脱獄が成功すると、どんな話題についても話すようになり、悪質な別の話題についても自由に提案をするようになります。しかも独創的で創造的です」と、Mindgard創業者のPeter GarraghanはBBC World Serviceの番組Tech Lifeで語った。

Mindgardは、武器や暗殺に関する助言が実際に有効であることを証明したわけではない。同社は、そもそもモデルがそうした要求に応じること自体を安全策で阻止すべきだったと主張している。また同社は、脱獄されたKimi K2.6によってハッカーがその計算リソース上でコードを実行し、インターネットに接続できる可能性があると確信しており、サイバー攻撃の足掛かりになり得るとも述べた。

今回の進展は、複数の大手開発企業のAIエージェントをめぐる最近の開示に続くものだ。Googleは、Geminiが3社にアクセスしたと明らかにしており、これは5月のセキュリティテスト中の出来事だった。一方、オーストラリア当局は、OpenAIのエージェントが6月に政府の医療ポータル上にある公開ファイルと非公開ファイルへアクセスしたと述べた。

Kimiはオープンウェイトモデルであり、ユーザーは自分たちの計算基盤上で実行できる。サリー大学のAlan Woodward教授はBBCに対し、このようなモデルが悪意ある者の手に渡る可能性がある一方、サイバー防御にも利用できると語った。

AI Chat Search Interest

AI Chat Search Interest

  • ChatGPT
  • Claude
  • Gemini
  • DeepSeek
  • Perplexity
  • Grok
  • Kimi
  • Qwen
SOURCE: Google Trends via The Latent