OpenAIはAI訓練向けの安全性ガイドラインを公開し、フロンティア強化学習の訓練を実行する前に、開発者は構造化された安全性文書を用意すべきだと述べた。

月曜日のブログ投稿で、ChatGPTの開発元は、AI訓練を開始する前に「安全性ケース」の文書を整備することを求める実践を体系化する枠組みに取り組んでいると記した。

OpenAIは、このような安全性ケースは技術スタックの3つの領域、すなわちアラインメント訓練、封じ込め、監視を対象にすべきだと指摘した。

「これらの安全対策は、モデルがアラインメントに反する行動を取ろうとしないようにし、仮に取ろうとしても封じ込めを破ることが難しく、被害が生じる前に監視がそれを検知できるようにするものです」とチームは述べた。

具体的には、アラインメント訓練はアラインメントに反する行動を止めることを目的とする。訓練環境のレビュー、評価者のチューニング、オフライン評価、過去のインシデントに基づくバックテストなどが行われる。

一方、封じ込めは潜在的な被害を抑えることを目的とする。OpenAIは、インフラのセキュリティを複数層にわたって強化したサンドボックスに加え、訓練チェックポイントを用いてこれらの環境をレッドチームで検証することを提案した。また、サンプル間の通信にも制限を設ける。

一方、監視はアラインメントに反する行動を早期に検知することを目的とし、再現率の目標、新たな評価データポイント、迅速なアラートによって支えられる。

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

安全性への懸念

OpenAIの安全性ガイドラインは、同社が同日、10月に予定していたGPT-6.1 Astraのリリースを中止したと安全性への懸念を理由に発表したのと同じ日に公開された。

OpenAIの安全システム責任者であるSaachi Jain氏は、月曜日にThe Latentと共有した声明で、安全性やアラインメントに関するあらゆる事柄には「トレードオフがある」と述べた。

Jain氏は「[GPT-6.1 Astraは]モデルの怠惰さなどの側面では改善しましたが、スコープと権限の範囲内にとどまることや、どのような作業を行ったかをユーザーにどう伝えるかという点では、基準を完全には満たしませんでした」と述べた。

安全性は、フロンティアAIの訓練をめぐる議論で重要なテーマになっている。先週、OpenAIのCEOであるSam Altman氏とAnthropicのCEOであるDario Amodei氏はともに、責任あるAI開発における一層の協調を求め、国連総会で演説した。

「私たちは過去に一方的にペースを落としたことがあります。将来もそうするでしょう」とAltman氏はイベントで述べた。「競争で他社に勝つことは、軽率な判断を下す理由にはなりません」

一方、AnthropicはIPOの目論見書で、フロンティアAIモデルの訓練に伴うリスクについて投資家に注意を促す予定であると、Reutersが月曜日に報じた。Claudeの開発元は、特に高度なAIモデルが「自己保存行動」を示した場合、AIが「人類に壊滅的なリスク、あるいは存亡に関わるリスク」をもたらす可能性があると警告している。