知識カットオフの仕組み
トレーニング中、大規模言語モデルは、トレーニングデータに含まれるパターンを使って内部の値を調整します。トレーニング済みのモデルがデプロイされると、通常、質問への回答にはそれらの値が使われ、値自体は更新されません。時間が経過したり、誰かがチャットで新しい出来事に言及したりするだけで、新しい出来事がモデルに入ることはありません。
公表されたカットオフは、モデルが学習した情報がどの程度新しいものになるよう意図されているかを要約したものです。これは、すべての情報源が1日に収集されたことを意味しません。トレーニングデータは多くの情報源から取得され、異なる時期に収集・フィルタリングされます。カットオフより前の情報でも、欠落していたり、まれだったり、矛盾していたり、モデルが信頼性をもって再現するには十分に表現されていなかったりする場合があります。
そのため研究者は、公表カットオフと実効カットオフを区別します。公表カットオフは、モデル提供者が示す日付です。実効カットオフは、特定の情報源やトピックについて、モデルが実際に信頼性のある知識を示せる時期までの範囲です。日付付きデータセットを使った研究では、これらの境界が異なる場合があることがわかっています。
つまり、カットオフは密閉された壁というより、次第に薄れていく境界に近いものです。境界付近では知識が断片的になることがあり、網羅性は分野によって異なります。
具体例
あるモデルのドキュメントに、知識カットオフが3月31日と記載されているとします。
- 2月1日に成立した、広く報道された法律について質問します。カットオフより前の出来事であり、トレーニングデータに十分な頻度で登場していれば、モデルは正しく回答できる可能性があります。
- 2月1日に公開された、あまり知られていない地域の告知について質問します。カットオフより前であっても、モデルはそれを知らない可能性があります。
- 4月15日に発表された選挙結果について質問します。3月で終わるトレーニングデータから、その結果を学習することはできません。別の情報源がなければ、モデルは情報の欠落を認めるか、推論するか、もっともらしい回答を作り出す可能性があります。
- 4月15日の公式結果を会話に貼り付け、同じ質問をします。するとモデルは、提供されたテキストに基づいて回答できます。モデルのカットオフは依然として3月31日のままです。
ウェブ検索や検索取得システムは、最後の例と同じように機能します。ツールが関連資料を見つけ、その依頼に対してモデルが読める情報に追加します。これにより、トレーニング中にモデルが学習した内容を変えずに、最新の回答を生成できます。
カットオフが重要な理由
回答が時間に依存する場合は、カットオフが重要です。ニュース、法律、価格、役職者、製品仕様、医療ガイダンス、ソフトウェアのドキュメントは、モデルがトレーニングされた後に変わる可能性があります。
使用しているモデルの正確なモデル名について、提供者のドキュメントを確認してください。同じ提供者のモデルでもカットオフが異なることがあり、製品が基盤となるモデルを切り替える場合もあります。モデルが自分のカットオフを正しく特定できるとは限らないため、モデルの回答だけに頼らないでください。
重大な影響がある質問や、急速に変化する質問では、カットオフの日付は最初に確認すべき事項にすぎません。製品が最新の情報源を取得できるか、その回答のために実際に取得したか、そして情報源が権威あるものかどうかも確認する必要があります。検索によって最新情報との隔たりは小さくなりますが、質の低い情報源や読み違えた情報源によって、依然として誤った回答が生じる可能性があります。
より新しいカットオフであれば、最近の情報が含まれている可能性は高まります。しかし、必要な事実をモデルが知っていることの証明にはなりません。重要で時間に敏感な知識については、自分の専門分野で検証してください。
よくある誤解
「モデルはカットオフ以前のことをすべて知っている」
いいえ。日付が示すのはトレーニングの境界であり、完全な網羅性ではありません。カットオフ以前の事実でも、欠落していたり、信頼性が低かったりする場合があります。
「モデルはカットオフ以後のことを何も話せない」
あなたやツールが新しい情報を提供すれば、モデルはそれについて推論できます。起こりそうな展開を推測することもありますが、推論は、その後の出来事を学習した証拠ではありません。
「ブラウジングをするとモデルが更新される」
ブラウジングによって、モデルは依頼に対して一時的に資料を読めるようになります。トレーニング済みのモデル自体を書き換えたり、カットオフを動かしたりすることはありません。
「カットオフはコンテキストウィンドウと同じものだ」
両者が制限するものは異なります。知識カットオフは、組み込まれた知識がいつ学習されたかに関係します。コンテキストウィンドウは、現在の依頼でモデルが処理できる情報量を制限します。
次に読むもの
実際に重要なのは、トレーニング中に学習された情報と、モデルが回答するときに提供される情報を区別することです。この区別の基礎が必要なら、まずLLMとは?を読んでください。次に、コンテキストウィンドウと知識カットオフの違いを使って、2つの制限を直接区別しましょう。