Fonctionnement d’une date de coupure des connaissances

Pendant l’entraînement, un grand modèle de langage ajuste ses valeurs internes à partir des régularités présentes dans ses données d’entraînement. Une fois ce modèle entraîné déployé, répondre à votre question utilise normalement ces valeurs sans les mettre à jour. Les nouveaux événements n’entrent pas dans le modèle simplement parce que le temps passe ou que quelqu’un les mentionne dans une conversation.

La date de coupure indiquée résume le degré de récence visé pour les informations apprises par le modèle. Cela ne signifie pas que toutes les sources ont été collectées le même jour. Les données d’entraînement proviennent de nombreuses sources, recueillies et filtrées à des moments différents. Certaines informations antérieures à la date de coupure peuvent être absentes, rares, contradictoires ou insuffisamment représentées pour que le modèle les restitue de manière fiable.

Les chercheurs distinguent donc une date de coupure indiquée d’une date de coupure effective. La date de coupure indiquée est la date fournie par le fournisseur du modèle. La date de coupure effective correspond à la période jusqu’à laquelle le modèle démontre réellement des connaissances fiables pour une source ou un sujet donné. Des recherches menées sur des jeux de données datés ont montré que ces limites peuvent différer.

La date de coupure ressemble donc davantage à un bord qui s’estompe qu’à une muraille étanche. Les connaissances peuvent devenir plus fragmentaires à l’approche de cette limite, et la couverture varie selon le sujet.

Un exemple détaillé

Supposons que la documentation d’un modèle indique le 31 mars comme date de coupure de ses connaissances.

  • Vous l’interrogez sur une loi largement médiatisée, adoptée le 1er février. Le modèle peut répondre correctement, car l’événement s’est produit avant la date de coupure et est apparu assez souvent dans ses données d’entraînement.
  • Vous l’interrogez sur un avis local peu connu, publié le 1er février. Le modèle peut ne pas le connaître, même s’il est antérieur à la date de coupure.
  • Vous l’interrogez sur le résultat d’une élection annoncé le 15 avril. Le modèle n’a pas pu apprendre ce résultat à partir de données d’entraînement s’arrêtant en mars. Sans autre source, il peut reconnaître cette lacune, tirer une déduction ou inventer une réponse plausible.
  • Vous collez le résultat officiel du 15 avril dans la conversation et posez la même question. Le modèle peut alors répondre à partir du texte que vous avez fourni. Sa date de coupure reste le 31 mars.

Les systèmes de recherche sur le Web et de récupération d’informations fonctionnent comme dans ce dernier cas. Un outil trouve des documents pertinents et les ajoute aux informations que le modèle peut lire pour cette requête. Cela peut produire une réponse actuelle sans modifier ce que le modèle a appris pendant son entraînement.

Pourquoi la date de coupure est importante

Une date de coupure est importante dès qu’une réponse dépend du temps. L’actualité, les lois, les prix, les titulaires de fonctions, les caractéristiques des produits, les recommandations médicales et la documentation logicielle peuvent tous changer après l’entraînement d’un modèle.

Consultez la documentation du fournisseur pour connaître le modèle exact que vous utilisez. Les modèles d’un même fournisseur peuvent avoir des dates de coupure différentes, et un produit peut changer de modèle sous-jacent. Ne comptez pas sur le modèle pour identifier correctement sa propre date de coupure.

Pour les questions à forts enjeux ou susceptibles d’évoluer rapidement, la date de coupure n’est qu’une première vérification. Vous devez également savoir si le produit peut récupérer des sources actuelles, s’il l’a effectivement fait pour cette réponse et si ces sources font autorité. La recherche réduit le décalage de récence, mais des sources faibles ou mal interprétées peuvent tout de même produire une réponse erronée.

Une date de coupure plus récente peut augmenter les chances que des informations récentes aient été incluses. Elle ne prouve pas que le modèle connaît le fait dont vous avez besoin. Testez les connaissances importantes et sensibles au facteur temps dans votre propre domaine.

Idées reçues courantes

« Le modèle connaît tout ce qui précède la date de coupure »

Non. La date décrit une limite d’entraînement, et non une couverture complète. Un fait antérieur à la date de coupure peut être absent ou peu fiable.

« Le modèle ne peut pas parler de ce qui s’est passé après la date de coupure »

Il peut raisonner sur des informations plus récentes que vous ou un outil lui fournissez. Il peut également déduire des évolutions probables, mais une déduction ne prouve pas qu’il a appris l’événement ultérieur.

« La navigation met le modèle à jour »

La navigation fournit au modèle des documents temporaires à lire pour une requête. Elle ne réécrit pas le modèle entraîné et ne repousse pas sa date de coupure.

« La date de coupure est la même chose que la fenêtre de contexte »

Ces deux notions limitent des choses différentes. La date de coupure des connaissances concerne le moment où les connaissances intégrées ont été apprises. La fenêtre de contexte limite la quantité d’informations que le modèle peut traiter dans la requête en cours.

Pour aller plus loin

La distinction pratique oppose les informations apprises pendant l’entraînement et celles fournies au moment où le modèle répond. Si vous avez besoin des bases de cette distinction, commencez par Qu’est-ce qu’un LLM ?. Utilisez ensuite Fenêtre de contexte et date de coupure des connaissances pour distinguer directement ces deux limites.