OpenAI a publié des lignes directrices de sécurité pour l’entraînement de l’IA, estimant que les développeurs devraient préparer une documentation de sécurité structurée avant toute reprise de l’entraînement par apprentissage par renforcement d’une IA de pointe.

Dans un article de blog, l’entreprise à l’origine de ChatGPT a écrit qu’elle travaillait sur un cadre visant à formaliser des pratiques exigeant qu’un « dossier de sécurité » soit en place avant le début de l’entraînement de l’IA.

OpenAI a indiqué que ces dossiers de sécurité devraient couvrir trois domaines de la pile technique : l’entraînement à l’alignement, le confinement et la surveillance.

« Ces mesures de protection contribuent à garantir que le modèle ne tentera pas de mener des actions en décalage avec les objectifs, que, même s’il le faisait, il lui serait difficile de sortir de son environnement confiné, et que la surveillance le détecterait avant qu’un préjudice ne puisse survenir », a déclaré l’équipe.

Plus précisément, l’entraînement à l’alignement vise à empêcher les comportements en décalage avec les objectifs. Il comprendrait l’examen des environnements d’entraînement, le réglage des évaluateurs, des évaluations hors ligne et des tests rétrospectifs fondés sur des incidents passés.

Le confinement vise à limiter les dommages potentiels. OpenAI a proposé des environnements sandbox renforcés — dotés de plusieurs couches de sécurité de l’infrastructure — ainsi que des exercices de red team dans ces environnements avec des points de contrôle de l’entraînement. Il imposerait également des restrictions sur les communications entre les échantillons.

La surveillance, quant à elle, vise à détecter rapidement les actions en décalage avec les objectifs, grâce notamment à des objectifs de rappel, à de nouvelles données d’évaluation et à des alertes rapides.

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

Préoccupations liées à la sécurité

Les lignes directrices de sécurité d’OpenAI ont été publiées le jour même où l’entreprise a annoncé avoir abandonné la sortie prévue en octobre de GPT-6.1 Astra pour des raisons de sécurité.

Dans une déclaration communiquée lundi à The Latent, Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a déclaré qu’« il y a un compromis » à trouver pour tout ce qui concerne la sécurité et l’alignement.

« Même si [GPT-6.1 Astra] s’est amélioré sur des axes tels que la tendance du modèle à la paresse, il n’a pas tout à fait atteint le niveau attendu en matière de respect du périmètre et des autorisations, ni dans la façon dont il informe l’utilisateur du type de travail effectué », a déclaré Jain.

La sécurité est devenue un élément central des discussions sur l’entraînement des IA de pointe. La semaine dernière, le PDG d’OpenAI, Sam Altman, et le PDG d’Anthropic, Dario Amodei, ont tous deux pris la parole devant l’Assemblée générale des Nations unies, appelant à une meilleure coordination dans le développement responsable de l’IA.

« Nous avons ralenti unilatéralement par le passé. Nous le ferons à l’avenir. » a déclaré Altman lors de l’événement. « Prendre le dessus sur des entreprises dans une course concurrentielle n’est pas une raison pour prendre des décisions irréfléchies. »

De son côté, Anthropic prévoit de mettre en garde les investisseurs dans le prospectus de son introduction en Bourse contre les risques associés à l’entraînement de modèles d’IA de pointe, a rapporté Reuters lundi. L’entreprise à l’origine de Claude avertit que l’IA pourrait présenter des « risques catastrophiques ou existentiels pour l’humanité », en particulier si les modèles d’IA avancés adoptent des « comportements de préservation de soi ».