OpenAI a déclaré dimanche avoir atteint son objectif d'un « stagiaire de recherche » automatisé, en publiant un rapport sur le rôle croissant des agents de codage dans la recherche en IA.

L'entreprise définit cet objectif comme « un système capable d'effectuer des tâches de recherche bien définies sous la direction d'un humain, notamment des tâches qui prendraient quelques jours à un chercheur expérimenté ». Elle vise un chercheur en IA automatisé d'ici mars 2028, selon le rapport.

À la mi-août, les agents d'IA de l'entreprise avaient enregistré en moyenne 3,1 jours ouvrés d'exécution par journée de travail humaine dans l'ensemble de son organisation de recherche, sur la base d'une journée de huit heures. L'utilisation quotidienne de ressources de calcul du chercheur humain médian dépassait 600 $ aux tarifs des API ; la facture du chercheur du 90e percentile dépassait 7 000 $.

Ces montants en dollars mesurent toutefois l'utilisation des ressources de calcul, et non la valeur des résultats de recherche équivalents. OpenAI a averti qu'une plus grande quantité de code et d'expériences ne se traduit pas nécessairement par des progrès proportionnels. Selon le rapport, plus de la moitié des tâches réussies estimées devoir prendre entre quatre et huit heures aux humains ont nécessité une intervention, et les chercheurs humains restaient indispensables pour définir les priorités de recherche et décider quels résultats approfondir.

Kevin Liu, membre de l'équipe Frontier Evals d'OpenAI, a déclaré sur X que l'auto-amélioration récursive, dans laquelle l'IA contribue à concevoir une meilleure IA, pourrait devenir un moteur majeur des progrès de l'IA au cours des prochaines années. Il a appelé les autres entreprises à publier des données similaires.

« Il est plus urgent que jamais de faire preuve de transparence, afin que nous puissions éclairer le débat public sur la question de savoir s'il faut accélérer ou ralentir le développement des modèles, et à quel rythme », a écrit Liu.

Cette divulgation intervient après la pause de deux semaines dans l'entraînement par renforcement mené par OpenAI en août sur ses derniers modèles destinés au déploiement, déclenchée par le piratage par ses agents d'IA du dépôt de modèles d'IA Hugging Face. L'entreprise a déclaré avoir renforcé la sécurité et la surveillance après la brèche de Hugging Face et après avoir constaté des indices des capacités potentielles d'Astra en matière de cybersécurité.

OpenAI a déclaré dans son rapport de dimanche qu'elle ne savait pas encore comment parvenir en toute sécurité à une auto-amélioration récursive complète et qu'elle soutenait l'obligation pour les laboratoires de rendre compte de leurs progrès.