Prime Intellect, le fournisseur san-franciscain de capacités de calcul et d’outils d’entraînement pour l’IA, a lancé mercredi son environnement d’exécution Prime Agent open source. Les scores de test de référence auto-déclarés par l’entreprise suggèrent qu’il peut améliorer considérablement les capacités des principaux modèles d’IA.
L’ARC-AGI-3 est un test géré par l’ARC Prize Foundation, qui plonge les modèles d’IA dans une série de jeux en 2D sans leur fournir d’instructions préalables sur la manière de les terminer. Il revient alors au modèle de découvrir les règles de chaque jeu par tâtonnements, puis de les terminer. Le score officiellement vérifié le plus élevé à ce test est de 30,2 %, détenu par Claude Opus 5 d’Anthropic.
Cependant, lorsqu’il a exécuté Claude Opus 5 dans son environnement personnalisé, Prime Intellect a déclaré un score de 95,5 % — 0,1 % de plus que le score de référence des experts humains eux-mêmes.
Il est important de souligner que ces chiffres n’ont pas été vérifiés de manière indépendante. ARC Prize tient un classement distinct pour les résultats auto-déclarés, c’est-à-dire ceux qui reposent sur des logiciels personnalisés allant au-delà des modèles eux-mêmes.
Ce que l’environnement de Prime Intellect fait différemment
Selon l’entreprise, la différence réside dans l’environnement d’exécution : l’enveloppe qui gère la mémoire et l’outillage du modèle d’IA qui y fonctionne. Le résultat de 95,5 % de Prime Intellect a été obtenu avec son propre environnement personnalisé plutôt qu’avec le dispositif officiel d’évaluation d’ARC Prize, ce qui signifie qu’il n’est pas directement comparable aux résultats vérifiés du classement.
L’environnement de Prime Intellect permettrait à un modèle de réécrire dynamiquement ses propres instructions — prompts, mémoire et rôles des agents auxiliaires — ce qui lui confère un avantage sur les environnements qui « forcent le modèle à contourner sa propre structure au lieu de l’exploiter ». Un rapport d’OpenAI a affirmé que l’environnement standard d’ARC Prize forçait ses modèles à écraser leur propre mémoire en cours de tâche, ce qui entravait leur progression et dégradait leurs scores.
L’environnement de Prime Intellect fonctionne au contraire avec une session Python active qui persiste pendant toute la tâche. L’historique de la session peut être parcouru par programmation, ce qui nécessite moins de tokens que les environnements comparables qui obligent le modèle à relire sa propre sortie. Une commande « refine » permet au modèle de modifier son propre manuel de procédures à la volée.
Autres résultats de test de Prime Agent au-delà de l’ARC-AGI-3
Prime Intellect a mis son environnement à l’épreuve sur un large éventail de tests. L’un d’eux consistait à créer de zéro des émulateurs de consoles de jeux rétro en langage de programmation Rust. Un autre lui demandait de jouer au célèbre jeu de gestion de production Factorio, dans lequel il a réussi à atteindre un score de production à six chiffres en seulement quelques heures.
Pendant la partie, Prime Intellect a rapporté qu’un modèle non identifié exécuté dans Prime Agent avait découvert qu’il pouvait exploiter les commandes de la console pour faire apparaître directement des ressources dans ses machines. La fonction refine de l’environnement a ensuite transformé ces exploits fructueux en compétences réutilisables. Le modèle a ensuite eu recours à plusieurs reprises à cette tactique efficace, malgré des rappels automatisés réguliers lui demandant de ne pas tricher.
Globalement, ces résultats constituent la dernière donnée en date soulignant que les enveloppes des modèles d’IA sont désormais tout aussi importantes que les modèles eux-mêmes.
Bien que l’environnement Prime Agent lui-même ne coûte rien et ait été publié sous licence MIT, l’entreprise qui le développe est désormais valorisée à 1 milliard de dollars. Un rapport de TechCrunch a détaillé la levée de fonds de 130 millions de dollars de série A de l’entreprise, sur la base d’un chiffre d’affaires annualisé de 100 millions de dollars.
