La Chine montre la voie en matière de distribution de modèles à poids ouverts : nombre de ses meilleurs laboratoires d’IA publient leurs modèles en ligne afin que chacun puisse les télécharger et les exécuter, à condition de disposer du matériel requis. Le dernier modèle à bénéficier de ce traitement est le Qwen3.8-Max d’Alibaba, l’entreprise ayant révélé qu’elle prévoyait de publier les poids sur ModelScope et Hugging Face la semaine prochaine.
Les actions d’Alibaba ont bondi en réaction, son titre coté à Hong Kong ayant clôturé en hausse de 7 % lundi, avant une progression de 4,2 % lors des échanges avant l’ouverture aux États-Unis.
Un porte-parole de l’entreprise a souligné qu’il s’agissait de « la première fois que nous publierons en open source les poids d’un modèle de la classe Qwen-Max ». Il s’agit du modèle le plus puissant de l’entreprise ; celle-ci avait auparavant publié les poids de ses modèles économiques moins performants, tout en limitant l’accès à son produit phare.
La tendance chez les développeurs chinois évolue toutefois de plus en plus vers un accès à des poids ouverts. Moonshot AI, basée à Pékin, a également publié le 27 juillet les poids de son propre modèle de 2,8 billions de paramètres, Kimi K3.
Alors que les laboratoires américains d’IA de pointe gardent jalousement leurs poids de modèles propriétaires, la tendance en Chine consiste à proposer des résultats comparables — quoique moins puissants à bien des égards — dans un format moins coûteux et librement téléchargeable.
Qwen3.8-Max met en avant ses capacités pour les tâches à horizon moyen ou long
Le Qwen3.8-Max d’Alibaba comporte 2,4 billions de paramètres et peut traiter jusqu’à un million de tokens par requête. Le modèle est présenté comme un outil puissant pour les tâches s’étendant sur de longues périodes, plutôt que pour des interactions de type chatbot.
Pour mettre ces capacités en évidence, le développeur lui a confié des tâches complexes d’apprentissage automatique et de programmation. Parmi celles-ci figurait un projet de développement logiciel mené sur plusieurs semaines, qui a abouti à 265 commits, 127 pull requests et 151 issues après environ 16 jours sans aucune intervention humaine. Lors d’un autre test, il a été demandé au modèle de réduire la taille d’une puce formant un circuit cryptographique ; Qwen a réussi à réduire de 81 % la taille physique du composant en ramenant le nombre de ses portes logiques de 8 298 à 678.
Le modèle peut également être utilisé dans le commerce électronique, comme l’a montré un dernier test au cours duquel on lui a attribué ¥100,000 et demandé de gagner autant que possible sur une simulation d’un an. Le modèle a réussi à quadrupler son capital pendant cette période, terminant 152 % au-dessus de la version précédente du modèle phare d’Alibaba.
Ces tests ont été menés en interne chez Alibaba, conformément à ses propres règles et procédures, et n’ont pas fait l’objet d’un audit indépendant.
Comparaison de Qwen3.8-Max avec la concurrence
Les capacités de Qwen sont peut-être moins impressionnantes lorsqu’il est confronté aux modèles américains de pointe. Le tableau comparatif d’Alibaba révèle qu’il surpasse ses concurrents dans certains types de tâches, mais accuse du retard dans d’autres. Lors du Terminal Bench 2.1 — qui évalue la capacité des modèles à accomplir des tâches complexes comportant plusieurs volets — le modèle a obtenu 86,6, se plaçant devant les modèles phares d’Anthropic, mais toujours légèrement derrière le GPT-5.6 Sol d’OpenAI, à 88,8.
Avec un score de 93,0, Qwen devance toutefois tous ses concurrents au test PaperBench, qui évalue la capacité à reproduire des articles de recherche en apprentissage automatique. Les autres résultats de référence étaient moins flatteurs : le modèle d’Alibaba n’a obtenu que 67,7 au test de programmation SWE-bench Pro, très loin derrière Claude Fable 5, à 80,0.
Lorsqu’on le compare uniquement à ses concurrents nationaux, la position de Qwen3.8-Max s’améliore toutefois. Bloomberg a rapporté qu’il se classe devant le très réputé Kimi K3 — un autre modèle à poids ouverts de taille comparable — dans plusieurs benchmarks clés, bien que le modèle de Moonshot affiche de meilleurs résultats globaux, quoique de peu.
Cela place néanmoins Qwen3.8-Max parmi les principaux modèles à poids ouverts, en particulier pour les tâches à horizon temporel long.
