Illustration abstraite d'une puce d'IA rapide et économe, style sombre avec circuits orange

Qwen3.8-Flash-Next : le modèle d'Alibaba qui annonce la guerre des prix en IA

Alibaba ouvre en open source Qwen3.8-Flash-Next, un modèle d'IA économe qui affiche des performances remarquables pour un coût dérisoire, et préfigure sa future famille Qwen4.

Alibaba vient de lâcher un modèle qui ressemble à une déclaration de guerre tarifaire. Il s'appelle Qwen3.8-Flash-Next, il est disponible en open source depuis mercredi, et il sert surtout à une chose : montrer à quoi ressemblera la prochaine grande famille de modèles de l'entreprise, Qwen4.

Sur le papier, c'est un petit modèle efficace. Il ne mobilise que 6 milliards de paramètres à chaque mot traité, pour 125 milliards de paramètres au total. Cette conception très économe, un modèle dit MoE (mixture of experts, soit "mélange d'experts"), permet de garder des performances élevées sans exploser la facture de calcul. L'objectif affiché est clair : un coût défiant toute concurrence.

Un avant-goût de Qwen4, en libre accès

Plutôt que de garder ses nouveautés pour la sortie officielle de Qwen4, l'équipe Qwen ouvre les poids du modèle. Pour comprendre à quoi servira la prochaine grosse mise à jour, il suffit de tester ce Flash-Next maintenant. Les poids et le code sont disponibles sur Hugging Face et sur ModelScope, ce qui veut dire que n'importe qui peut les télécharger et les faire tourner sur sa propre machine.

En plus des 125 milliards de paramètres actifs, le modèle embarque une innovation surprenante : une couche d'embedding de 51 milliards de paramètres, un composant qui transforme les mots en nombres traitables par le réseau. Cette couche se range dans la mémoire vive standard de l'ordinateur plutôt que sur la carte graphique, une astuce qui permet d'augmenter la finesse du modèle à coût quasi nul.

Schéma de l'architecture de Qwen3.8-Flash-Next avec sa couche d'embedding N-gram et l'activation de seulement 6 milliards de paramètres par mot traité

Schéma : Alibaba / Qwen, via The Decoder.

Résultat : le modèle comprend jusqu'à 262 144 jetons de contexte, soit l'équivalent d'un très gros livre, et cette fenêtre peut passer à un million de jetons avec la technique de prolongement YaRN. Pour un usage courant, c'est largement assez confortable.

Des scores qui font mal aux modèles plus gros

Les chiffres publiés par Alibaba donnent le tournis. Sur les tests de programmation qui demandent à une IA de corriger seule des bogues dans de vrais projets (SWE-bench Pro), le modèle atteint 62,5, devant le fameux Claude Opus 4.6 d'Anthropic à 53,4 et le DeepSeek-V4-Flash à 56. Sur les tâches de bureau, l'écart se creuse encore : 73,9 sur CoWorkBench contre 45,1 pour DeepSeek.

Surtout, l'entraînement a coûté environ neuf fois moins cher que celui du précédent modèle géant Qwen3.7-Plus. C'est un signal fort : Alibaba cherche à prouver qu'une grosse intelligence n'exige plus un budget de calcul démesuré. Pour les développeurs comme pour les entreprises, c'est une incitation claire à basculer.

Le modèle est déjà accessible via l'API QwenCloud au prix de 0,16 dollar par million de jetons en entrée et 0,47 dollar en sortie. Pour comparer, le modèle vedette Qwen3.8-Max coûte environ douze fois plus cher. Ce tarif met une pression sérieuse sur OpenAI et Anthropic, qui ont d'ailleurs réagi récemment en baissant les prix de leurs modèles GPT-5.6.

Qu'est-ce que ça change pour toi ?

Si tu testes des modèles d'IA pour travailler ou pour tes projets, ce Flash-Next est un excellent candidat : il est gratuit à télécharger, performant et peu gourmand. Si tu passes par une API, son tarif dérisoire permet d'expérimenter sans surveiller la facture. On en parlait déjà dans notre guide pour auto-héberger tes LLM et dans notre test des modèles qui tournent sur ta carte graphique.

Reste la limite habituelle : les annonces d'Alibaba en disent parfois plus que ce que le modèle produit une fois installé. Les scores de référence sont impressionnants, mais la vraie vie se juge à l'usage. Quoi qu'il en soit, la guerre des prix ne fait que s'intensifier — et c'est une excellente nouvelle pour toi.

Sources

Le blog officiel de Qwen, avec l'annonce détaillée de l'architecture et les notes techniques.

L'analyse de The Decoder, qui détaille les benchmarks et la comparaison avec les rivaux.

La couverture de TechNode sur l'ouverture du modèle en open source.

L'article de The Next Web expliqué pour un public non spécialiste.



Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.

No comments yet