Le chiffre est de 1 107 tokens par seconde. C'est la vitesse affichée par Mercury 2.5, le nouveau modèle du labo californien Inception lancé lundi. Mais le plus intéressant n'est pas le nombre : c'est la façon dont il écrit.
GPT, Claude ou Gemini génèrent leur réponse mot par mot, dans l'ordre. Mercury 2.5 procède à l'inverse : il part d'un brouillon flou de la réponse entière et l'affine d'un coup, par blocs. Une approche dite de diffusion, la même famille de techniques que celle qui fait tourner les générateurs d'images, appliquée ici au texte. Résultat : du très rapide, à un prix imbattable, sans sacrifier la qualité. Après la génération d'images accélérée de ChatGPT cette semaine, le texte passe lui aussi à la vitesse supérieure.
La différence entre écriture séquentielle et parallèle
Presque tous les modèles actuels sont autorégressifs : ils prédisent le mot suivant, l'ajoutent à la phrase, puis recommencent. Chaque mot dépend du précédent, donc tout est séquentiel.
La diffusion fait l'inverse. Comme un générateur d'images qui part d'un bruit gris et le précise étape par étape jusqu'à obtenir une photo nette, le modèle part d'une version brouillonne de la réponse complète et l'affine en parallèle. Moins d'allers-retours, une meilleure utilisation des cartes graphiques, et surtout beaucoup moins de temps d'attente.
Ce que ça change concrètement
Les premiers concernés sont les applications où chaque milliseconde se sent : assistants vocaux, complétion de code, recherche interne en entreprise. OpenCall, qui branche des standardistes téléphoniques sur l'IA, mesure une latence médiane sous les 200 millisecondes avec Mercury 2.5. Augment Code, un assistant de développement, a déplacé vers Mercury une tâche ingrate, la compression du contexte : la latence est passée d'environ 150 secondes à 27 secondes, avec une facture en baisse de 90 %.

Crédit : Inception Labs, chiffres constructeur.
Un prix qui pique l'œil
Mercury 2.5 coûte 0,20 dollar par million de tokens en entrée et 0,75 dollar par million en sortie. Pour donner un ordre de grandeur, un million de tokens représente à peu près un gros roman. Au lancement, Inception casse même les prix avec une remise de 80 % : 0,04 dollar en entrée et 0,15 dollar en sortie. De quoi faire tourner un agent qui sollicite le modèle une dizaine de fois par requête sans exploser le budget.
L'argument ne s'arrête pas au prix. Le modèle embarque une fenêtre de contexte de 260 000 tokens, de quoi avaler un livre entier en une seule question, un raisonnement réglable à la demande, des appels d'outils en parallèle et une sortie JSON propre, le format structuré qu'utilisent les développeurs pour faire dialoguer leurs applications avec l'IA.
Rapide, mais aussi malin ?
Inception compare Mercury 2.5 aux modèles dits économiques des gros labos : GPT-5.6 Luna en mode bas, Gemini 3.5 Flash-Lite ou Claude Haiku 4.5. Selon les mesures publiées par le labo, la progression est nette face à Mercury 2, la version précédente, avec un bond d'intelligence de 40 %.
✉️ Un moment, avant de continuer la lecture…
La newsletter condense l'actu tech chaque dimanche : les 4-5 infos qui comptent + un outil open source à installer, en français. Inscription gratuite, désinscription en un clic.

Crédit : Inception Labs, chiffres constructeur.
Gardez quand même la tête froide : tous ces chiffres viennent du constructeur, et une vraie comparaison indépendante, même matériel et mêmes consignes, n'existe pas encore. Le fabricant du modèle n'est jamais le mieux placé pour juger sa vitesse, c'est comme si un restaurant se donnait lui-même son étoile. La vraie épreuve viendra des développeurs qui vont brancher le modèle sur leurs propres usages.
Comment l'essayer
Bonne nouvelle pour les curieux : aucune modification de code à prévoir. Mercury 2.5 se branche comme une API OpenAI classique, donc la plupart des applications déjà raccordées à un modèle du marché peuvent basculer en changeant deux lignes de configuration. Le modèle est disponible via l'API d'Inception, via Baseten, une plateforme d'hébergement de modèles, et via OpenRouter, un intermédiaire qui donne accès à des dizaines de modèles. Inception offre 100 millions de tokens gratuits pour tester l'API, et un chat en ligne ouvert à tous permet de discuter avec Mercury sans rien installer.
Inception a levé 50 millions de dollars auprès de Menlo Ventures, avec Andrew Ng et Andrej Karpathy, deux figures historiques de l'IA, parmi les investisseurs. Autant dire que le labo n'a pas l'intention de s'arrêter là : un modèle encore plus gros est déjà en entraînement, avec une sortie annoncée dans les prochains mois. La course à la vitesse ne fait que commencer, et elle ne se joue plus seulement sur la taille des modèles.
Sources
—
Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.




No comments yet