DeepSeek a officialisé jeudi son V4.1 Flash, le modèle rapide qui remplace le V4 Flash sur son API. Le modèle s'appelle désormais deepseek-flash côté API, il comprend les images sans module séparé, et ses poids sont déjà téléchargeables sous licence MIT sur Hugging Face. La bêta éclair de 48 heures est devenue une sortie publique, avec une baisse de prix à la clé.
On te racontait mardi la bêta éclair de 48 heures, montée à la va-vite pour tester le terrain. Deux jours plus tard, le modèle est officiel, ses poids sont en ligne et le calendrier s'est précisé. Reste une zone d'ombre de taille : lundi, le V4 Pro change de modèle, sauf que deux pages officielles de DeepSeek ne disent pas la même chose.
Un moteur neuf plutôt qu'un réglage
Sous le capot, ce n'est pas une mise à jour incrémentale. Le V4.1 Flash est un mixture of experts de 552 milliards de paramètres, une architecture découpée en spécialistes dont seuls quelques-uns s'activent à chaque requête. La vraie nouveauté tient dans son encodeur asymétrique : 8 milliards de paramètres actifs pour lire une demande, 16 milliards pour rédiger la réponse. Comprendre coûte ainsi moins de calcul que produire, et c'est toute l'économie du modèle qui s'en trouve changée.
Deuxième bascule : la compréhension des images est gérée nativement par le modèle, sans passer par une variante expérimentale dédiée comme l'exigeait le V4 Flash Vision. La fenêtre de contexte monte à 1 million de tokens, l'unité de découpage du texte que le modèle lit et écrit, de quoi avaler de très longs documents d'un seul morceau. Et DeepSeek précise que ce Flash est le plus petit modèle de sa nouvelle famille d'architecture : une série plus puissante est donc attendue derrière, avec un V4.1 Pro en ligne de mire.
Devant le V4 Pro sur l'essentiel mais pas partout
Sur les tâches d'agents, c'est-à-dire des modèles qui pilotent un terminal, écrivent du code ou inspectent des dépôts, le V4.1 Flash passe devant le V4 Pro sur la quasi-totalité des tests publiés. Terminal-Bench 2.1, une suite d'épreuves en ligne de commande : 90,6 contre 87,9. DeepSWE, un banc d'essai d'agents logiciels : 74,2 contre 62,7. CyberGym, orienté sécurité : 88,1 contre 83,3. Et sur les versions récentes des mêmes tests, l'écart devient spectaculaire : 31,2 contre 12,4 sur Terminal-Bench 4.0.
Le sans-faute n'existe pourtant pas. Sur le raisonnement pur, le V4 Pro garde l'avantage : 92,4 contre 90,9 sur GPQA Diamond, un examen de questions de niveau doctorat, et 42,7 contre 36,8 sur Humanity's Last Exam, un ensemble d'énigmes réputées quasi insolubles. GPT-5.6-Sol et Claude Opus 5 restent devant sur ces deux tableaux précis. Prudence d'usage : tous ces chiffres sont publiés par DeepSeek elle-même, et les tests indépendants n'ont pas encore tranché.

Les prix baissent et le cache rétrécit
La facture baisse nettement. Hors heures de pointe, l'API facture 0,003 dollar par million de tokens d'entrée quand le contexte est déjà connu du modèle (ce qu'on appelle un cache hit), 0,15 dollar quand il est nouveau, et 0,60 dollar par million de tokens de sortie. En heures de pointe, entre 3 h et 6 h puis entre 8 h et 12 h heure de Paris en semaine, ces prix doublent. Pour situer : le V4 Pro facture 0,022, 0,66 puis 1,98 dollar sur les mêmes lignes. L'entrée hors cache est ainsi divisée par plus de 4, la sortie par plus de 3.
✉️ Un moment, avant de continuer la lecture…
Le rendez-vous du dimanche : un extrait de la chronique « Un pavé dans la tech », les 4-5 infos qui comptent et un aperçu de la semaine à venir. Inscription gratuite, désinscription en un clic.
L'autre baisse est invisible mais lourde de conséquences. Le cache du modèle, la mémoire qui lui évite de retraiter ce qu'il a déjà lu, occupe désormais quatre fois moins de mémoire rapide et huit fois moins de stockage SSD que la génération précédente. Or DeepSeek rappelle que les accès au cache pèsent une grosse part de la facture des agents, ces programmes qui enchaînent des dizaines d'appels avec un contexte qui ne cesse de grossir. Moins de cache à stocker, c'est directement moins de coûts répercutés sur l'abonné.

Que devient le V4 Pro lundi ?
C'est la partie la plus intéressante, et la plus floue. La note de lancement annonce qu'à partir de lundi 14 septembre à 6 h du matin heure de Paris, toutes les requêtes adressées au V4 Pro seront dirigées vers le V4.1 Flash et facturées au prix du Flash, en attendant un futur V4.1 Pro. Autrement dit : appeler l'ancien modèle haut de gamme donnerait le nouveau modèle, moins cher, sans changer une ligne de configuration.
Mais le même jour, le journal des changements de l'API et la grille de prix de DeepSeek affichent une tout autre mention : en réponse à la demande des utilisateurs, le service V4 Pro continuerait après le 14 septembre, avec une facturation inchangée. Les pages officielles ne sont donc pas d'accord entre elles, et personne n'a encore levé l'ambiguïté. Si tu utilises le V4 Pro, ne change rien dans la précipitation : vérifie plutôt lundi matin ce que répond réellement ton API et ce que dit ta facture.
Dernière limite, au sens propre : avec 552 milliards de paramètres, ce modèle ne tournera pas sur un serveur personnel, même si ses poids sont ouverts sous licence MIT. DeepSeek invite d'ailleurs les organisations visant un déploiement à 2 000 GPU à se faire connaître. Le V4.1 Flash se consomme donc pour l'instant via l'API, en espérant que la communauté open source s'en empare comme l'éditeur le promet.
Pour écrire du français, on avait confronté DeepSeek à GLM et à Mistral : ce match-là va devoir être rejoué avec ce nouveau venu. La relève est annoncée ; lundi, on saura si le V4 Pro accepte de céder sa place.
Sources
L'annonce officielle du V4.1 Flash détaille l'architecture, les résultats et le calendrier de sortie.
Le journal des changements de l'API mentionne le maintien du service V4 Pro après le 14 septembre.
Le dépôt Hugging Face du modèle met les poids à disposition sous licence MIT.
—
Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.




No comments yet