Illustration sombre et orange : flux de données lumineux évoquant un modèle IA rapide

DeepSeek lance le V4.1 Flash : le V4 Pro rétrogradé dès jeudi

DeepSeek dévoile son V4.1 Flash : multimodal natif, des pointes à 507 tokens par seconde et de nouveaux tarifs réduits qui rétrogradent le V4 Pro dès jeudi.

Mardi 8 septembre en fin d'après-midi, DeepSeek a ouvert sans prévenir une bêta éclair de son V4.1 Flash. Le modèle de test disparaît le 10 septembre, et la sortie officielle est déjà programmée pour le 10, heure de Pékin. Derrière ce calendrier express, un signal fort : DeepSeek affirme que ce Flash nouvelle génération supplante son propre modèle haut de gamme, le V4 Pro.

Pour un utilisateur, l'affaire tient en trois chiffres : du multimodal natif, des vitesses mesurées jusqu'à 507 tokens par seconde, et un tarif d'entrée qui descend à 0,15 $ par million de tokens. Le V4 Pro, lui, va se faire rétrograder de force.

Le logo DeepSeek

Source : Wikimedia Commons.

Une bêta éclair de deux jours

Pour tester la bêta, rien de plus simple : les développeurs gardent leur adresse d'API habituelle et remplacent le nom du modèle par

deepseek-v4.1-flash-expires-on-0910 (le nom dit tout : le modèle s'éteint tout seul le 10 septembre). Même tarif que le V4 Flash, sans surcoût de test. Seule limite : 20 requêtes simultanées par compte, contre 2 500 sur la version de production.

Ce format condensé n'a rien d'anodin. DeepSeek a aussi lancé une enquête anonyme auprès des développeurs pour savoir si le V4.1 Flash peut remplacer le V4 Pro en conditions réelles. La bêta sert donc à valider une prise de risque assumée : faire passer le modèle haut de gamme sur l'architecture du modèle rapide.

Un nouveau moteur, pas un simple réglage

Ce qui distingue vraiment le V4.1 Flash, c'est son architecture entièrement repensée. Le multimodal (texte, image, audio) est pris en charge nativement par le modèle lui-même, au lieu d'être collé derrière une extension séparée. C'est le grand écart avec la génération actuelle : pour analyser une image avec le V4 Flash, il faut passer par un modèle expérimental dédié, le V4 Flash Vision.

Côté vitesse, les retours de développeurs sur X font état d'une sortie généralement supérieure à 300 tokens par seconde, avec des pointes relevées à 507. Le V4 Flash était déjà réputé rapide, et le V4.1 Flash pousse cet avantage plus loin.

Mercury 2.5, qu'on couvrait hier, avait exploré une autre voie pour accélérer la génération. DeepSeek, lui, optimise son architecture classique.

Des tarifs qui rétrogradent le V4 Pro

Selon l'annonce officielle, la sortie du V4.1 Flash est prévue autour du jeudi 10 septembre, heure de Pékin. À partir de midi le même jour, la tarification du Flash change et devient :

  • 0,003 $ par million de tokens d'entrée quand le cache est touché
  • 0,15 $ par million de tokens d'entrée hors cache
  • 0,60 $ par million de tokens de sortie

En heures de pointe, ces prix doublent. Pour comparer : le V4 Flash actuel facture 0,007 $, 0,22 $ puis 0,66 $, et le V4 Pro 0,022 $, 0,66 $ puis 1,98 $ (par million de tokens, hors heures de pointe, dans le même ordre). Le nouveau tarif Flash divise le prix d'entrée hors cache par 4,4 et le prix de sortie par 3,3 par rapport au Pro.

✉️ Un moment, avant de continuer la lecture…

La newsletter condense l'actu tech chaque dimanche : les 4-5 infos qui comptent + un outil open source à installer, en français. Inscription gratuite, désinscription en un clic.

Le plus incroyable reste la transition. DeepSeek annonce qu'après le lancement du V4.1 Flash et en attendant un V4.1 Pro, toutes les requêtes adressées au V4 Pro seront automatiquement dirigées vers le V4.1 Flash, facturées au prix du Flash. Autrement dit : payer l'ancien modèle haut de gamme donne le nouveau modèle moins cher.

Ce que ça change pour toi

Si tu utilises DeepSeek via un outil compatible avec son API (assistants de code, agents, chatbots), la facturation va baisser sans changement de configuration. Et si DeepSeek a raison sur la qualité, le rapport performance-prix devient très difficile à battre. Reste la prudence d'usage : l'affirmation de supériorité vient de l'éditeur lui-même, et elle sera à confronter aux tests indépendants dès la sortie.

Autre limite à connaître : le V4.1 Flash n'existe que sur l'API officielle, sans poids téléchargeables. Les générations précédentes de la série V4 restent disponibles sous licence MIT sur Hugging Face, mais la bêta elle-même est fermée aux organisations qui ne peuvent pas envoyer leurs données vers les serveurs de DeepSeek.

Le Kimi K3 tourne depuis quatre SSD sur un simple MacBook Pro : une démonstration locale qui montre ce qu'on peut faire sans passer par le cloud.

Sources

TechNode : les modalités de la bêta limitée dans le temps du V4.1 Flash.

BigGo Finance : détail de l'architecture, vitesses relevées et grille de prix de la série V4.

PANews : l'annonce de la sortie officielle autour du 10 septembre et le basculement des requêtes V4 Pro.

la documentation officielle de l'API DeepSeek : les modèles disponibles et les intégrations outils pour agents.

le fil Hacker News du lancement : le texte intégral de l'annonce DeepSeek, avec les nouveaux tarifs et le routage du V4 Pro.



Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.

No comments yet