Illustration IA de Gemini 3.8 Flash, spirale de noeuds lumineux orange

Six semaines, trois Gemini Flash : Google met le turbo sur les agents et le code

Six semaines, trois Gemini Flash : la 3.8 sort au même prix que la 3.7 et muscle les agents autonomes et le code. Testable dès maintenant dans Gemini et Antigravity.

Depuis six semaines, Google sort des Gemini Flash à un rythme de forcené : la 3.6 début août, la 3.7 le 13 août, et dès ce mercredi la 3.8. Une nouvelle Flash qui muscle surtout les agents autonomes et l'ingénierie logicielle, présentée comme « notre modèle de travail le plus intelligent pour le code et les agents ». On te résume ce qui change vraiment, et ce que cette cadence dit de la stratégie de Google.

Qu'est-ce que Gemini 3.8 Flash, exactement ?

Gemini est la famille de modèles d'IA de Google, accessible dans l'application Gemini, via le site Gemini, en API pour les développeurs, ou dans les outils d'agents comme Antigravity. Les « Flash » sont la version rapide et économique de la gamme : moins puissants que les « Pro », mais bien plus rapides et beaucoup moins chers, idéaux pour les tâches répétitives et à gros volume.

La 3.8 Flash succède directement à la 3.7 Flash, sortie en août. Google la positionne comme « notre modèle de travail le plus intelligent pour le code et les agents », et l'a pensée avant tout pour l'exécution d'agents : ces programmes qui reçoivent un objectif et travaillent tout seuls, en multipliant les étapes jusqu'au résultat. C'est le cœur du sujet : rendre les agents plus fiables et plus endurants.

Pourquoi ça compte pour les agents

La promesse la plus intéressante tient dans l'endurance. Google affirme que la 3.8 Flash « excelle sur les tâches longues et denses en documents », et l'éditeur Glean, qui intègre le modèle, dit qu'elle « complète plus de trois fois plus de tâches que la 3.7 Flash » dans ses évaluations. Concrètement : là où un modèle précédent aurait décroché après quelques pas, la 3.8 tient le cap sur des parcours à plusieurs dizaines d'étapes, en relisant au besoin le contexte déjà produit.

Google met aussi en avant la cohérence des raisonnements (un concept que les chercheurs nomment « longueur d'effort » : le modèle peut choisir de réfléchir plus pour les problèmes difficiles), la gestion directe de dossiers, et une compréhension multimodale qui couvre texte, image, audio, vidéo et PDF. Pour l'utilisateur, ça veut dire des agents capables de manipuler de vrais documents de travail, pas seulement des lignes de texte.

Et pour le code ?

La 3.8 Flash garde la spécialité de sa gamme : écrire et corriger du code. Les démonstrations officielles montrent des jeux complets et une carte en trois dimensions générés en une seule instruction, et un outil de visualisation matérielle interactif. Sur les bancs d'essai, elle devance la 3.7 Flash et plusieurs modèles dits « frontaux » (les plus puissants du marché) : 10 % sur le benchmark juridique de Harvey contre 8,8 % pour la 3.7, et une avance sur des domaines comme la finance.

Résultat de Gemini 3.8 Flash sur le benchmark HLE-Verified, selon l'évaluation publiée par Google DeepMind.

Source : évaluation officielle de Google DeepMind (model card Gemini 3.8 Flash).

Il faut garder deux précisions. D'abord, ces chiffres viennent de Google et de ses partenaires, pas d'une source neutre : ils disent la direction, pas nécessairement la réalité pour ton cas précis. Ensuite, la 3.8 reste un modèle « Flash » : pas question de remplacer un modèle Pro pour des raisonnements très lourds. Son terrain, c'est le grand volume, la vitesse et le coût maîtrisé.

Comment l'essayer et combien ça coûte

Pour un usage grand public, c'est simple : le modèle est disponible dans Gemini (site et application), dans Google Antigravity, le studio d'agents de Google, et tu peux aussi le tester gratuitement dans Google AI Studio pour voir ce qu'il donne en direct. Pour les développeurs, l'accès se fait via l'API Gemini en une ligne de configuration, avec un contexte de 1 million de jetons : autant dire très large pour charger un gros dossier.

Côté tarifs, Google a publié sa grille : la 3.8 Flash est facturée au même prix que la 3.7 Flash. Sur l'API payante, comptez 0,75 dollar par million de jetons en entrée et 3,75 dollars par million en sortie (raisonnement compris) jusqu'au 31 décembre 2026, puis le tarif double ensuite. C'est toujours deux à quatre fois moins cher qu'un gros modèle, avec un mode gratuit pour débuter. Deux mises en garde : les modèles de cette gamme ont un compilateur de connaissances qui s'arrête à mars 2026, et l'équipe reconnaît une légère régression sur certaines langues hors anglais. Autant de bonnes raisons de tester plutôt que de croire sur parole.

En bref

Gemini 3.8 Flash n'est pas une révolution, c'est un progrès bien placé : plus endurante pour les agents, plus douée pour le code, et visiblement très compétitive en raisonnement pour un modèle « rapide ». Ce qui risque de changer pour toi, c'est la fiabilité des assistants qui agissent à ta place : sur la durée, ces modèles-là définissent ce que les agents pourront vraiment faire seuls.

À noter : Google présente la 3.8 Flash comme « New Stable », autrement dit disponible en production et pas en simple aperçu, dans toutes ses surfaces, de l'application aux outils d'agents.

Sources

Page Gemini 3.8 Flash de Google DeepMind — la fiche officielle du modèle, avec les usages et les partenaires.

Model card Gemini 3.8 Flash (Google DeepMind) — le document officiel publié le 2 septembre 2026, avec les limites et l'évaluation.

Présentation de Gemini 3.8 Flash sur Google AI for Developers — la page qui annonce la disponibilité et l'endpoint de l'API.

Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.

No comments yet