À retenir

  • Modèle vedette : Gemini 3.6 Flash dépasse 3.5 Flash et même le plus gros modèle 3.1 Pro sur la plupart des benchmarks de code et d'agent (Google, juillet 2026).
  • Connaissance plus récente : sa date de connaissance passe à mars 2026, contre janvier 2025 pour 3.5 Flash.
  • Usage de l'ordinateur natif : le computer use devient un outil intégré, directement dans l'API Gemini.
  • Pas de gagnant unique : GPT-5.6 Luna, Grok 4.5 et Claude Sonnet 5 gardent l'avantage sur certains tests, Gemini 3.6 Flash sur d'autres (officechai, juillet 2026).
  • Flash-Lite très rapide : à 350 tokens par seconde et 0,30 $ / 2,50 $, il bat même l'ancien 3 Flash sur SWE-Bench Pro et OSWorld-Verified.
  • Déjà adopté : des clients comme Harvey, Hebbia et Figma l'utilisent pour l'analyse de documents, de graphiques et de données.
  • La suite arrive : Gemini 3.5 Pro est en test chez des partenaires et Google a démarré l'entraînement de Gemini 4.

Réponse rapide. Google a lancé le 21 juillet 2026 trois nouveaux modèles Gemini de la gamme Flash, sa série rapide et économique conçue pour faire tourner des agents IA à grande échelle. Gemini 3.6 Flash devient le modèle polyvalent par défaut : il consomme 17 % de tokens de sortie en moins que 3.5 Flash pour une meilleure qualité, à 1,50 $ en entrée et 7,50 $ en sortie par million de tokens. Gemini 3.5 Flash-Lite vise le très haut volume : 350 tokens par seconde, 0,30 $ / 2,50 $. Gemini 3.5 Flash Cyber, spécialisé en cybersécurité, reste réservé aux gouvernements et partenaires de confiance.

Verdict en 30 secondes

Le chiffre à regarder n'est pas le prix affiché au token, mais le coût par tâche. Un modèle qui utilise moins de tokens et fait moins d'appels d'outils pour un même travail coûte moins cher à l'usage, même si son étiquette n'est pas la plus basse du marché. C'est exactement le pari de cette gamme.

Pour qui construit des automatisations ou des agents : adoptez 3.6 Flash comme modèle par défaut, réservez Flash-Lite aux tâches répétitives à fort volume, et pilotez le coût réel par tâche plutôt que la grille tarifaire. Studeria recommande de tester sur un cas métier concret avant de basculer un flux en production. Le bon modèle est celui qui fait le travail au moindre coût total, pas celui qui affiche le plus petit prix.

Qu'a annoncé Google le 21 juillet 2026 ?

Google a dévoilé trois modèles Gemini en même temps, tous issus de la gamme Flash : la série pensée pour la vitesse, le faible coût et la fiabilité à grande échelle. Un LLM (Large Language Model, grand modèle de langage) de type Flash n'est pas le plus puissant du catalogue, mais c'est le cheval de trait des usages à fort volume : automatisations, agents, traitement de documents. L'annonce est signée Tulsee Doshi, Senior Director Product Management chez Google, qui résume l'intention en une phrase : « Our newest Gemini models deliver the efficiency, latency, and reliability to build AI agents at scale » (Tulsee Doshi, Google, juillet 2026). En clair, ces modèles visent l'efficacité, la latence et la fiabilité nécessaires pour construire des agents à grande échelle.

Les trois modèles servent des besoins distincts. Gemini 3.6 Flash est le modèle polyvalent par défaut. Gemini 3.5 Flash-Lite vise le très haut volume à moindre coût. Gemini 3.5 Flash Cyber est un modèle spécialisé en cybersécurité, réservé à un usage encadré. Google a par ailleurs confirmé que Gemini 3.5 Pro, son modèle haut de gamme attendu depuis l'été, est encore en test chez des partenaires, et que l'entraînement de Gemini 4, décrit comme le plus ambitieux à ce jour, a commencé. Le retard de la version Pro, révélé par Bloomberg mi-juillet, a d'ailleurs fait reculer l'action Alphabet d'environ 4,4 % en une séance.

L'annonce, en direct de l'équipe Gemini :

Gemini 3.6 Flash : qu'est-ce qui change vraiment ?

Gemini 3.6 Flash apporte plus de qualité pour moins de tokens, donc un coût par tâche en baisse. Selon l'indice Artificial Analysis, le modèle consomme 17 % de tokens de sortie en moins que 3.5 Flash, et jusqu'à 65 % en moins sur certains tests comme DeepSWE. Il prend aussi moins d'étapes de raisonnement et moins d'appels d'outils pour un même travail. Côté prix, la sortie passe de 9 à 7,50 dollars par million de tokens (l'entrée reste à 1,50 dollar). Résultat combiné : sur une tâche générant beaucoup de texte, la facture par tâche baisse d'environ un tiers.

La qualité progresse malgré cette efficacité accrue. Face à 3.5 Flash, Gemini 3.6 Flash gagne sur le code (DeepSWE, 49 % contre 37 %), sur la recherche en apprentissage automatique (MLE-Bench, 63,9 % contre 49,7 %), sur l'usage de l'ordinateur (OSWorld-Verified, 83,0 % contre 78,4 %) et sur le travail de la connaissance (GDPval-AA v2, 1421 contre 1349). Sa date de connaissance passe à mars 2026, contre janvier 2025 auparavant, et l'usage de l'ordinateur (computer use) devient un outil natif de l'API. Des clients comme Harvey, Hebbia et Figma l'exploitent déjà pour l'analyse de documents, de graphiques et de données. Le modèle embarque aussi des garde-fous renforcés contre les usages chimiques, biologiques, radiologiques, nucléaires (CBRN) et cyber offensifs.

Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber : le comparatif

Les trois nouveaux modèles ne s'adressent pas au même usage. Voici comment ils se positionnent.

Critère Gemini 3.6 Flash Gemini 3.5 Flash-Lite Gemini 3.5 Flash Cyber
Rôle Modèle polyvalent par défaut Le plus rapide et économique Spécialisé cybersécurité
Prix entrée / sortie (1M tokens) 1,50 $ / 7,50 $ 0,30 $ / 2,50 $ Non communiqué (accès restreint)
Fenêtre de contexte 1 M tokens 1 M tokens Non communiqué (accès restreint)
Vitesse de sortie ~275 tokens/s 350 tokens/s Non communiqué (accès restreint)
Atout clé 17 % de tokens de sortie en moins que 3.5 Flash 350 tokens par seconde Trouve et corrige les failles à moindre coût
Disponibilité API, Gemini Enterprise, app Gemini API, app Gemini, Google Search Gouvernements et partenaires de confiance (pilote CodeMender)
Idéal pour Agents et travail de la connaissance Tâches à très haut volume Équipes de défense et sécurité logicielle

Fenêtres de contexte et vitesses de sortie mesurées par Artificial Analysis (juillet 2026) ; Gemini 3.5 Flash Cyber n'est pas commercialisé publiquement.

Gemini 3.6 Flash face à Claude et GPT : où se situe-t-il ?

Sur le prix comme sur les benchmarks, Gemini 3.6 Flash se place bien, mais aucun modèle rapide ne domine partout en juillet 2026. Côté tarif API (prix standard par million de tokens), Claude Haiku 4.5 est à 1 $ en entrée et 5 $ en sortie, GPT-5.6 Luna à 1 $ et 6 $, quand Gemini 3.6 Flash affiche 1,50 $ et 7,50 $. Sur l'étiquette seule, Gemini 3.6 Flash n'est donc pas le moins cher de sa catégorie. C'est au plancher que Google reprend l'avantage : Gemini 3.5 Flash-Lite, à 0,30 $ / 2,50 $, coûte trois à quatre fois moins que Claude Haiku 4.5.

Côté performances, l'analyse indépendante d'officechai (juillet 2026) montre un partage selon les tâches : GPT-5.6 Luna mène sur DeepSWE, Grok 4.5 sur SWE-Bench Pro, Claude Sonnet 5 sur le travail de la connaissance, tandis que Gemini 3.6 Flash tient la tête sur l'usage de l'ordinateur (OSWorld-Verified) et sur les tests de contexte long. L'accueil est d'ailleurs contrasté : sur l'indice Artificial Analysis, le modèle obtient un score de 50, au niveau de 3.5 Flash, ce que certains observateurs jugent décevant ; sur le classement Arena, il progresse en revanche nettement, passant de la 21e à la 12e place. La leçon est simple : le prix au token ne dit pas le coût par tâche. Un modèle plus efficace, qui utilise moins de tokens et fait moins d'appels d'outils, peut revenir moins cher à l'usage qu'un modèle au prix affiché plus bas. Le seul juge de paix, c'est le test sur votre propre cas.

Gemini 3.5 Flash-Lite : le modèle du très haut volume

Gemini 3.5 Flash-Lite est conçu pour la vitesse et le volume, pas pour la finesse maximale. Il tourne à 350 tokens par seconde et coûte 0,30 $ en entrée et 2,50 $ en sortie par million de tokens, un prix plancher pour du trafic de production massif. Il écrase la génération précédente 3.1 Flash-Lite (Terminal-Bench 2.1, 54 % contre 31 % ; GDPval-AA v2, 1140 contre 642) et dépasse même l'ancien modèle 3 Flash sur plusieurs épreuves d'agent et de code (SWE-Bench Pro, 54,2 % contre 49,6 % ; OSWorld-Verified, 74,0 % contre 65,1 %).

Son terrain de jeu : la recherche agentique, le traitement de documents, la modération de contenu, la traduction et l'extraction de données en masse. Il embarque des niveaux de raisonnement configurables, du plus économique pour les tâches simples au plus poussé pour des sous-agents multi-étapes, et intègre lui aussi l'usage de l'ordinateur. Des clients comme Palo Alto Networks, Ramp et Ashler l'utilisent déjà pour passer à l'échelle. Il se déploie aussi progressivement dans Google Search.

Gemini 3.5 Flash Cyber : à qui s'adresse-t-il ?

Gemini 3.5 Flash Cyber est un modèle spécialisé, réservé à la défense informatique, et il n'est pas ouvert au public. Construit sur 3.5 Flash puis affiné pour trouver et corriger les vulnérabilités logicielles, il fonctionne à l'intérieur de CodeMender, l'agent de sécurité du code de Google DeepMind, où plusieurs de ses instances collaborent pour produire un rapport unique. Sur le benchmark de référence CyberGym, il atteint une performance compétitive au plus haut niveau, à un coût par token inférieur aux plus gros modèles.

Compte tenu de sa nature à double usage, Google a choisi un déploiement encadré : le modèle est exclusivement disponible pour les gouvernements et des partenaires de confiance, via CodeMender, dans le cadre d'un programme pilote à accès limité. L'objectif affiché est de donner une longueur d'avance aux défenseurs pour réparer les failles critiques avant qu'elles ne soient exploitées, tout en limitant les détournements. Pour une TPE ou une PME, ce modèle n'est pas accessible directement ; ce qui compte, c'est le signal : la cybersécurité assistée par IA devient un chantier de fond.

Quel modèle choisir selon votre profil ?

Le bon modèle dépend de ce que vous construisez et de votre rôle. Voici la correspondance.

Salarié ou en reconversion. Vous n'avez pas besoin d'appeler ces modèles par API pour en profiter : Gemini 3.6 Flash alimente l'application Gemini, et 3.5 Flash-Lite arrive dans Google Search. Comprendre comment fonctionnent ces modèles rapides, leurs forces et leurs limites, est une compétence recherchée sur le marché. C'est l'objet du parcours Incubateur IA.

Indépendant, consultant ou formateur. C'est vous que Google vise en premier. Un modèle plus efficace et moins cher, c'est une marge directe sur vos automatisations et vos agents vendus à des clients. Savoir choisir le bon modèle, mesurer le coût par tâche et structurer une offre d'agents IA différenciante est un levier business immédiat, au cœur du parcours Accélérateur IA et du parcours Consultant IA.

Dirigeant de TPE ou PME. La bonne nouvelle, c'est le rapport qualité-prix : ces modèles permettent d'automatiser des tâches (relances, tri de documents, réponses clients) pour un coût marginal. Encore faut-il identifier les bons cas d'usage avant d'investir. Un diagnostic ciblé via l'Audit IA, puis une implémentation d'agent IA, évitent de payer pour des outils que personne n'utilise.

ETI ou grand groupe. L'enjeu est le déploiement à grande échelle : choisir la bonne combinaison de modèles (3.6 Flash pour la qualité, Flash-Lite pour le volume), gouverner les coûts et sécuriser les usages. Un audit stratégique et une formation des équipes permettent d'industrialiser sans dériver.

Les pièges à éviter

  • Choisir un modèle au prix affiché. Le coût réel se mesure par tâche, pas au token. Un modèle efficace peut revenir moins cher qu'un modèle à l'étiquette plus basse.
  • Prendre le plus gros modèle par réflexe. Pour une tâche répétitive à fort volume, Flash-Lite fait le travail à une fraction du coût d'un modèle frontière.
  • Basculer en production sans test. Les performances varient selon le cas d'usage. Testez sur vos propres données avant de migrer un flux critique.
  • Ignorer l'efficacité en tokens. 17 % de tokens en moins et moins d'appels d'outils, à l'échelle de milliers de tâches par jour, changent la facture mensuelle.
  • Croire que Flash Cyber est accessible. Ce modèle est réservé aux gouvernements et partenaires de confiance ; il ne s'intègre pas dans un projet d'entreprise classique.
  • Se figer sur un seul fournisseur. Aucun modèle ne domine tous les tests. Une bonne pratique consiste à garder la possibilité de changer de modèle selon la tâche.

Ce que Studeria retient

Gemini 3.6 Flash confirme la direction prise par tout le secteur en 2026 : la course ne se joue plus seulement sur la puissance brute, mais sur le coût par tâche et l'efficacité à l'échelle. Google baisse le prix de sortie, réduit la consommation de tokens et livre un modèle qui, pour les utilisateurs de 3.5 Flash, revient à une mise à jour quasi gratuite. Avec Flash-Lite au plancher tarifaire et Flash Cyber sur le front de la sécurité, la gamme couvre désormais du prototype rapide au déploiement massif. Mais la leçon de fond dépasse Gemini : le bon réflexe n'est pas de suivre les annonces, c'est de savoir tester, mesurer et choisir le modèle adapté à chaque cas d'usage. Les modèles changent tous les mois ; la compétence à les évaluer, elle, dure. C'est exactement ce que Studeria installe dans les équipes.

Pour aller plus loin

Sur le blog Studeria :

Sources externes citées dans cet article :

FAQ article

Qu'est-ce que Gemini 3.6 Flash ?

Combien coûte Gemini 3.6 Flash ?

Gemini 3.6 Flash est-il meilleur que Claude Haiku 4.5 ou GPT-5.6 Luna ?

Quelle différence entre Gemini 3.6 Flash et Gemini 3.5 Flash-Lite ?

Qu'est-ce que Gemini 3.5 Flash Cyber et puis-je l'utiliser ?

Où utiliser Gemini 3.6 Flash et Gemini 3.5 Flash-Lite ?

Faut-il migrer ses automatisations vers Gemini 3.6 Flash ?

Sommaire
Text Link
Découvrez le parcours Accélérateur IA
Implémentez l’IA grâce à un accompagnement stratégique et opérationnel pour structurer, automatiser et scaler votre business
En savoir plus

4,9/5

Boostez vos compétences

+5000 apprenants formés

Nos parcours s’adaptent à vos objectifs, à votre rythme et à votre niveau.

Nos parcours pour particuliers

4,7/5

sur 171 avis

+200 entreprises formées à l’IA

De la startup au grand groupe, nos parcours sont pensées pour déployer des solutions performantes avec l’IA .

Nos parcours entreprises

Prêt à te former ?

Trois parcours selon ton objectif : apprendre, te certifier, ou lancer ton activité.

Nos parcours pour particuliers

Formez vos équipes

Intégrez efficacement l’IA et l’automatisation
dans votre entreprise.

Former mes équipes

Parcours Incubateur IA

Comprenez l’IA, gagnez du temps au quotidien et valorisez votre profil professionnel

Découvrir la formation

Parcours Consultant IA

Monétisez vos compétences IA et décrocher vos premières missions

Découvrir la formation

Parcours Accélérateur IA

Implémentez l’IA grâce à un accompagnement stratégique et opérationnel pour structurer, automatiser et scaler votre business

Découvrir la formation

Parcours Audit IA

Une approche personnalisée pour favoriser la collaboration et l’innovation

Découvrir la formation

Parcours Formation IA

Acculturation et formation de vos équipes aux outils IA métiers

Découvrir la formation

Parcours Implémentation & Agent IA

TPE, PME, ETI : Un parcours stratégique pour former vos équipes et implémenter les bons outils IA dans votre entreprise.

Découvrir la formation

Parlons-en ensemble

Prendre rendez-vous

Du dimanche 5 avril au jeudi 9 avril 2026

Le sommet IA 2026

Cinq soirées de démonstrations live, de conseils actionnables et d'échanges avec certains des entrepreneurs et experts les plus influents de France, le tout sans écrire une seule ligne de code.

Je m'inscris gratuitement

Du dimanche 28 Juin au jeudi 2 Juillet 2026

Le sommet IA 2026

Cinq soirées de démonstrations live, de conseils actionnables et d'échanges avec certains des entrepreneurs et experts les plus influents de France, le tout sans écrire une seule ligne de code.

Je m'inscris gratuitement