À retenir
- L'annonce de Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking a été publiée le 15 septembre 2026 sur le blog officiel de Google et sur la fiche modèle DeepMind, sous la signature de Tom Ouyang (ingénieur principal) et Malini Jaganathan (équipe Gemini Audio).
- Sur ses propres benchmarks, Google revendique la première place sur l'index de qualité voix à voix d'Artificial Analysis (82,6) et la deuxième place au classement Speech Agent Arena, des chiffres publiés par l'entreprise elle-même et non vérifiés de façon indépendante.
- Le modèle atteint 97,7 % sur le benchmark Big Bench Audio et 68,6 % sur un test de tâches agentiques nommé tau-Voice, toujours selon les chiffres communiqués par Google.
- Les modèles s'intègrent à des outils tiers via des partenaires cités par Google : Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents.
- Plusieurs fonctions Workspace portent désormais le nom « Live » : Gmail Live, Docs Live et Keep Live, en plus de Search Live pour la recherche vocale.
- Aucune citation orale d'un dirigeant nommé de Google ou DeepMind n'a pu être vérifiée au sujet de ce lancement ; seule une phrase issue du billet de blog cosigné a pu être confirmée.
- La comparaison de prix avec le modèle vocal concurrent d'OpenAI, largement reprise dans la presse, n'a pas pu être vérifiée directement auprès d'OpenAI et reste donc à confirmer.
Réponse rapide
Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont deux modèles vocaux de Google DeepMind, annoncés le 15 septembre 2026, capables de tenir une conversation audio en temps réel dans 97 langues avec détection et changement de langue automatique en cours d'échange. Le modèle Extended Thinking peut raisonner pendant qu'il parle, y compris pendant des appels d'outils exécutés en arrière-plan. Les deux modèles sont accessibles via l'API Gemini, Google AI Studio, l'application Gemini, Vertex AI et Gemini Enterprise. Google facture l'audio en entrée 3 dollars par million de jetons et l'audio en sortie 12 dollars par million de jetons, soit environ 1,38 dollar par heure d'usage continu selon un calcul du média The Decoder à partir des tarifs officiels publiés par Google.
Verdict en 30 secondes
Ce lancement confirme que la voix devient le prochain terrain d'affrontement de l'IA générative, après le texte et l'image. Pour une TPE (très petite entreprise) ou une PME (petite ou moyenne entreprise), l'enjeu n'est pas la performance brute du modèle, mais la baisse spectaculaire du coût d'un assistant vocal capable de répondre à un client en temps réel, dans sa langue, sans script figé. Notre recommandation : ne construisez pas votre premier agent vocal directement sur ce modèle sans avoir chiffré un cas d'usage précis (support client, prise de rendez-vous, qualification d'appels) et sans avoir testé sa fiabilité sur vos propres scénarios, au-delà des benchmarks publiés par Google elle-même.
Qu'est-ce que Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking ?
Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont deux modèles audio vers audio (l'entrée et la sortie sont toutes deux vocales) présentés par Google DeepMind le 15 septembre 2026, sur le blog officiel de Google et sur la fiche modèle publiée par DeepMind. L'annonce est signée conjointement par Tom Ouyang, ingénieur principal, et Malini Jaganathan, membre de l'équipe technique Gemini Audio, qui écrivent que ces deux modèles apportent des avancées dans le raisonnement en quasi temps réel pour mieux permettre la création d'agents vocaux. La différence entre les deux versions : Gemini 3.8 Live Extended Thinking peut réfléchir tout en continuant de parler, y compris pendant l'exécution d'appels d'outils en arrière-plan (consulter un agenda, interroger une base de données), ce qui le destine aux agents vocaux qui doivent agir pendant la conversation plutôt qu'après.
Combien de langues Gemini 3.8 Live parle-t-il ?
Gemini 3.8 Live prend en charge 97 langues, avec une détection et un changement de langue automatiques en cours de conversation : un interlocuteur peut passer du français à l'anglais au milieu d'un échange sans que l'assistant ne perde le fil. Ce chiffre est confirmé à la fois par le blog officiel de Google, la fiche modèle de DeepMind et une publication de Logan Kilpatrick, responsable produit chez Google, ce qui en fait une donnée fiable plutôt qu'une estimation de presse.
Où utiliser Gemini 3.8 Live : API, AI Studio, application Gemini ou Workspace ?
Les deux modèles sont disponibles via l'API Gemini et Google AI Studio pour les développeurs, via l'application grand public Gemini et sa fonction Gemini Live, via Vertex AI et Gemini Enterprise pour les entreprises (y compris pour des usages de relation client), via Search Live (le mode vocal du mode IA de la recherche Google), et via plusieurs fonctions Workspace encore désignées « Live » : Gmail Live, Docs Live et Keep Live. Google cite aussi des partenaires d'intégration technique pour faciliter le déploiement de ces modèles dans des produits tiers : Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents.
Combien coûte Gemini 3.8 Live ?
Selon la page de tarification officielle de l'API Gemini, l'audio en entrée coûte 3 dollars par million de jetons (environ 0,005 dollar par minute) et l'audio en sortie 12 dollars par million de jetons (environ 0,018 dollar par minute). Cela représente environ 1,38 dollar par heure d'usage continu, un calcul réalisé par le média The Decoder à partir de ces tarifs officiels, et non un chiffre communiqué tel quel par Google. Les modalités précises d'accès gratuit ou payant pour un utilisateur grand public de l'application Gemini n'ont en revanche pas pu être confirmées avec certitude à la date de publication de cet article : à vérifier directement dans l'application avant d'en informer un client.
Gemini 3.8 Live face à la concurrence : où se situe Google ?
Sur ses propres benchmarks, Google avance un score de 82,6 sur l'index de qualité voix à voix d'Artificial Analysis (où l'entreprise revendique la première place), 68,6 % sur un test de réalisation de tâches agentiques baptisé tau-Voice, 97,7 % sur Big Bench Audio, 35,1 % sur un test bancaire tau-Voice conçu par Sierra, et une deuxième place au classement Speech Agent Arena. Ce sont des chiffres publiés par Google elle-même, pas des mesures indépendantes : à traiter comme une revendication du constructeur plutôt que comme un verdict neutre. Plusieurs médias rapportent par ailleurs que Gemini 3.8 Live serait nettement moins cher que le modèle vocal concurrent d'OpenAI, mais cette comparaison de prix provient de sources secondaires et n'a pas pu être vérifiée directement auprès d'OpenAI ; elle est donc à manier avec prudence.
| Critère | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Raisonnement pendant la parole | Non | Oui, y compris en arrière-plan (gagnant) |
| Langues supportées | 97 langues | 97 langues |
| Usage recommandé | Conversation vocale simple (gagnant coût) | Agent vocal qui doit agir pendant l'appel |
| Disponibilité | API, AI Studio, app Gemini, Vertex AI, Enterprise | API, AI Studio, Vertex AI, Enterprise |
Quel choix selon votre profil ?
Ce lancement se lit différemment selon votre situation professionnelle.
Professionnel en évolution ou reconversion. Savoir distinguer un modèle « Live » classique d'un modèle « Extended Thinking » devient une compétence utile pour évaluer un projet d'agent vocal en entretien ou en poste, bien avant de savoir le configurer techniquement.
Indépendant ou expert. Un tarif à l'heure d'usage aussi bas ouvre la voie à des prestations de conseil sur mesure : audit de faisabilité d'un agent vocal pour un client, avant que celui-ci n'investisse dans un déploiement complet.
TPE et PME. C'est le profil le plus directement concerné : un standard téléphonique ou un support client vocal disponible dans 97 langues, facturé à l'usage plutôt qu'en licence fixe, change le calcul de rentabilité d'un projet qui semblait réservé aux grands comptes il y a encore un an.
ETI et grand groupe. L'intégration via Vertex AI et Gemini Enterprise pose la question de la gouvernance : quels flux vocaux clients transitent par quel modèle, avec quelle politique de rétention des enregistrements, et selon quelles règles de conformité sectorielle.
Quels pièges éviter avant de déployer un agent vocal Gemini 3.8 Live ?
Premier piège : confondre les benchmarks publiés par Google avec une garantie de performance sur votre propre cas d'usage. Un score élevé sur un test de qualité voix à voix ne dit rien de la façon dont le modèle gérera un accent régional, un environnement bruyant ou un jargon métier spécifique à votre secteur. Deuxième piège : lancer un agent vocal en production sans avoir chiffré précisément le coût réel par appel ou par heure, en tenant compte du volume attendu, avant de le comparer au coût d'un centre d'appels humain ou d'une solution existante. Troisième piège : ignorer les questions de conformité liées à l'enregistrement et au traitement de conversations vocales avec des clients, en particulier si ces échanges contiennent des données personnelles ou sensibles.
Ce que Studeria retient
Gemini 3.8 Live n'est pas une rupture technologique isolée : c'est la confirmation que les grands éditeurs d'IA générative structurent désormais une offensive commune sur la voix, avec un argument de prix qui rend l'agent vocal accessible à des entreprises qui n'auraient pas pu l'envisager il y a un an. Notre position : la baisse de coût change la question posée aux TPE et PME. Ce n'est plus « peut-on se permettre un agent vocal IA », mais « pour quel cas d'usage précis, avec quel budget de test, et avec quelle vérification de conformité avant le premier appel client réel ».
Pour aller plus loin
Articles Studeria :
FAQ article
Qu'est-ce que Gemini 3.8 Live ?
Combien de langues Gemini 3.8 Live parle-t-il ?
Où peut-on utiliser Gemini 3.8 Live ?
Combien coûte Gemini 3.8 Live ?
Gemini 3.8 Live est-il plus performant que la concurrence ?
Qu'apporte la version Extended Thinking par rapport à Gemini 3.8 Live classique ?
Une TPE ou une PME peut-elle déployer un agent vocal avec Gemini 3.8 Live ?
4,9/5
Boostez vos compétences
+5000 apprenants formés
Nos parcours s’adaptent à vos objectifs, à votre rythme et à votre niveau.

4,7/5
sur 171 avis

+200 entreprises formées à l’IA
De la startup au grand groupe, nos parcours sont pensées pour déployer des solutions performantes avec l’IA .

Prêt à te former ?
Trois parcours selon ton objectif : apprendre, te certifier, ou lancer ton activité.
Parcours Incubateur IA
Comprenez l’IA, gagnez du temps au quotidien et valorisez votre profil professionnel
Parcours Accélérateur IA
Implémentez l’IA grâce à un accompagnement stratégique et opérationnel pour structurer, automatiser et scaler votre business
Parcours Implémentation & Agent IA
TPE, PME, ETI : Un parcours stratégique pour former vos équipes et implémenter les bons outils IA dans votre entreprise.
Du dimanche 5 avril au jeudi 9 avril 2026
Le sommet IA 2026
Cinq soirées de démonstrations live, de conseils actionnables et d'échanges avec certains des entrepreneurs et experts les plus influents de France, le tout sans écrire une seule ligne de code.

Du dimanche 28 Juin au jeudi 2 Juillet 2026
Le sommet IA 2026
Cinq soirées de démonstrations live, de conseils actionnables et d'échanges avec certains des entrepreneurs et experts les plus influents de France, le tout sans écrire une seule ligne de code.









