15 septembre 2026, Google a présenté deux nouveaux modèles — Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking. Ils sont positionnés comme les modèles les plus avancés pour le dialogue en direct, optimisés pour une faible latence et le temps réel.
La principale différence avec leurs prédécesseurs, tels que Gemini 3.1 Flash Live, réside dans la prise en charge du raisonnement entrelacé et des appels de fonctions asynchrones. Le modèle peut raisonner et générer simultanément de la parole, tandis que les outils s'exécutent en arrière-plan sans interrompre la conversation.
Cela est rendu possible grâce à une architecture audio native, où l'entrée et la sortie sont l'audio et le texte en temps réel. Le contexte visuel en quasi temps réel, le basculement automatique entre 97 langues et les mises à jour du contenu de la session sont pris en charge. Le prix est de $0.005 par minute d'entrée audio et de $0.018 par minute de sortie.
Extended Thinking est en tête des benchmarks : 82.6 points sur l'Artificial Analysis Speech to Speech Quality Index, 68.6% sur τ-Voice, 35.1% sur Sierra’s τ-Voice-banking et 97.7% sur Big Bench Audio. La version de base occupe la deuxième place dans le Speech Agent Arena et affiche de solides résultats sur EVA-Bench.
La méthodologie des benchmarks se concentre sur l'achèvement de tâches agentiques et la qualité de la parole, mais ne révèle pas toujours les détails des tests held-out ou la comparaison avec des scénarios zero-shot. Cela laisse des questions sur la généralisation réelle au-delà de tâches d'entreprise spécifiques.
Dans le paysage, cela diffère des approches d'OpenAI avec GPT-Live et de xAI avec Grok Voice Think Fast. Google met l'accent sur l'exécution parallèle des tâches et l'ancrage visuel, et non uniquement sur la vitesse de réponse. Les modèles précédents exigeaient souvent des pauses pour le raisonnement, ce qui nuisait au naturel du dialogue.
Les nouvelles capacités ouvrent la voie à des agents vocaux de qualité production, où le modèle peut effectuer des opérations complexes à plusieurs étapes tout en préservant le flux conversationnel. Cela est particulièrement visible dans les intégrations avec Search Live, Gemini Live et Workspace.
On ne sait pas encore dans quelle mesure les résultats sont robustes lors d'une vérification indépendante et dans des conditions de bruit réel ou d'accents. La communauté testera probablement la latence dans les cas limites et comparera avec des alternatives open-source.
Le changement clé est le passage d'interfaces vocales réactives à des interfaces véritablement agentiques, où le raisonnement n'entrave pas la communication naturelle.

