El 15 de septiembre de 2026, Google presentó dos nuevos modelos: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. Se posicionan como los modelos más avanzados para el diálogo en vivo, optimizados para una baja latencia y tiempo real.
La principal diferencia con sus predecesores, como Gemini 3.1 Flash Live, radica en la compatibilidad con el interleaved reasoning y las llamadas asíncronas a funciones. El modelo puede razonar y generar voz simultáneamente, mientras que las herramientas se ejecutan en segundo plano sin interrumpir la conversación.
Esto se logra gracias a una arquitectura de audio nativa, donde la entrada y la salida son audio y texto en tiempo real. Se admite el contexto visual casi en tiempo real, el cambio automático entre 97 idiomas y las actualizaciones del contenido de la sesión. El precio es de $0.005 por minuto de entrada de audio y $0.018 por minuto de salida.
Extended Thinking lidera en los benchmarks: 82.6 puntos en el Artificial Analysis Speech to Speech Quality Index, 68.6% en τ-Voice, 35.1% en Sierra’s τ-Voice-banking y 97.7% en Big Bench Audio. La versión básica ocupa el segundo lugar en Speech Agent Arena y muestra resultados sólidos en EVA-Bench.
La metodología de los benchmarks se centra en el agentic task completion y la calidad de la voz, pero no siempre revela detalles de las pruebas held-out o comparaciones con escenarios zero-shot. Esto deja dudas sobre la generalización real más allá de tareas empresariales específicas.
En el panorama actual, esto difiere de los enfoques de OpenAI con GPT-Live y xAI con Grok Voice Think Fast. Google pone énfasis en la ejecución paralela de tareas y el grounding visual, no solo en la velocidad de respuesta. Los modelos anteriores a menudo requerían pausas para el reasoning, lo que interrumpía la naturalidad del diálogo.
Las nuevas capacidades abren el camino a agentes de voz de nivel production-grade, donde el modelo puede realizar operaciones complejas de varios pasos manteniendo el flujo conversacional. Esto es especialmente notable en las integraciones con Search Live, Gemini Live y Workspace.
Sigue sin estar claro cuán estables son los resultados bajo una verificación independiente y en condiciones de ruido real o acentos. Es probable que la comunidad pruebe la latencia en casos extremos (edge-cases) y la compare con alternativas de código abierto.
El cambio clave es la transición de interfaces de voz reactivas a otras truly agentic, donde el reasoning no interfiere con la comunicación natural.

