Gemini 3.8 Live: cómo el interleaved reasoning y las llamadas asíncronas a herramientas están cambiando a los agentes de voz de Google

Editado por: Svitlana Velhush

El 15 de septiembre de 2026, Google presentó dos nuevos modelos: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. Se posicionan como los modelos más avanzados para el diálogo en vivo, optimizados para una baja latencia y tiempo real.

La principal diferencia con sus predecesores, como Gemini 3.1 Flash Live, radica en la compatibilidad con el interleaved reasoning y las llamadas asíncronas a funciones. El modelo puede razonar y generar voz simultáneamente, mientras que las herramientas se ejecutan en segundo plano sin interrumpir la conversación.

Esto se logra gracias a una arquitectura de audio nativa, donde la entrada y la salida son audio y texto en tiempo real. Se admite el contexto visual casi en tiempo real, el cambio automático entre 97 idiomas y las actualizaciones del contenido de la sesión. El precio es de $0.005 por minuto de entrada de audio y $0.018 por minuto de salida.

Extended Thinking lidera en los benchmarks: 82.6 puntos en el Artificial Analysis Speech to Speech Quality Index, 68.6% en τ-Voice, 35.1% en Sierra’s τ-Voice-banking y 97.7% en Big Bench Audio. La versión básica ocupa el segundo lugar en Speech Agent Arena y muestra resultados sólidos en EVA-Bench.

La metodología de los benchmarks se centra en el agentic task completion y la calidad de la voz, pero no siempre revela detalles de las pruebas held-out o comparaciones con escenarios zero-shot. Esto deja dudas sobre la generalización real más allá de tareas empresariales específicas.

En el panorama actual, esto difiere de los enfoques de OpenAI con GPT-Live y xAI con Grok Voice Think Fast. Google pone énfasis en la ejecución paralela de tareas y el grounding visual, no solo en la velocidad de respuesta. Los modelos anteriores a menudo requerían pausas para el reasoning, lo que interrumpía la naturalidad del diálogo.

Las nuevas capacidades abren el camino a agentes de voz de nivel production-grade, donde el modelo puede realizar operaciones complejas de varios pasos manteniendo el flujo conversacional. Esto es especialmente notable en las integraciones con Search Live, Gemini Live y Workspace.

Sigue sin estar claro cuán estables son los resultados bajo una verificación independiente y en condiciones de ruido real o acentos. Es probable que la comunidad pruebe la latencia en casos extremos (edge-cases) y la compare con alternativas de código abierto.

El cambio clave es la transición de interfaces de voz reactivas a otras truly agentic, donde el reasoning no interfiere con la comunicación natural.

3 Vues

Fuentes

  • Google launches Gemini 3.8 Live models

Comentarios

Lea más artículos sobre este tema:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
¿Encontró un error o inexactitud?Consideraremos sus comentarios lo antes posible.