Gemini 3.8 Live: como o raciocínio intercalado e as chamadas assíncronas de ferramentas estão a mudar os agentes de voz da Google

Editado por: Svitlana Velhush

15 de setembro de 2026, a Google apresentou dois novos modelos — Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking. São posicionados como os modelos mais avançados para diálogo ao vivo, otimizados para baixa latência e tempo real.

A principal diferença em relação aos antecessores, como o Gemini 3.1 Flash Live, reside no suporte ao raciocínio intercalado e às chamadas assíncronas de funções. O modelo pode raciocinar e, ao mesmo tempo, gerar fala, enquanto as ferramentas são executadas em segundo plano sem interromper a conversa.

Isto é conseguido graças a uma arquitetura de áudio nativa, em que a entrada e a saída são áudio e texto em tempo real. São suportados contexto visual em near real-time, alternância automática entre 97 idiomas e atualizações do conteúdo da sessão. O preço é $0.005 por minuto de entrada de áudio e $0.018 por minuto de saída.

O Extended Thinking lidera nos benchmarks: 82.6 pontos no Artificial Analysis Speech to Speech Quality Index, 68.6% no τ-Voice, 35.1% no Sierra’s τ-Voice-banking e 97.7% no Big Bench Audio. A versão base ocupa o segundo lugar na Speech Agent Arena e apresenta resultados fortes no EVA-Bench.

A metodologia dos benchmarks centra-se na agentic task completion e na qualidade da fala, mas nem sempre revela detalhes dos testes held-out ou da comparação com cenários zero-shot. Isto deixa questões sobre a generalização real para além de tarefas empresariais específicas.

No panorama, isto distingue-se das abordagens da OpenAI com o GPT-Live e da xAI com o Grok Voice Think Fast. A Google dá ênfase à execução paralela de tarefas e ao grounding visual, e não apenas à velocidade de resposta. Os modelos anteriores exigiam frequentemente pausas para raciocínio, o que quebrava a naturalidade do diálogo.

As novas capacidades abrem caminho a agentes de voz de nível de produção, em que o modelo pode executar operações complexas de vários passos, mantendo o fluxo conversacional. Isto é especialmente visível nas integrações com o Search Live, o Gemini Live e o Workspace.

Continua por esclarecer até que ponto os resultados são robustos sob verificação independente e em condições de ruído real ou sotaques. A comunidade irá provavelmente testar a latência em edge cases e comparar com alternativas open-source.

A mudança fundamental é a passagem de interfaces de voz reativas para interfaces verdadeiramente agentic, em que o raciocínio não interfere com a comunicação natural.

3 Visualizações

Fontes

  • Google launches Gemini 3.8 Live models

Comentários

Leia mais artigos sobre este tema:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
Encontrou um erro ou imprecisão?Vamos considerar seus comentários assim que possível.