15 settembre 2026 Google ha presentato due nuovi modelli — Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking. Sono posizionati come i modelli più avanzati per il dialogo dal vivo, ottimizzati per la bassa latenza e il tempo reale.
La differenza principale rispetto ai predecessori, come Gemini 3.1 Flash Live, sta nel supporto dell'interleaved reasoning e delle chiamate asincrone alle funzioni. Il modello può ragionare e contemporaneamente generare parlato, mentre gli strumenti vengono eseguiti in background senza interrompere la conversazione.
Ciò si ottiene grazie a un'architettura audio nativa, in cui input e output sono audio e testo in tempo reale. Sono supportati il contesto visivo in near real-time, il passaggio automatico tra 97 lingue e gli aggiornamenti dei contenuti della sessione. Il prezzo è di $0.005 al minuto per l'input audio e di $0.018 al minuto per l'output.
Extended Thinking è in testa nei benchmark: 82.6 punti sull'Artificial Analysis Speech to Speech Quality Index, 68.6% su τ-Voice, 35.1% sul τ-Voice-banking di Sierra e 97.7% su Big Bench Audio. La versione base occupa il secondo posto nella Speech Agent Arena e mostra risultati solidi su EVA-Bench.
La metodologia dei benchmark si concentra sul completamento di compiti agentici e sulla qualità del parlato, ma non sempre rivela i dettagli dei test held-out o il confronto con scenari zero-shot. Questo lascia dubbi sulla reale generalizzazione al di fuori di specifici compiti enterprise.
Nel panorama, questo si distingue dagli approcci di OpenAI con GPT-Live e di xAI con Grok Voice Think Fast. Google pone l'accento sull'esecuzione parallela dei compiti e sul grounding visivo, non solo sulla velocità di risposta. I modelli precedenti richiedevano spesso pause per il reasoning, il che comprometteva la naturalezza del dialogo.
Le nuove capacità aprono la strada ad agenti vocali di livello produttivo, in cui il modello può eseguire operazioni complesse a più passaggi mantenendo il flusso conversazionale. Ciò è particolarmente evidente nelle integrazioni con Search Live, Gemini Live e Workspace.
Resta poco chiaro quanto siano solidi i risultati in caso di verifica indipendente e in condizioni di rumore reale o di accenti. La comunità probabilmente testerà la latenza nei casi limite e la confronterà con le alternative open-source.
Il cambiamento chiave è il passaggio da interfacce vocali reattive a interfacce veramente agentiche, in cui il reasoning non ostacola la comunicazione naturale.

