Gemini 3.8 Live: come l'interleaved reasoning e le chiamate asincrone agli strumenti cambiano gli agenti vocali di Google

Modificato da: Svitlana Velhush

15 settembre 2026 Google ha presentato due nuovi modelli — Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking. Sono posizionati come i modelli più avanzati per il dialogo dal vivo, ottimizzati per la bassa latenza e il tempo reale.

La differenza principale rispetto ai predecessori, come Gemini 3.1 Flash Live, sta nel supporto dell'interleaved reasoning e delle chiamate asincrone alle funzioni. Il modello può ragionare e contemporaneamente generare parlato, mentre gli strumenti vengono eseguiti in background senza interrompere la conversazione.

Ciò si ottiene grazie a un'architettura audio nativa, in cui input e output sono audio e testo in tempo reale. Sono supportati il contesto visivo in near real-time, il passaggio automatico tra 97 lingue e gli aggiornamenti dei contenuti della sessione. Il prezzo è di $0.005 al minuto per l'input audio e di $0.018 al minuto per l'output.

Extended Thinking è in testa nei benchmark: 82.6 punti sull'Artificial Analysis Speech to Speech Quality Index, 68.6% su τ-Voice, 35.1% sul τ-Voice-banking di Sierra e 97.7% su Big Bench Audio. La versione base occupa il secondo posto nella Speech Agent Arena e mostra risultati solidi su EVA-Bench.

La metodologia dei benchmark si concentra sul completamento di compiti agentici e sulla qualità del parlato, ma non sempre rivela i dettagli dei test held-out o il confronto con scenari zero-shot. Questo lascia dubbi sulla reale generalizzazione al di fuori di specifici compiti enterprise.

Nel panorama, questo si distingue dagli approcci di OpenAI con GPT-Live e di xAI con Grok Voice Think Fast. Google pone l'accento sull'esecuzione parallela dei compiti e sul grounding visivo, non solo sulla velocità di risposta. I modelli precedenti richiedevano spesso pause per il reasoning, il che comprometteva la naturalezza del dialogo.

Le nuove capacità aprono la strada ad agenti vocali di livello produttivo, in cui il modello può eseguire operazioni complesse a più passaggi mantenendo il flusso conversazionale. Ciò è particolarmente evidente nelle integrazioni con Search Live, Gemini Live e Workspace.

Resta poco chiaro quanto siano solidi i risultati in caso di verifica indipendente e in condizioni di rumore reale o di accenti. La comunità probabilmente testerà la latenza nei casi limite e la confronterà con le alternative open-source.

Il cambiamento chiave è il passaggio da interfacce vocali reattive a interfacce veramente agentiche, in cui il reasoning non ostacola la comunicazione naturale.

3 Visualizzazioni

Fonti

  • Google launches Gemini 3.8 Live models

Commenti

Leggi altri articoli su questo argomento:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
Hai trovato un errore o un'inaccuratezza?Esamineremo il tuo commento il prima possibile.