15 september 2026 heeft Google twee nieuwe modellen gepresenteerd — Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. Ze worden gepositioneerd als de meest geavanceerde modellen voor live dialoog, geoptimaliseerd voor lage latentie en realtime.
Het belangrijkste verschil met voorgangers zoals Gemini 3.1 Flash Live is de ondersteuning van interleaved reasoning en asynchrone functieaanroepen. Het model kan redeneren en tegelijkertijd spraak genereren, terwijl tools op de achtergrond worden uitgevoerd zonder het gesprek te onderbreken.
Dit wordt bereikt dankzij een native audio-architectuur, waarbij input en output audio en tekst in realtime zijn. Visuele context in near real-time, automatische omschakeling tussen 97 talen en updates van sessie-inhoud worden ondersteund. De prijs is $0.005 per minuut audio-invoer en $0.018 per minuut uitvoer.
Extended Thinking leidt in de benchmarks: 82.6 punten op de Artificial Analysis Speech to Speech Quality Index, 68.6% op τ-Voice, 35.1% op Sierra’s τ-Voice-banking en 97.7% op Big Bench Audio. De basisversie staat tweede in de Speech Agent Arena en laat sterke resultaten zien op EVA-Bench.
De benchmarkmethodologie richt zich op agentic task completion en spraakkwaliteit, maar onthult niet altijd details over held-out tests of vergelijkingen met zero-shot scenario's. Dat laat vragen open over de werkelijke generalisatie buiten specifieke enterprise-taken.
In het landschap verschilt dit van de benaderingen van OpenAI met GPT-Live en xAI met Grok Voice Think Fast. Google legt de nadruk op parallelle uitvoering van taken en visuele grounding, niet alleen op reactiesnelheid. Eerdere modellen vereisten vaak pauzes voor reasoning, wat de natuurlijkheid van het gesprek verstoorde.
De nieuwe mogelijkheden openen de weg naar production-grade voice-agenten, waarbij het model complexe meerstapsoperaties kan uitvoeren met behoud van de gespreksstroom. Dit is vooral merkbaar in integraties met Search Live, Gemini Live en Workspace.
Het blijft onduidelijk hoe robuust de resultaten zijn bij onafhankelijke verificatie en onder omstandigheden met echte ruis of accenten. De community zal waarschijnlijk de latency in edge-cases testen en vergelijken met open-source alternatieven.
De belangrijkste verschuiving is de overgang van reactieve spraakinterfaces naar truly agentic, waarbij reasoning het natuurlijke gesprek niet in de weg staat.

