15 września 2026 roku Google zaprezentowało dwa nowe modele — Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking. Są one pozycjonowane jako najbardziej zaawansowane modele do rozmowy na żywo, zoptymalizowane pod niskie opóźnienia i działanie w czasie rzeczywistym.
Główna różnica w stosunku do poprzedników, takich jak Gemini 3.1 Flash Live, polega na obsłudze interleaved reasoning i asynchronicznych wywołań funkcji. Model może rozumować i jednocześnie generować mowę, a narzędzia są wykonywane w tle bez przerywania rozmowy.
Osiągnięto to dzięki natywnej architekturze audio, w której wejściem i wyjściem są dźwięk i tekst w czasie rzeczywistym. Obsługiwany jest kontekst wizualny w czasie niemal rzeczywistym, automatyczne przełączanie między 97 językami oraz aktualizacje treści sesji. Cena wynosi $0.005 za minutę wejścia audio i $0.018 za minutę wyjścia.
Extended Thinking prowadzi w benchmarkach: 82.6 punktów w Artificial Analysis Speech to Speech Quality Index, 68.6% w τ-Voice, 35.1% w Sierra’s τ-Voice-banking i 97.7% w Big Bench Audio. Wersja podstawowa zajmuje drugie miejsce w Speech Agent Arena i osiąga mocne wyniki w EVA-Bench.
Metodologia benchmarków koncentruje się na realizacji zadań agentowych i jakości mowy, ale nie zawsze ujawnia szczegóły testów held-out ani porównania ze scenariuszami zero-shot. Pozostawia to pytania o rzeczywistą generalizację poza konkretnymi zadaniami enterprise.
W tym krajobrazie wyróżnia się to na tle podejść OpenAI z GPT-Live i xAI z Grok Voice Think Fast. Google kładzie nacisk na równoległe wykonywanie zadań i ugruntowanie wizualne, a nie tylko na szybkość reakcji. Poprzednie modele często wymagały pauz na rozumowanie, co zakłócało naturalność dialogu.
Nowe możliwości otwierają drogę do agentów głosowych klasy produkcyjnej, w których model może wykonywać złożone wieloetapowe operacje, zachowując płynność rozmowy. Jest to szczególnie widoczne w integracjach z Search Live, Gemini Live i Workspace.
Pozostaje niejasne, jak stabilne są wyniki przy niezależnej weryfikacji oraz w warunkach rzeczywistego szumu lub akcentów. Społeczność prawdopodobnie przetestuje opóźnienia w edge case’ach i porówna je z alternatywami open-source.
Kluczowa zmiana to przejście od reaktywnych interfejsów głosowych do prawdziwie agentowych, w których rozumowanie nie przeszkadza w naturalnej komunikacji.

