15 вересня 2026 року Google представила дві нові моделі — Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking. Вони позиціонуються як найдосконаліші моделі для живої розмови, оптимізовані під низьку затримку та реальний час.
Основна відмінність від попередників, таких як Gemini 3.1 Flash Live, полягає в підтримці interleaved reasoning та асинхронних викликів функцій. Модель може міркувати й водночас генерувати мовлення, а інструменти виконуються у фоновому режимі, не перериваючи розмову.
Це досягається завдяки нативній аудіоархітектурі, де вхід і вихід — аудіо та текст у реальному часі. Підтримуються візуальний контекст у near real-time, автоматичне перемикання між 97 мовами та оновлення вмісту сесії. Ціна — $0.005 за хвилину аудіовходу та $0.018 за хвилину виводу.
Extended Thinking лідирує в бенчмарках: 82.6 балів на Artificial Analysis Speech to Speech Quality Index, 68.6% на τ-Voice, 35.1% на Sierra’s τ-Voice-banking і 97.7% на Big Bench Audio. Базова версія посідає друге місце в Speech Agent Arena і показує сильні результати на EVA-Bench.
Методологія бенчмарків зосереджується на agentic task completion і якості мовлення, але не завжди розкриває деталі held-out тестів чи порівняння з zero-shot сценаріями. Це залишає питання про реальну генералізацію за межами конкретних enterprise-завдань.
У ландшафті це відрізняється від підходів OpenAI з GPT-Live і xAI з Grok Voice Think Fast. Google робить акцент на паралельному виконанні завдань і візуальному grounding, а не лише на швидкості відгуку. Попередні моделі часто вимагали пауз для reasoning, що порушувало природність діалогу.
Нові можливості відкривають шлях до production-grade voice-агентів, де модель може виконувати складні багатокрокові операції, зберігаючи розмовний потік. Це особливо помітно в інтеграціях із Search Live, Gemini Live і Workspace.
Залишається неясним, наскільки стійкими є результати за незалежної верифікації та в умовах реального шуму чи акцентів. Спільнота, ймовірно, протестує latency в edge-кейсах і порівняє з open-source альтернативами.
Ключовий зсув — перехід від реактивних голосових інтерфейсів до truly agentic, де reasoning не заважає природному спілкуванню.

