Gemini 3.8 Live: як interleaved reasoning і асинхронні виклики інструментів змінюють голосових агентів Google

Відредаговано: Svitlana Velhush

15 вересня 2026 року Google представила дві нові моделі — Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking. Вони позиціонуються як найдосконаліші моделі для живої розмови, оптимізовані під низьку затримку та реальний час.

Основна відмінність від попередників, таких як Gemini 3.1 Flash Live, полягає в підтримці interleaved reasoning та асинхронних викликів функцій. Модель може міркувати й водночас генерувати мовлення, а інструменти виконуються у фоновому режимі, не перериваючи розмову.

Це досягається завдяки нативній аудіоархітектурі, де вхід і вихід — аудіо та текст у реальному часі. Підтримуються візуальний контекст у near real-time, автоматичне перемикання між 97 мовами та оновлення вмісту сесії. Ціна — $0.005 за хвилину аудіовходу та $0.018 за хвилину виводу.

Extended Thinking лідирує в бенчмарках: 82.6 балів на Artificial Analysis Speech to Speech Quality Index, 68.6% на τ-Voice, 35.1% на Sierra’s τ-Voice-banking і 97.7% на Big Bench Audio. Базова версія посідає друге місце в Speech Agent Arena і показує сильні результати на EVA-Bench.

Методологія бенчмарків зосереджується на agentic task completion і якості мовлення, але не завжди розкриває деталі held-out тестів чи порівняння з zero-shot сценаріями. Це залишає питання про реальну генералізацію за межами конкретних enterprise-завдань.

У ландшафті це відрізняється від підходів OpenAI з GPT-Live і xAI з Grok Voice Think Fast. Google робить акцент на паралельному виконанні завдань і візуальному grounding, а не лише на швидкості відгуку. Попередні моделі часто вимагали пауз для reasoning, що порушувало природність діалогу.

Нові можливості відкривають шлях до production-grade voice-агентів, де модель може виконувати складні багатокрокові операції, зберігаючи розмовний потік. Це особливо помітно в інтеграціях із Search Live, Gemini Live і Workspace.

Залишається неясним, наскільки стійкими є результати за незалежної верифікації та в умовах реального шуму чи акцентів. Спільнота, ймовірно, протестує latency в edge-кейсах і порівняє з open-source альтернативами.

Ключовий зсув — перехід від реактивних голосових інтерфейсів до truly agentic, де reasoning не заважає природному спілкуванню.

3 Перегляди

Джерела

  • Google launches Gemini 3.8 Live models

Коментарі

Читайте більше статей на цю тему:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
Знайшли помилку чи неточність?Ми розглянемо ваші коментарі якомога швидше.