Gemini 3.8 Live: как interleaved reasoning и асинхронные вызовы инструментов меняют голосовых агентов Google

Отредактировано: Svitlana Velhush

15 сентября 2026 года Google представила две новые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они позиционируются как самые продвинутые модели для живого диалога, оптимизированные под низкую задержку и реальное время.

Основное отличие от предшественников, таких как Gemini 3.1 Flash Live, заключается в поддержке interleaved reasoning и асинхронных вызовов функций. Модель может рассуждать и одновременно генерировать речь, а инструменты выполняются в фоне без прерывания разговора.

Это достигается за счёт нативной аудио-архитектуры, где вход и выход — аудио и текст в реальном времени. Поддерживаются визуальный контекст в near real-time, автоматическое переключение между 97 языками и обновления контента сессии. Цена — $0.005 за минуту аудиовхода и $0.018 за минуту вывода.

Extended Thinking лидирует в бенчмарках: 82.6 баллов на Artificial Analysis Speech to Speech Quality Index, 68.6% на τ-Voice, 35.1% на Sierra’s τ-Voice-banking и 97.7% на Big Bench Audio. Базовая версия занимает второе место в Speech Agent Arena и показывает сильные результаты на EVA-Bench.

Методология бенчмарков фокусируется на agentic task completion и качестве речи, но не всегда раскрывает детали held-out тестов или сравнения с zero-shot сценариями. Это оставляет вопросы о реальной генерализации за пределами конкретных enterprise-задач.

В ландшафте это отличается от подходов OpenAI с GPT-Live и xAI с Grok Voice Think Fast. Google делает акцент на параллельном выполнении задач и визуальном grounding, а не только на скорости отклика. Предыдущие модели часто требовали пауз для reasoning, что нарушало естественность диалога.

Новые возможности открывают путь к production-grade voice-агентам, где модель может выполнять сложные многошаговые операции, сохраняя разговорный поток. Это особенно заметно в интеграциях с Search Live, Gemini Live и Workspace.

Остаётся неясным, насколько устойчивы результаты при независимой верификации и в условиях реального шума или акцентов. Сообщество, вероятно, протестирует latency в edge-кейсах и сравнит с open-source альтернативами.

Ключевой сдвиг — переход от реактивных голосовых интерфейсов к truly agentic, где reasoning не мешает естественному общению.

3 Просмотров

Источники

  • Google launches Gemini 3.8 Live models

Комментарии

Читайте больше статей по этой теме:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
Вы нашли ошибку или неточность?Мы учтем ваши комментарии как можно скорее.