15 сентября 2026 года Google представила две новые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они позиционируются как самые продвинутые модели для живого диалога, оптимизированные под низкую задержку и реальное время.
Основное отличие от предшественников, таких как Gemini 3.1 Flash Live, заключается в поддержке interleaved reasoning и асинхронных вызовов функций. Модель может рассуждать и одновременно генерировать речь, а инструменты выполняются в фоне без прерывания разговора.
Это достигается за счёт нативной аудио-архитектуры, где вход и выход — аудио и текст в реальном времени. Поддерживаются визуальный контекст в near real-time, автоматическое переключение между 97 языками и обновления контента сессии. Цена — $0.005 за минуту аудиовхода и $0.018 за минуту вывода.
Extended Thinking лидирует в бенчмарках: 82.6 баллов на Artificial Analysis Speech to Speech Quality Index, 68.6% на τ-Voice, 35.1% на Sierra’s τ-Voice-banking и 97.7% на Big Bench Audio. Базовая версия занимает второе место в Speech Agent Arena и показывает сильные результаты на EVA-Bench.
Методология бенчмарков фокусируется на agentic task completion и качестве речи, но не всегда раскрывает детали held-out тестов или сравнения с zero-shot сценариями. Это оставляет вопросы о реальной генерализации за пределами конкретных enterprise-задач.
В ландшафте это отличается от подходов OpenAI с GPT-Live и xAI с Grok Voice Think Fast. Google делает акцент на параллельном выполнении задач и визуальном grounding, а не только на скорости отклика. Предыдущие модели часто требовали пауз для reasoning, что нарушало естественность диалога.
Новые возможности открывают путь к production-grade voice-агентам, где модель может выполнять сложные многошаговые операции, сохраняя разговорный поток. Это особенно заметно в интеграциях с Search Live, Gemini Live и Workspace.
Остаётся неясным, насколько устойчивы результаты при независимой верификации и в условиях реального шума или акцентов. Сообщество, вероятно, протестирует latency в edge-кейсах и сравнит с open-source альтернативами.
Ключевой сдвиг — переход от реактивных голосовых интерфейсов к truly agentic, где reasoning не мешает естественному общению.

