1 сентября 2026 года Google DeepMind представил агентное понимание видео в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо фиксированной выборки кадров с частотой один в секунду модель теперь самостоятельно решает, какие фрагменты видео, аудио или транскрипта стоит загрузить и в каком разрешении. Официальный блог компании сообщает о сокращении потребления токенов до 88 %, снижении стоимости до 66 % и росте точности до 7 % на длинных видео.
Механизм работает следующим образом: модель получает ссылку на видео и запрос пользователя, после чего планирует последовательность действий — извлечь транскрипт, увеличить частоту кадров в подозрительном интервале или переключиться на аудио. Каждый шаг сопровождается внутренним рассуждением, а итоговый контекст формируется только из релевантных фрагментов. В результате часовая лекция, которая в статическом режиме требовала более миллиона токенов, теперь обрабатывается с использованием примерно 100 тысяч.
Оценка проводилась на бенчмарках 1H-VideoQA и LVBench. В агентном режиме токенов ушло на 88 % меньше, а точность ответов выросла на несколько процентов. При этом Google не публикует детальные абляционные исследования, показывающие, какой именно компонент — выбор модальности, адаптивная частота кадров или внутреннее планирование — вносит основной вклад в прирост качества.
Ранее большинство мультимодальных моделей, включая предыдущие версии Gemini и решения других лабораторий, полагались на статическую обработку: фиксированная частота кадров и полная загрузка контекста. Такой подход гарантировал воспроизводимость, но быстро становился неэффективным на длинных видео. Агентный метод Google напоминает подходы, которые уже применялись в текстовых агентах с инструментами, однако переносит их на видео с сохранением мультимодальности.
Сравнение с параллельными работами показывает, что Google делает ставку на эффективность именно для длинного контента, тогда как некоторые другие лаборатории продолжают совершенствовать статические методы с более высоким разрешением кадров. Разница в философии очевидна: одна сторона минимизирует объём контекста, другая — максимизирует его плотность.
Для разработчиков это означает возможность строить видео-агентов, которые анализируют многочасовые записи без prohibitive затрат. Появляются новые сценарии — автоматический поиск ключевых моментов в лекциях, точное редактирование видео по описанию, мониторинг аномалий в промышленных записях. Однако остаётся неясным, насколько стабильно модель справляется с неоднозначными запросами, когда релевантные фрагменты распределены по всему видео.
Независимая верификация пока ограничена первыми отчётами разработчиков. Сообщество, вероятно, проверит поведение на edge-кейсах: видео с быстрыми сменами сцен, низкокачественным аудио или противоречивыми транскриптами. Следующие интересные работы будут посвящены именно отказоустойчивости агентного планирования и его влиянию на обобщение.
Главный итог разработки — видео-анализ становится не исчерпывающим, а целенаправленным, и это меняет экономику приложений, работающих с длинным мультимедийным контентом.

