Агентне розуміння відео в Gemini Flash: від статичної вибірки до активного дослідження контенту

Відредаговано: Svitlana Velhush

1 вересня 2026 року Google DeepMind представив агентне розуміння відео в моделях Gemini 3.7 Flash, 3.6 Flash та 3.5 Flash-Lite. Замість фіксованої вибірки кадрів із частотою один на секунду модель тепер самостійно вирішує, які фрагменти відео, аудіо чи транскрипту варто завантажити та в якій роздільній здатності. Офіційний блог компанії повідомляє про скорочення споживання токенів до 88 %, зниження вартості до 66 % та зростання точності до 7 % на довгих відео.

Механізм працює наступним чином: модель отримує посилання на відео та запит користувача, після чого планує послідовність дій — витягти транскрипт, збільшити частоту кадрів у підозрілому інтервалі або переключитися на аудіо. Кожен крок супроводжується внутрішнім міркуванням, а підсумковий контекст формується лише з релевантних фрагментів. У результаті годинна лекція, яка в статичному режимі потребувала понад мільйон токенів, тепер обробляється з використанням приблизно 100 тисяч.

Оцінка проводилася на бенчмарках 1H-VideoQA та LVBench. В агентному режимі токенів витрачено на 88 % менше, а точність відповідей зросла на кілька відсотків. При цьому Google не публікує детальні абляційні дослідження, які показують, який саме компонент — вибір модальності, адаптивна частота кадрів чи внутрішнє планування — вносить основний внесок у приріст якості.

Раніше більшість мультимодальних моделей, включно з попередніми версіями Gemini та рішеннями інших лабораторій, покладалися на статичну обробку: фіксована частота кадрів і повне завантаження контексту. Такий підхід гарантував відтворюваність, але швидко ставав неефективним на довгих відео. Агентний метод Google нагадує підходи, які вже застосовувалися в текстових агентах з інструментами, однак переносить їх на відео зі збереженням мультимодальності.

Порівняння з паралельними роботами показує, що Google робить ставку на ефективність саме для довгого контенту, тоді як деякі інші лабораторії продовжують удосконалювати статичні методи з вищою роздільною здатністю кадрів. Різниця у філософії очевидна: одна сторона мінімізує обсяг контексту, інша — максимізує його щільність.

Для розробників це означає можливість будувати відео-агентів, які аналізують багатогодинні записи без заборонних витрат. З'являються нові сценарії — автоматичний пошук ключових моментів у лекціях, точне редагування відео за описом, моніторинг аномалій у промислових записах. Однак залишається незрозумілим, наскільки стабільно модель справляється з неоднозначними запитами, коли релевантні фрагменти розподілені по всьому відео.

Незалежна верифікація поки обмежена першими звітами розробників. Спільнота, ймовірно, перевірить поведінку на крайових випадках: відео зі швидкими змінами сцен, низькоякісним аудіо або суперечливими транскриптами. Наступні цікаві роботи будуть присвячені саме відмовостійкості агентного планування та його впливу на узагальнення.

Головний підсумок розробки — відео-аналіз стає не вичерпним, а цілеспрямованим, і це змінює економіку застосунків, що працюють із довгим мультимедійним контентом.

15 Перегляди

Джерела

  • AI NEWS WAS NONSTOP TODAY

Читайте більше статей на цю тему:

Знайшли помилку чи неточність?Ми розглянемо ваші коментарі якомога швидше.