Google включила агентный разбор видео в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. По замерам компании, режим сокращает расход токенов до 88%, стоимость анализа — до 66%, а точность поднимает до 7%. Анонс опубликован 1 сентября.
Разница в том, как модель читает ролик. Раньше видео разбиралось с фиксированной частотой — по умолчанию один кадр в секунду, — и длинная запись превращалась в огромный поток кадров независимо от того, есть в них что-то полезное или нет. Теперь модель сама ищет нужные фрагменты и просматривает их прицельно, работая одновременно с кадрами, звуковой дорожкой и расшифровкой.
Из этого вырастают возможности, которых при статичном разборе не было: поиск момента с точностью до долей секунды, более надёжное обнаружение аномалий и точный подсчёт объектов в кадре. Выигрыш заметнее всего на длинных записях — от получасовых лекций до многочасовых съёмок.
Режим доступен для загруженных роликов и видео с YouTube через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform; включается он значением «agentic» в настройках запроса. В России Gemini API официально недоступен — Россия не входит в список поддерживаемых стран. Детали и бенчмарки — в блоге Google DeepMind.

