
Gemini от Google снизила расход токенов на анализ видео до 88%
Модели Gemini Flash от Google теперь анализируют видео выборочно вместо сканирования каждого кадра, сообщает The Decoder, снижая расход токенов до 88% на бенчмарках.
- Изменение затрагивает Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite и уже доступно через Gemini API и Google AI Studio по стандартным тарифам на токены
- Вместо обработки видео с фиксированной частотой кадров модели теперь работают в цикле, выборочно вытягивая кадры, аудио или транскрипт только из тех фрагментов, которые важны, самостоятельно решая, что забрать и с какой скоростью двигаться
- На бенчмарках вроде 1H-VideoQA и LongVideoBench расход токенов упал до 88%, а затраты снизились на 66%, при этом точность осталась на прежнем уровне или немного выросла, несмотря на обработку меньшего объёма данных
- По заявлению Google, Gemini 3.7 Flash показала наивысшую точность при самой низкой стоимости запроса на тесте 1H-VideoQA, опередив в собственном сравнении GPT 5.6 Terra, Claude Opus 5.0 и Grok 4.6
Технология развивает «агентное зрение» — возможность, которую Google выпустила для Gemini 3 Flash в январе и которая позволяла моделям писать собственный код на Python для обработки изображений внутри цикла думать-действовать-наблюдать. Применение того же самостоятельного подхода к видео позволяет модели пропускать кадры вместо линейного прохода по всей записи — тот же сдвиг, что сделал заметной более раннюю функцию для изображений. Google описывает целевой диапазон как угодно от 10-минутного туториала до многочасовой записи, обрабатываемых одним и тем же циклом.
Аргумент об эффективности важнее для видео, чем почти для любого другого типа данных, потому что фиксированная частота кадров умножает стоимость на длительность записи. 10-минутный туториал и 90-минутная лекция при старом подходе обходятся в примерно пропорциональные суммы независимо от того, сколько из записи реально относится к заданному вопросу. Позволить модели самой решать, что пропустить, — та же экономия ресурсов, которую Intokened отслеживал и в других местах по мере роста использования ИИ: агенты уже обгоняют людей по потреблению на платформах вроде OpenRouter, а собственный инструмент Google Flash Cyber уже показывал, что компания предпочитает оптимизировать узкие, заточенные под задачу модели, а не по умолчанию использовать самую крупную для любой работы.
Ни одна из цифр в бенчмарках Google не прошла независимую проверку, и компания сравнивает собственную модель с конкурентами по собственному графику, а не по нейтральному стороннему тесту. Тем не менее направление понятно: по мере того как анализ видео через ИИ переходит из разряда новинки в инструмент, который применяют к часам записей, а не коротким роликам, стоимость обработки каждого кадра «в лоб» перестаёт быть незаметной статьёй расходов.
Текст написан в информационных целях и не призывает к конкретным инвестиционным решениям.

Комментарии (0)
Пока нет комментариев — будь первым!
Крипторынок производит шум. Мы присылаем сигнал
Письмо, ради которого стоит открыть почту
Похожие материалы

Anthropic открыла доступ к обнаружению водяных знаков текста Claude

Google преследует сделки с Голливудом по ИИ, которые нужны ему больше, чем студиям

Goldman Sachs возглавил институциональных держателей XRP-ETF
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
73Рынок


