Loading prices...
Все новости
Кинолента с одним ярко светящимся кадром среди приглушённых остальных — символ выборочного отбора нужных кадров ИИ

Gemini от Google снизила расход токенов на анализ видео до 88%

Модели Gemini Flash от Google теперь анализируют видео выборочно вместо сканирования каждого кадра, сообщает The Decoder, снижая расход токенов до 88% на бенчмарках.

  • Изменение затрагивает Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite и уже доступно через Gemini API и Google AI Studio по стандартным тарифам на токены
  • Вместо обработки видео с фиксированной частотой кадров модели теперь работают в цикле, выборочно вытягивая кадры, аудио или транскрипт только из тех фрагментов, которые важны, самостоятельно решая, что забрать и с какой скоростью двигаться
  • На бенчмарках вроде 1H-VideoQA и LongVideoBench расход токенов упал до 88%, а затраты снизились на 66%, при этом точность осталась на прежнем уровне или немного выросла, несмотря на обработку меньшего объёма данных
  • По заявлению Google, Gemini 3.7 Flash показала наивысшую точность при самой низкой стоимости запроса на тесте 1H-VideoQA, опередив в собственном сравнении GPT 5.6 Terra, Claude Opus 5.0 и Grok 4.6

Технология развивает «агентное зрение» — возможность, которую Google выпустила для Gemini 3 Flash в январе и которая позволяла моделям писать собственный код на Python для обработки изображений внутри цикла думать-действовать-наблюдать. Применение того же самостоятельного подхода к видео позволяет модели пропускать кадры вместо линейного прохода по всей записи — тот же сдвиг, что сделал заметной более раннюю функцию для изображений. Google описывает целевой диапазон как угодно от 10-минутного туториала до многочасовой записи, обрабатываемых одним и тем же циклом.

Аргумент об эффективности важнее для видео, чем почти для любого другого типа данных, потому что фиксированная частота кадров умножает стоимость на длительность записи. 10-минутный туториал и 90-минутная лекция при старом подходе обходятся в примерно пропорциональные суммы независимо от того, сколько из записи реально относится к заданному вопросу. Позволить модели самой решать, что пропустить, — та же экономия ресурсов, которую Intokened отслеживал и в других местах по мере роста использования ИИ: агенты уже обгоняют людей по потреблению на платформах вроде OpenRouter, а собственный инструмент Google Flash Cyber уже показывал, что компания предпочитает оптимизировать узкие, заточенные под задачу модели, а не по умолчанию использовать самую крупную для любой работы.

Ни одна из цифр в бенчмарках Google не прошла независимую проверку, и компания сравнивает собственную модель с конкурентами по собственному графику, а не по нейтральному стороннему тесту. Тем не менее направление понятно: по мере того как анализ видео через ИИ переходит из разряда новинки в инструмент, который применяют к часам записей, а не коротким роликам, стоимость обработки каждого кадра «в лоб» перестаёт быть незаметной статьёй расходов.

Текст написан в информационных целях и не призывает к конкретным инвестиционным решениям.

Опубликовано: 12:55 · 02.09.2026
Maks

Автор

Maks

Трейдер

Долгое время интересуюсь рынком криптовалют, являюсь трейдером, пишу статьи и новости о своем опыте простыми словами.

Комментарии (0)

Пока нет комментариев — будь первым!

Крипторынок производит шум. Мы присылаем сигнал

Письмо, ради которого стоит открыть почту