Loading prices...

Мультимодальный ИИ

Обновлено 11.08.20261 мин

Мультимодальная модель работает не только с текстом, но и с изображениями, звуком или видео — в одном и том же механизме. Можно показать ей график и спросить о нём словами, получив текстовый ответ.

Как это работает

Разные типы данных приводятся к общему виду — векторам. Картинка нарезается на фрагменты, каждый превращается в набор чисел, и дальше модель обрабатывает их тем же механизмом внимания, что и слова. Для неё это одна последовательность, а не два разных мира.

Отсюда возможность связывать модальности. Модель отвечает на вопрос о содержимом фотографии, читает текст со скриншота, описывает график или находит несоответствие между таблицей и подписью к ней.

Изображения дороже текста: одна картинка занимает сотни или тысячи токенов в зависимости от разрешения. При работе с документами это заметно влияет и на стоимость, и на то, сколько поместится в контекст.

Где это применяют

  • Разбор документов и скриншотовИзвлечь данные из счёта, таблицы или снимка экрана — самое частое практическое применение.
  • Проверка графиков и схемМодель находит расхождение между цифрами в тексте и тем, что показано на изображении.
  • ДоступностьОписание изображений словами и распознавание речи закрывают задачи, которые раньше требовали отдельных систем.
  • Мелкий текст всё ещё проблемаНа плотных таблицах и низком разрешении ошибки чтения обычны. Важные цифры стоит перепроверять.