Мультимодальный ИИ
Мультимодальная модель работает не только с текстом, но и с изображениями, звуком или видео — в одном и том же механизме. Можно показать ей график и спросить о нём словами, получив текстовый ответ.
Как это работает
Разные типы данных приводятся к общему виду — векторам. Картинка нарезается на фрагменты, каждый превращается в набор чисел, и дальше модель обрабатывает их тем же механизмом внимания, что и слова. Для неё это одна последовательность, а не два разных мира.
Отсюда возможность связывать модальности. Модель отвечает на вопрос о содержимом фотографии, читает текст со скриншота, описывает график или находит несоответствие между таблицей и подписью к ней.
Изображения дороже текста: одна картинка занимает сотни или тысячи токенов в зависимости от разрешения. При работе с документами это заметно влияет и на стоимость, и на то, сколько поместится в контекст.
Где это применяют
- Разбор документов и скриншотовИзвлечь данные из счёта, таблицы или снимка экрана — самое частое практическое применение.
- Проверка графиков и схемМодель находит расхождение между цифрами в тексте и тем, что показано на изображении.
- ДоступностьОписание изображений словами и распознавание речи закрывают задачи, которые раньше требовали отдельных систем.
- Мелкий текст всё ещё проблемаНа плотных таблицах и низком разрешении ошибки чтения обычны. Важные цифры стоит перепроверять.