Loading prices...

Трансформер

Обновлено 11.08.20261 мин

Трансформер — архитектура нейросети, предложенная в 2017 году в статье «Attention Is All You Need». На ней построены практически все современные языковые модели, а её ключевая идея — механизм внимания.

Как это работает

Внимание позволяет модели при обработке каждого слова смотреть на все остальные слова сразу и решать, какие из них важны. В предложении «банк отказал в кредите, потому что он был убыточным» именно внимание связывает «он» с нужным словом.

До трансформеров текст обрабатывался последовательно, слово за словом, и связь между далёкими частями предложения терялась. Внимание сняло это ограничение и заодно сделало обучение параллельным — отсюда и возможность обучать модели на действительно больших объёмах.

Расплата за это — квадратичный рост вычислений с длиной текста. Удвоив контекст, вы учетверяете работу, и именно поэтому длинный контекст стоит дорого и развивается медленнее, чем хотелось бы.

Почему это важно знать

  • Объясняет цену длинного контекстаЗапрос на 100 тысяч токенов стоит не вдвое дороже запроса на 50 тысяч, а заметно больше.
  • Объясняет «потерю середины»Модели заметно лучше держат начало и конец длинного текста, чем середину. Важное стоит ставить по краям.
  • Одна архитектура на всёТекст, изображения, звук и код обрабатываются одним и тем же механизмом — отсюда мультимодальные модели.