Трансформер
Трансформер — архитектура нейросети, предложенная в 2017 году в статье «Attention Is All You Need». На ней построены практически все современные языковые модели, а её ключевая идея — механизм внимания.
Как это работает
Внимание позволяет модели при обработке каждого слова смотреть на все остальные слова сразу и решать, какие из них важны. В предложении «банк отказал в кредите, потому что он был убыточным» именно внимание связывает «он» с нужным словом.
До трансформеров текст обрабатывался последовательно, слово за словом, и связь между далёкими частями предложения терялась. Внимание сняло это ограничение и заодно сделало обучение параллельным — отсюда и возможность обучать модели на действительно больших объёмах.
Расплата за это — квадратичный рост вычислений с длиной текста. Удвоив контекст, вы учетверяете работу, и именно поэтому длинный контекст стоит дорого и развивается медленнее, чем хотелось бы.
Почему это важно знать
- Объясняет цену длинного контекстаЗапрос на 100 тысяч токенов стоит не вдвое дороже запроса на 50 тысяч, а заметно больше.
- Объясняет «потерю середины»Модели заметно лучше держат начало и конец длинного текста, чем середину. Важное стоит ставить по краям.
- Одна архитектура на всёТекст, изображения, звук и код обрабатываются одним и тем же механизмом — отсюда мультимодальные модели.