Токен (в ИИ)
Токен в ИИ — кусок текста, которым модель оперирует вместо букв и слов. Обычно это часть слова: в английском примерно четыре символа. В токенах измеряют и длину контекста, и стоимость запроса.
Как это работает
Текст разбивается на токены по частоте встречаемости. Частые слова становятся одним токеном целиком, редкие дробятся на части. Поэтому «the» — это один токен, а выдуманное слово может занять пять.
Кириллица дробится мельче латиницы: один и тот же смысл на русском обычно занимает в полтора-два раза больше токенов, чем на английском. Это напрямую влияет и на цену запроса, и на то, сколько помещается в контекст.
Модель видит только токены, а не буквы внутри них. Отсюда её давняя слабость в задачах вроде «сколько букв «р» в слове»: она работает с фрагментами, а не с символами.
Сколько это в словах
Примерные соотношения, которых достаточно для оценки объёма и цены.
| 1 токен (английский) | ≈ 4 символа |
| 1 000 токенов | ≈ 750 слов |
| Страница А4 | ≈ 500–700 токенов |
| Тот же текст на русском | ×1,5–2 |
Контекст на 128 тысяч токенов вмещает примерно роман среднего размера на английском — и заметно меньше на русском. Цена запроса считается по сумме входных и выходных токенов, поэтому длинная переписка дорожает с каждым сообщением.