Контекстное окно
Контекстное окно — сколько текста модель удерживает одновременно: и ваш запрос, и всю предыдущую переписку, и ответ. Измеряется в токенах, и всё, что вышло за границу окна, для модели перестаёт существовать.
Как это работает
Модель не помнит прошлые разговоры. Каждый запрос отправляется вместе со всей историей переписки, и именно эта история и есть «память». Как только суммарный объём превышает окно, самое старое отбрасывается или сжимается.
Окно делится между входом и выходом. Загрузив документ на 90% окна, вы оставляете модели мало места на ответ, и он окажется короче, чем вы рассчитывали.
Большое окно не равно хорошей работе с ним. Модели устойчиво лучше используют начало и конец длинного текста, чем середину, поэтому набивать окно «на всякий случай» обычно вредит качеству.
Как с этим работать
- Важное — в начало и в конецИнструкция в самом начале и повтор ключевого требования в конце работают лучше, чем то же самое в середине.
- Меньше текста, но по делуТри нужные страницы дают лучший ответ, чем триста, среди которых эти три спрятаны.
- Длинная переписка дорожаетИстория отправляется целиком каждый раз, поэтому стоимость сообщения растёт по мере разговора.
- Для больших объёмов есть RAGВместо того чтобы грузить всю базу в окно, ищут нужные куски и передают только их.