Loading prices...

Контекстное окно

Обновлено 11.08.20261 мин

Контекстное окно — сколько текста модель удерживает одновременно: и ваш запрос, и всю предыдущую переписку, и ответ. Измеряется в токенах, и всё, что вышло за границу окна, для модели перестаёт существовать.

Как это работает

Модель не помнит прошлые разговоры. Каждый запрос отправляется вместе со всей историей переписки, и именно эта история и есть «память». Как только суммарный объём превышает окно, самое старое отбрасывается или сжимается.

Окно делится между входом и выходом. Загрузив документ на 90% окна, вы оставляете модели мало места на ответ, и он окажется короче, чем вы рассчитывали.

Большое окно не равно хорошей работе с ним. Модели устойчиво лучше используют начало и конец длинного текста, чем середину, поэтому набивать окно «на всякий случай» обычно вредит качеству.

Как с этим работать

  • Важное — в начало и в конецИнструкция в самом начале и повтор ключевого требования в конце работают лучше, чем то же самое в середине.
  • Меньше текста, но по делуТри нужные страницы дают лучший ответ, чем триста, среди которых эти три спрятаны.
  • Длинная переписка дорожаетИстория отправляется целиком каждый раз, поэтому стоимость сообщения растёт по мере разговора.
  • Для больших объёмов есть RAGВместо того чтобы грузить всю базу в окно, ищут нужные куски и передают только их.