Loading prices...

Инференс

Обновлено 11.08.20261 мин

Инференс — работа уже обученной модели: она получает запрос и выдаёт ответ. В отличие от обучения, веса при этом не меняются, и именно за инференс вы платите, пользуясь ИИ-сервисом.

Как это работает

Запрос превращается в токены, проходит через все слои модели, и на выходе получается распределение вероятностей для следующего токена. Из него выбирается один, добавляется к тексту, и всё повторяется — токен за токеном, пока ответ не закончится.

Поэтому ответ и печатается постепенно: он в буквальном смысле создаётся по кусочку. И поэтому длинный ответ стоит дороже короткого — работа выполняется заново для каждого токена.

Настройка «температуры» управляет выбором из распределения. Ниже — модель чаще берёт самый вероятный вариант и отвечает предсказуемо; выше — допускает менее вероятные, что даёт разнообразие вместе с большим риском ошибки.

Что влияет на цену и скорость

  • Считаются вход и выходПлатите и за отправленный контекст, и за сгенерированный ответ, обычно по разным ставкам.
  • Длинная переписка дорожаетВся история отправляется заново с каждым сообщением, поэтому стоимость растёт по ходу разговора.
  • Размер модели решаетМодель поменьше отвечает быстрее и дешевле. Для простых задач крупная — это переплата без выигрыша.
  • Кэширование контекстаМногие провайдеры дешевле считают повторно отправляемую неизменную часть запроса. На длинных промптах экономия заметная.