Инференс
Инференс — работа уже обученной модели: она получает запрос и выдаёт ответ. В отличие от обучения, веса при этом не меняются, и именно за инференс вы платите, пользуясь ИИ-сервисом.
Как это работает
Запрос превращается в токены, проходит через все слои модели, и на выходе получается распределение вероятностей для следующего токена. Из него выбирается один, добавляется к тексту, и всё повторяется — токен за токеном, пока ответ не закончится.
Поэтому ответ и печатается постепенно: он в буквальном смысле создаётся по кусочку. И поэтому длинный ответ стоит дороже короткого — работа выполняется заново для каждого токена.
Настройка «температуры» управляет выбором из распределения. Ниже — модель чаще берёт самый вероятный вариант и отвечает предсказуемо; выше — допускает менее вероятные, что даёт разнообразие вместе с большим риском ошибки.
Что влияет на цену и скорость
- Считаются вход и выходПлатите и за отправленный контекст, и за сгенерированный ответ, обычно по разным ставкам.
- Длинная переписка дорожаетВся история отправляется заново с каждым сообщением, поэтому стоимость растёт по ходу разговора.
- Размер модели решаетМодель поменьше отвечает быстрее и дешевле. Для простых задач крупная — это переплата без выигрыша.
- Кэширование контекстаМногие провайдеры дешевле считают повторно отправляемую неизменную часть запроса. На длинных промптах экономия заметная.