RLHF (обучение с подкреплением на основе обратной связи людей)
RLHF — дообучение модели на человеческих оценках: люди сравнивают варианты ответов, на этих сравнениях учится отдельная модель-судья, и по её оценкам настраивается основная. Так модель учат быть полезной, а не просто правдоподобной.
Зачем это нужно
После предобучения модель умеет продолжать текст, но не отвечать на вопросы. На «как испечь хлеб» она может выдать список похожих вопросов — потому что в интернете именно так и выглядят страницы. Это правдоподобное продолжение, но бесполезный ответ.
RLHF закрывает этот разрыв. Людям показывают несколько вариантов ответа, они выбирают лучший, и модель настраивается выдавать то, что люди предпочитают. Отсюда привычный формат диалога, отказ от вредных запросов и признание незнания.
Побочные эффекты тоже отсюда. Склонность соглашаться с собеседником, многословие и осторожные оговорки — это то, что оценщики систематически предпочитали, а модель добросовестно усвоила.
Что стоит понимать
- Оценки — это чьи-то оценкиПоведение модели отражает вкусы конкретной группы разметчиков и заданные им инструкции.
- Полезность и правдивость — разные целиУверенный ответ нравится людям больше осторожного, поэтому обучение на предпочтениях само по себе не убирает выдумки.
- Соглашательство — известная проблемаЕсли настаивать на неверном утверждении, модель склонна согласиться. Это прямое следствие обучения на одобрении.
- Есть более дешёвые вариантыПодходы вроде обучения по прямым предпочтениям дают похожий результат без отдельной модели-судьи.