RLVF: <span class='thin'>обучение с проверяемой обратной связью</span>
Категория:  ИИ
Дата:  
Автор:  Команда SmartSeven

RLVF использует обратную связь, которую можно проверить по формальному правилу. Модель генерирует решение, система вычисляет награду, а обучение повышает вероятность ответов с правильным результатом.

Название иногда расшифровывают по-разному. Важно отличать этот подход от RLHF, где ответы оценивают люди. Проверяемая награда подходит для задач с однозначной проверкой, например математического ответа, прохождения тестов или соблюдения схемы.

Как проходит обучение

  1. Модель получает задачу и генерирует один или несколько ответов.
  2. Проверяющая программа оценивает результат.
  3. Алгоритм обновляет модель с учётом награды.
  4. Команда проверяет, не научилась ли модель обходить проверку.

Последний пункт особенно важен. Если метрика неполна, модель может получить высокий балл способом, который не решает исходную задачу.

Отличие от fine-tuning

Fine-tuning учит модель повторять примеры из подготовленного набора. RLVF оптимизирует результат по функции награды и позволяет модели искать разные способы решения.

Fine-tuning проще и подходит для формата, стиля и типовых ответов. RLVF имеет смысл, если результат можно надёжно проверять автоматически и обычных примеров недостаточно.

Отличие от RAG

RAG не обучает модель. Он находит актуальные сведения и добавляет их в запрос. RLVF меняет параметры модели, а RAG меняет контекст конкретного ответа.

Подходы можно сочетать. RAG даёт источники, а проверяемая награда учит модель правильно использовать их. Но для открытых диалогов, жалоб клиентов и оценки тона формального проверяющего правила часто нет. Там нужны человеческая оценка, тестовый набор и ручной контроль.

RLVF полезен не потому, что делает ИИ человечнее. Он даёт точный сигнал обучения там, где правильность можно вычислить.