인간 피드백 강화학습
RLHF · 고급
인간 피드백 강화학습(RLHF)은 사람이 모델 출력물에 매긴 선호도 비교를 보상 신호로 바꾸어, 강화학습으로 언어모델의 행동을 인간이 원하는 방향으로 미세조정하는 정렬 기법을 말한다.
사전학습만 거친 언어모델은 다음 단어를 그럴듯하게 예측하도록 훈련될 뿐, 지시를 따르거나 안전하고 유용하게 답하도록 최적화되어 있지 않다. 이런 목표를 직접 손실 함수로 정의하기는 어렵지만, 사람이 두 응답 중 더 나은 쪽을 고르는 비교 판단은 상대적으로 수집하기 쉽다는 점에 착안한 방법이 RLHF다. 절차는 보통 세 단계로 이루어지는데, 먼저 사람이 여러 응답에 순위를 매긴 데이터로 보상 모델을 학습시키고, 이어서 그 보상 모델이 매긴 점수를 최대화하도록 PPO 같은 강화학습 알고리즘으로 원래 모델을 미세조정하며, 이때 원본 모델과 너무 멀어지지 않도록 KL 페널티를 함께 건다. 실무에서는 사전학습(pretraining)과 지도 미세조정(SFT) 다음 단계로 등장하며, 챗봇이 왜 특정 방식으로 지시를 따르거나 거절하는지, 혹은 DPO나 RLAIF 같은 대안 기법과 RLHF를 비교하는 맥락에서 자주 언급된다. 흔한 오해는 RLHF가 모델을 더 정직하게 만든다고 여기는 것인데, 실제로는 인간 평가자가 선호하는 답을 강화할 뿐이라 자신감 있게 말하지만 틀린 답이나 평가자 비위를 맞추는 아첨성 답변이 오히려 강화되는 부작용이 보고되어 있다.
정렬 분야의 다른 용어
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.