모델 698건 · 국산 131 · 가격 519 추적 중
용어집 · 정렬

직접 선호 최적화

DPO (Direct Preference Optimization) · 고급

사람이 어느 응답을 더 선호하는지 표시한 비교 데이터만으로, 별도의 보상 모델이나 강화학습 단계 없이 언어모델을 직접 최적화해 정렬시키는 기법을 말한다.

RLHF는 보상 모델을 따로 학습시킨 뒤 PPO 같은 강화학습으로 정책을 조정해야 해서 파이프라인이 복잡하고 학습이 불안정해지기 쉽다는 문제가 있었다. DPO는 '선택된 응답'과 '거부된 응답' 쌍에 대해, 기준 모델 대비 선택된 응답의 로그확률은 높이고 거부된 응답의 로그확률은 낮추는 손실함수를 직접 최적화함으로써, 수학적으로 보상 모델을 명시적으로 두지 않고도 동일한 목표를 달성한다. 실무에서는 오픈소스 언어모델을 사람의 선호에 맞게 미세조정할 때 RLHF의 대안으로 널리 쓰이며, 선호 쌍 데이터셋만 준비되면 비교적 단순한 지도학습 형태로 정렬 단계를 수행할 수 있어 학습 인프라 부담이 적은 프로젝트에서 자주 채택된다. 흔한 오해는 보상 모델 개념 자체가 사라졌다고 생각하는 것인데, 실제로는 정책 모델 안에 보상 함수가 암묵적으로 녹아 있는 구조이며, 결과물의 품질은 여전히 선호 데이터의 정확성과 다양성에 크게 좌우된다.

정렬 분야의 다른 용어

인간 피드백 강화학습정렬헌법적 AI
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.