모델 801건 · 국산 131 · 가격 643 추적 중
용어집 · 평가

평가

Evaluation (Eval) · 중급

AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.

프롬프트를 수정하거나 모델을 교체했을 때 성능이 실제로 좋아졌는지 나빠졌는지를 감이 아니라 데이터로 확인할 필요가 있어서 등장한 개념이다. 입력과 기대 출력 또는 채점 기준으로 구성된 데이터셋을 준비한 뒤, 모델의 실제 출력을 규칙 기반 채점, 다른 모델을 채점자로 쓰는 LLM-as-judge, 사람의 직접 검토 등으로 점수를 매기는 방식으로 이루어진다. 실무에서는 이런 평가 파이프라인을 CI 과정에 넣어, 배포 전이나 모델 교체 시 회귀가 없는지 자동으로 확인하는 경우가 많다. 특정 작업(요약, 분류, 코드 생성 등)마다 평가 기준과 데이터셋을 따로 설계해야 하며, 하나의 범용 점수로 모든 용도를 판단하기는 어렵다. 다만 벤치마크나 평가 점수가 높다고 해서 실제 서비스 환경에서의 품질이나 사용자 만족도까지 보장되는 것은 아니며, 평가 데이터셋이 실사용 분포와 동떨어져 있으면 결과가 왜곡될 수 있다는 점에 유의해야 한다.

함께 보기

평가 분야의 다른 용어

벤치마크벤치마크 오염