모델 698건 · 국산 131 · 가격 519 추적 중
용어집 · 평가

벤치마크

Benchmark · 입문

AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.

AI 모델마다 구조와 학습 방식이 달라 '어느 모델이 더 잘하는가'를 말로만 비교하기는 어렵다. 벤치마크는 동일한 문제 세트와 동일한 채점 방식을 모든 모델에 적용해, 성능을 수치로 환산하고 나란히 비교할 수 있게 해준다. 구성 요소는 보통 문제(질문·과제)와 정답, 그리고 모델의 답을 정답과 비교해 점수를 매기는 채점 규칙으로 이루어진다. 실무에서는 여러 모델 중 하나를 선택할 때, 새로 나온 모델의 발표 자료를 읽을 때, 또는 자체 서비스에 맞는 모델을 고르기 위해 특정 영역(코딩, 수학, 대화 등) 벤치마크 점수를 참고할 때 마주치게 된다. 다만 벤치마크 점수가 높다고 해서 실제 서비스 환경에서도 똑같이 잘 작동한다는 보장은 없으며, 문제 데이터가 모델 학습 과정에 이미 노출되어 점수가 부풀려지는 경우도 있어 참고 지표 중 하나로만 다루는 것이 안전하다.

모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.