모델 797건 · 국산 131 · 가격 639 추적 중
용어집 · 평가

벤치마크 오염

Benchmark Contamination · 중급

모델을 평가하는 벤치마크의 문제나 정답이 사전 학습 데이터에 그대로 섞여 들어가, 실제 능력보다 부풀려진 평가 점수가 나오는 현상을 말한다.

벤치마크는 서로 다른 모델의 능력을 공정하게 비교하기 위해 만들어지는데, 웹에서 대량으로 수집한 학습 데이터에 그 벤치마크의 문제나 정답지가 그대로 포함되면 모델이 문제를 풀어낸 것이 아니라 암기한 결과가 되어 점수의 신뢰성이 무너진다. 벤치마크 데이터셋이 논문이나 코드 저장소, 커뮤니티 게시글 형태로 공개되면서 크롤링 데이터에 흘러 들어가고, 모델은 사전 학습 과정에서 문제와 정답의 쌍을 그대로 노출받아 이를 기억해 버리는 방식으로 발생한다. 실무에서는 새로 나온 모델이 특정 벤치마크에서 유독 튀는 점수를 받았을 때 오염 여부를 먼저 의심하며, 벤치마크 제작 기관이 문제 일부를 비공개로 두거나 시간이 지나면 새 문제셋으로 교체하는 것도 이런 오염을 막기 위한 조치다. 또한 리더보드 순위만 보고 모델을 선정했다가 실제 서비스 환경에서 기대한 성능이 나오지 않을 때, 원인을 되짚어 보면 오염된 벤치마크 점수를 신뢰한 것이 문제였던 경우가 있다. 다만 오염이 확인됐다고 해서 모델의 전반적 능력이 없다는 뜻은 아니며, 문제 일부만 겹친 부분 오염과 정답을 통째로 암기한 경우는 구분해서 판단해야 하고, 오염 여부를 사후에 완벽히 검증하기는 쉽지 않다는 점도 함께 알아둘 필요가 있다.

평가 분야의 다른 용어

벤치마크평가