모델 817건 · 국산 131 · 가격 654 추적 중
이슈 브리핑

AI 벤치마크 경쟁 과열, 신뢰성 논란도

AI 기업들이 회계, 법률, 모델 라우팅 등 각종 벤치마크에서 1위를 기록했다는 발표를 잇따라 내놓고 있다. 동시에 벤치마크 점수 자체의 신뢰성과 실제 업무 성능과의 격차를 지적하는 목소리도 함께 나왔다.

6개 매체·기사 13건·2026-10-03AI 안전·정렬·평가

무슨 일이 있었나

  • 데이터분석기업 머코어가 2026년 10월 1일 발표한 평가에서 앤트로픽의 클로드 오퍼스5가 회계 결산 업무 벤치마크를 100%에 가깝게 완수했다고 밝혔으며, 같은 평가에서 인간 완수율은 37%였다.
  • AI 기업 비드래프트는 자체 모델 '다윈-180B-RSI'가 2026년 10월 1일 법률추론 벤치마크 'LEXam'과 'LEXam-hard'에서 1위를 기록했고, 9월 28일에는 허깅페이스 공인 5개 리더보드에서도 각각 1위에 올랐다고 밝혔다.
  • 구글은 2026년 9월 30일 신규 모델 '제미나이4 아르곤'을 일부 사이버보안 파트너에 우선 공개했는데, 내부에서는 벤치마크 점수와 달리 실제 코딩 등 업무 안정성에 대한 회의론이 제기됐다.
  • KT는 2026년 9월 27일 자체 개발한 AI 모델 라우팅 기술 '오토모델라우터'가 미국 라이스대 연구진이 만든 'LLM 라우터 아레나' 벤치마크의 정확도·비용 종합 평가에서 2위를 기록했다고 밝혔다.
  • AI 연구기관 에포크AI는 2026년 9월 18일 주요 AI 벤치마크의 신뢰성을 점검하는 '벤치마크 리뷰'를 시작했다고 밝혔고, 초기 검토 대상 15개 중 9개에서 결함을 발견했다고 전했다.

왜 중요한가

  • 기업들이 벤치마크 1위 기록을 경쟁적으로 발표하고 있지만, 머코어 연구진은 이를 단순한 인간 대체가 아니라 평가 방식 자체가 바뀌는 신호로 해석했다.
  • 구글 사례처럼 벤치마크 점수가 높아도 실제 복잡한 업무에서는 안정적이지 않을 수 있다는 지적이 내부에서 나왔다.
  • 에포크AI 검토에서 15개 벤치마크 중 9개가 결함이 있는 것으로 나타나, 벤치마크 점수 자체를 그대로 신뢰하기 어려울 수 있다는 점이 드러났다.

나에게 무슨 상관인가

당장 이 소식이 일반 독자의 업무나 생활을 바꾸지는 않는다. 다만 벤치마크 1위라는 홍보 문구만으로 어떤 AI 서비스가 실제로 가장 뛰어난지 판단하기는 어려워졌다는 점은 알아둘 만하다. 에포크AI가 지적했듯 벤치마크 자체에 결함이 있을 수 있고, 구글 사례처럼 높은 점수가 실제 업무 안정성을 보장하지 않을 수 있기 때문이다.

다음에 볼 것

  • 구글이 제미나이4 아르곤을 추가 테스트를 거쳐 유료 가입자에게 확대 제공할지
  • 에포크AI의 벤치마크 리뷰가 다른 벤치마크에 대해서도 추가 검증 결과를 내놓을지
  • 비드래프트 다윈-180B-RSI가 추가 벤치마크에서도 선두 기록을 이어갈지

읽은 원문

이 브리핑은 아래 13건만 근거로 썼습니다

사진 Tima Miroshnichenko / Pexels