AI 벤치마크 경쟁 과열, 신뢰성 논란도
AI 기업들이 회계, 법률, 모델 라우팅 등 각종 벤치마크에서 1위를 기록했다는 발표를 잇따라 내놓고 있다. 동시에 벤치마크 점수 자체의 신뢰성과 실제 업무 성능과의 격차를 지적하는 목소리도 함께 나왔다.
무슨 일이 있었나
- 데이터분석기업 머코어가 2026년 10월 1일 발표한 평가에서 앤트로픽의 클로드 오퍼스5가 회계 결산 업무 벤치마크를 100%에 가깝게 완수했다고 밝혔으며, 같은 평가에서 인간 완수율은 37%였다.
- AI 기업 비드래프트는 자체 모델 '다윈-180B-RSI'가 2026년 10월 1일 법률추론 벤치마크 'LEXam'과 'LEXam-hard'에서 1위를 기록했고, 9월 28일에는 허깅페이스 공인 5개 리더보드에서도 각각 1위에 올랐다고 밝혔다.
- 구글은 2026년 9월 30일 신규 모델 '제미나이4 아르곤'을 일부 사이버보안 파트너에 우선 공개했는데, 내부에서는 벤치마크 점수와 달리 실제 코딩 등 업무 안정성에 대한 회의론이 제기됐다.
- KT는 2026년 9월 27일 자체 개발한 AI 모델 라우팅 기술 '오토모델라우터'가 미국 라이스대 연구진이 만든 'LLM 라우터 아레나' 벤치마크의 정확도·비용 종합 평가에서 2위를 기록했다고 밝혔다.
- AI 연구기관 에포크AI는 2026년 9월 18일 주요 AI 벤치마크의 신뢰성을 점검하는 '벤치마크 리뷰'를 시작했다고 밝혔고, 초기 검토 대상 15개 중 9개에서 결함을 발견했다고 전했다.
왜 중요한가
- 기업들이 벤치마크 1위 기록을 경쟁적으로 발표하고 있지만, 머코어 연구진은 이를 단순한 인간 대체가 아니라 평가 방식 자체가 바뀌는 신호로 해석했다.
- 구글 사례처럼 벤치마크 점수가 높아도 실제 복잡한 업무에서는 안정적이지 않을 수 있다는 지적이 내부에서 나왔다.
- 에포크AI 검토에서 15개 벤치마크 중 9개가 결함이 있는 것으로 나타나, 벤치마크 점수 자체를 그대로 신뢰하기 어려울 수 있다는 점이 드러났다.
나에게 무슨 상관인가
당장 이 소식이 일반 독자의 업무나 생활을 바꾸지는 않는다. 다만 벤치마크 1위라는 홍보 문구만으로 어떤 AI 서비스가 실제로 가장 뛰어난지 판단하기는 어려워졌다는 점은 알아둘 만하다. 에포크AI가 지적했듯 벤치마크 자체에 결함이 있을 수 있고, 구글 사례처럼 높은 점수가 실제 업무 안정성을 보장하지 않을 수 있기 때문이다.
다음에 볼 것
- 구글이 제미나이4 아르곤을 추가 테스트를 거쳐 유료 가입자에게 확대 제공할지
- 에포크AI의 벤치마크 리뷰가 다른 벤치마크에 대해서도 추가 검증 결과를 내놓을지
- 비드래프트 다윈-180B-RSI가 추가 벤치마크에서도 선두 기록을 이어갈지
읽은 원문
이 브리핑은 아래 13건만 근거로 썼습니다
- 클로드 오퍼스5, 회계 벤치마크서 100% 달성AI타임스 · 2026-10-03
- 비드래프트, 법률 데이터 없이 LEXam 벤치마크 1위AI타임스 · 2026-10-01
- 구글, 제미나이 4 아르곤 내부서 실성능 회의론AI타임스 · 2026-10-01
- 구글, 보안 결함 스스로 고치는 '제미나이 4 아르곤' 공개테크42 · 2026-10-01
- 비드래프트 '다윈-180B-RSI', 벤치마크 5개 1위ZDNet Korea · 2026-09-28
- KT '오토모델라우터', LLM 라우터 벤치마크서 2위전자신문 SW · 2026-09-27
- KT 오토모델라우터, 라우터 아레나 2위 기록IT조선 · 2026-09-27
- KT 자체 AI 라우팅 기술, 라우터 아레나 2위 올라ZDNet Korea · 2026-09-27
- 에포크AI, 벤치마크 신뢰성 검증 착수AI타임스 · 2026-09-22
- 뉴로퓨전, 미래예측 벤치마크 ForecastBench 1위전자신문 SW · 2026-09-22
- 뉴로퓨전, 글로벌 예측 벤치마크 1위 달성AI타임스 · 2026-09-21
- xAI 그록 4.6, 아마존 베드록에 출시AWS ML Blog · 2026-09-21
- 오픈아트, 이미지·비디오 생성모델 평가 아레나 출시AI타임스 · 2026-09-21