모델 817건 · 국산 131 · 가격 654 추적 중
AI 안전·정렬·평가

클로드 오퍼스5, 회계 벤치마크서 100% 달성

AI타임스·2026-10-03

요약

데이터 분석기업 머코어가 2026년 10월 1일(현지시간) 발표한 평가에 따르면, 앤트로픽의 클로드 오퍼스 5는 월말 결산 등 실제와 유사한 회계 업무 벤치마크에서 100%에 가까운 완수율을 기록했다. 이는 같은 평가에서 인간이 보인 37%와 대비되는 결과로, 머코어가 자체적으로 측정한 수치다. 연구진은 이를 단순한 인간 업무 대체로 해석하기보다, 인간이 시간과 비용 제약으로 하지 못했던 정교한 대량 작업을 AI가 수행하는 사례로 보고 벤치마크 평가의 패러다임이 이동하고 있다고 설명했다.

큐레이터 노트

원문에 없는 맥락입니다

해당 수치는 머코어의 자체 벤치마크 결과이며, 연구진도 '인간 대체'가 아니라 평가 방식 자체의 변화로 해석했다는 점을 함께 짚을 필요가 있다.

깊이 읽기

이 기사 한 건이 아니라, 같은 사안을 다룬 이 사이트의 기록을 근거로 정리했습니다

이 일이 어디서 왔나

같은 주에 비드래프트의 법률·추론 벤치마크 1위, KT 오토모델라우터의 라우터 아레나 2위 등 AI 기업들의 벤치마크 성과 발표가 잇따랐다. 한편 9월 18일 에포크AI는 주요 벤치마크 15개 중 9개에 결함이 있다며 벤치마크 자체의 신뢰성 검증에 착수했고, 구글은 제미나이 4 아르곤의 높은 벤치마크 점수와 실제 업무 성능 사이에 괴리가 있다는 내부 지적을 받고 있다. 클로드 오퍼스5의 회계 벤치마크 100% 결과도 이런 흐름 속에 나왔다.

짚어야 할 점

  • 100%라는 수치는 앤트로픽이 아니라 데이터 분석기업 머코어가 자체적으로 측정한 결과이며, 연구진도 '인간 대체'보다는 평가 패러다임 자체의 변화로 해석했다는 점이 기사 안에서도 강조됐다.
  • 같은 기간 구글 제미나이 4 아르곤의 경우 벤치마크 점수는 높았지만 실제 코딩·제품 개발에서는 기대만큼 안정적이지 않다는 내부 평가가 나온 것과 대비해 볼 필요가 있다.
  • 에포크AI가 9월 18일부터 주요 벤치마크 15개 중 9개에서 결함을 발견했다고 밝힌 시점과 맞물려, 이번처럼 기업이나 분석업체가 자체 발표하는 벤치마크 수치를 그대로 받아들이기보다 검증 여부를 함께 봐야 한다는 지적이 나오는 중이다.
  • 비드래프트의 다윈-180B-RSI, KT 오토모델라우터 등 비슷한 시기 잇따른 '벤치마크 1·2위' 발표들과 마찬가지로, 특정 과제 환경에서의 결과가 전반적인 실무 적용 가능성을 바로 의미하지는 않는다.

아직 확인되지 않은 것

  • 머코어가 설계한 회계 업무 벤치마크의 과제 구성과 채점 기준이 구체적으로 공개됐는지는 확인되지 않았다.
  • 인간 참가자의 37% 완수율이 어떤 시간·도구 제약 아래 측정됐는지는 나오지 않았다.
  • 이 벤치마크가 에포크AI 등 외부 기관의 검증을 받았는지, 혹은 머코어의 자체 평가로만 머물러 있는지는 확인되지 않았다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

구글, 보안 결함 스스로 고치는 '제미나이 4 아르곤' 공개
테크42 · 2026-10-01

구글이 소프트웨어의 보안 취약점을 스스로 탐지하고 수정하는 방어적 사이버 업무에 특화된 신규 AI 모델 '제미나이 4 아르곤'을 공개했다. 이 모델은 보안 파트너십 프로그램을 통해 선별된 기업에 우선 제공되며, 구글 내부에서는 이미 복잡한 코드 수정과 시스템 이전 작업에 활용 중이다. …

비드래프트 '다윈-180B-RSI', 벤치마크 5개 1위
ZDNet Korea · 2026-09-28

국내 AI 기업 비드래프트는 추론 모델 '다윈-180B-RSI'가 허깅페이스가 공인한 5개 리더보드에서 각 1위를 기록했다고 28일 밝혔다. 이 모델은 AIME 2026과 HMMT 2026에서 100% 만점을, GPQA 다이아몬드에서 94.44%를 기록해 기존 최고점(각각 97.1%, …

KT '오토모델라우터', LLM 라우터 벤치마크서 2위
전자신문 SW · 2026-09-27

KT가 자체 개발한 AI 모델 라우팅 기술 '오토모델라우터'가 LLM 라우터 전문 공개 벤치마크 '라우터 아레나'에서 종합 2위를 기록했다. 이 기술은 공개 리더보드에 'KT-ModelRouter'라는 이름으로 등재됐으며, 정확도와 비용을 함께 평가하는 'Acc-Cost Arena' 기…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
평가
AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →