클로드 오퍼스5, 회계 벤치마크서 100% 달성
요약
데이터 분석기업 머코어가 2026년 10월 1일(현지시간) 발표한 평가에 따르면, 앤트로픽의 클로드 오퍼스 5는 월말 결산 등 실제와 유사한 회계 업무 벤치마크에서 100%에 가까운 완수율을 기록했다. 이는 같은 평가에서 인간이 보인 37%와 대비되는 결과로, 머코어가 자체적으로 측정한 수치다. 연구진은 이를 단순한 인간 업무 대체로 해석하기보다, 인간이 시간과 비용 제약으로 하지 못했던 정교한 대량 작업을 AI가 수행하는 사례로 보고 벤치마크 평가의 패러다임이 이동하고 있다고 설명했다.
큐레이터 노트
원문에 없는 맥락입니다
다른 매체는 이렇게 썼다
같은 사안을 다룬 다른 곳의 보도입니다
구글이 소프트웨어의 보안 취약점을 스스로 탐지하고 수정하는 방어적 사이버 업무에 특화된 신규 AI 모델 '제미나이 4 아르곤'을 공개했다. 이 모델은 보안 파트너십 프로그램을 통해 선별된 기업에 우선 제공되며, 구글 내부에서는 이미 복잡한 코드 수정과 시스템 이전 작업에 활용 중이다. …
국내 AI 기업 비드래프트는 추론 모델 '다윈-180B-RSI'가 허깅페이스가 공인한 5개 리더보드에서 각 1위를 기록했다고 28일 밝혔다. 이 모델은 AIME 2026과 HMMT 2026에서 100% 만점을, GPQA 다이아몬드에서 94.44%를 기록해 기존 최고점(각각 97.1%, …
KT가 자체 개발한 AI 모델 라우팅 기술 '오토모델라우터'가 LLM 라우터 전문 공개 벤치마크 '라우터 아레나'에서 종합 2위를 기록했다. 이 기술은 공개 리더보드에 'KT-ModelRouter'라는 이름으로 등재됐으며, 정확도와 비용을 함께 평가하는 'Acc-Cost Arena' 기…
이 사안의 흐름
같은 주제를 다룬 이 사이트의 기록 — 최신순
- 2026-10-01비드래프트, 법률 데이터 없이 LEXam 벤치마크 1위AI타임스
- 2026-10-01구글, 제미나이 4 아르곤 내부서 실성능 회의론AI타임스
- 2026-09-27KT 오토모델라우터, 라우터 아레나 2위 기록IT조선
- 2026-09-27KT 자체 AI 라우팅 기술, 라우터 아레나 2위 올라ZDNet Korea
- 2026-09-22에포크AI, 벤치마크 신뢰성 검증 착수AI타임스
이 글에 나온 말
이 분야 브리핑
여러 매체가 함께 다룬 사안을 한 번에
이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.
같은 분야의 다른 소식
- AI 추론 '침묵화'로 사고 사슬 모니터링 무력화 우려AI타임스 · 2026-10-03
- 구글 딥마인드, AI 단백질 워터마크 '신스ID 바이오' 공개AI타임스 · 2026-10-02
- 앤트로픽, 중국 GLM-5.3 해킹 위험성 경고AI타임스 · 2026-10-02
- 강장묵 교수, 튀르키예 기업과 AI 보안 협력 논의전자신문 SW · 2026-10-02
- 오픈AI, 기밀 유출 의혹 안전연구원 3명 해고ZDNet Korea · 2026-10-02
- Arm, 엔비디아 에이전틱 AI 보안 플랫폼에 반도체 IP 지원ZDNet Korea · 2026-10-02