아티피셜 애널리시스, AAII 평가체계 개편
요약
아티피셜 애널리시스가 9월 6일(현지시간) AI 지능 지수(AAII) 평가 체계를 실제 업무 환경과 유사한 장기 에이전트 작업 수행 능력 중심으로 개편했다고 밝혔다. 기존 벤치마크에서 나타난 단순 편법 대응, 특정 데이터에 대한 편향, 상위권 모델 간 점수 포화 문제를 줄이기 위한 조치라고 설명했다. 이번 개편으로 기존 평가에서 5위에 머물렀던 'GPT-6 아스트라'의 순위가 크게 상승해 '클로드 페이블 5.1'과 공동 1위에 올랐다.
큐레이터 노트
원문에 없는 맥락입니다
다른 매체는 이렇게 썼다
같은 사안을 다룬 다른 곳의 보도입니다
오픈AI가 미국 샌프란시스코에서 열린 '데브데이 2026'에서 AI 에이전트 '닷(dots)'을 공개했다. 닷은 사용자의 목표와 업무 방식을 익혀 여러 작업을 지속적으로 수행하며, 연결된 앱과 자체 클라우드 컴퓨터·브라우저를 활용해 작업을 진행한다. 사용자는 닷에 프로젝트를 맡긴 뒤 진…
국내 AI 기업 비드래프트는 추론 모델 '다윈-180B-RSI'가 허깅페이스가 공인한 5개 리더보드에서 각 1위를 기록했다고 28일 밝혔다. 이 모델은 AIME 2026과 HMMT 2026에서 100% 만점을, GPQA 다이아몬드에서 94.44%를 기록해 기존 최고점(각각 97.1%, …
KT가 자체 개발한 AI 모델 라우팅 기술 '오토모델라우터'가 LLM 라우터 전문 공개 벤치마크 '라우터 아레나'에서 종합 2위를 기록했다. 이 기술은 공개 리더보드에 'KT-ModelRouter'라는 이름으로 등재됐으며, 정확도와 비용을 함께 평가하는 'Acc-Cost Arena' 기…
이 사안의 흐름
같은 주제를 다룬 이 사이트의 기록 — 최신순
- 2026-09-02앤트로픽, 클로드 페이블 5.1 출시…AAII 최고점AI타임스
- 2026-09-27KT 오토모델라우터, 라우터 아레나 2위 기록IT조선
- 2026-09-27KT 자체 AI 라우팅 기술, 라우터 아레나 2위 올라ZDNet Korea
- 2026-09-22앤트로픽, 신형 플래그십 '클로드 오퍼스 5.5' 공개AI타임스
- 2026-09-22샤오미, 오픈소스 '미모-V2.6' 공개…AAII 중국 최고점AI타임스
이 글에 나온 말
이 분야 브리핑
여러 매체가 함께 다룬 사안을 한 번에
이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.
같은 분야의 다른 소식
- 구글, 재학습 없이 에이전트 개선하는 'RRSI' 공개AI타임스 · 2026-09-30
- 한양대 연구팀, 조기 종료형 AI 추론 기술 NeurIPS 2026 채택전자신문 SW · 2026-09-30
- 작물 사이 누비며 병충해 찾는 로봇견 개발전자신문 IT · 2026-09-30
- 원자력연구원, AI 활용 방사선 분자 연구 추진 계획ZDNet Korea · 2026-09-30
- GIST-MIT, 앉아서 걷는 감각 주는 VR 기술 개발전자신문 SW · 2026-09-29
- AI가 수학 난제 풀자, 수학자들이 더 걱정하는 것AI타임스 · 2026-09-29