모델 816건 · 국산 131 · 가격 654 추적 중
파운데이션 모델·LLM

비드래프트 '다윈-180B-RSI', 벤치마크 5개 1위

ZDNet Korea·2026-09-28

요약

국내 AI 기업 비드래프트는 추론 모델 '다윈-180B-RSI'가 허깅페이스가 공인한 5개 리더보드에서 각 1위를 기록했다고 28일 밝혔다. 이 모델은 AIME 2026과 HMMT 2026에서 100% 만점을, GPQA 다이아몬드에서 94.44%를 기록해 기존 최고점(각각 97.1%, 92.7%)과 키미-K3(93.5%)를 앞섰다고 회사 측은 설명했다. MMLU-프로와 MMMU-프로에서도 각각 88.12%, 79.48%를 기록했다. 비드래프트는 자체 기술인 선택적 병합 '다윈', 재귀적 자가개선(RSI), 정답 확신도를 사전에 산출하는 'ZTC'를 적용했다고 밝혔다.

큐레이터 노트

원문에 없는 맥락입니다

제시된 벤치마크 점수는 비드래프트가 직접 발표한 수치이며, 허깅페이스 리더보드가 공인한 결과라는 점 외에 별도의 독립 기관 검증 여부는 원문에 나타나 있지 않다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

비드래프트, 중국 모델스코프서 '연구기관' 인증 획득
AI타임스 · 2026-10-02

AI 전문기업 비드래프트가 중국 AI 모델 플랫폼 모델스코프로부터 '연구기관' 공식 인증을 받았다고 2일 밝혔다. 국내 AI 조직 가운데 이 인증을 받은 곳은 비드래프트가 유일하다고 회사 측은 설명했다. 모델스코프는 알리바바와 중국컴퓨터학회(CCF)가 공동 설립한 오픈소스 AI 모델 커…

비드래프트, 법률 데이터 없이 LEXam 벤치마크 1위
AI타임스 · 2026-10-01

AI 기업 비드래프트는 자체 개발한 추론 모델 '다윈-180B-RSI'가 허깅페이스 공인 법률 추론 벤치마크 'LEXam'과 'LEXam-hard'에서 각각 1위를 기록했다고 1일 밝혔다. 이 모델은 법률 데이터를 전혀 학습하지 않았으며, 사람이 작성한 정답 풀이 대신 AI가 스스로 수…

구글, 제미나이 4 아르곤 내부서 실성능 회의론
AI타임스 · 2026-10-01

구글이 차세대 플래그십 모델 '제미나이 4 아르곤'을 공개했으나, 내부에서는 실제 업무 성능을 두고 엇갈린 평가가 나오고 있다. 벤치마크 점수는 높았지만 실제 제품 개발이나 복잡한 코딩 작업에서는 기대만큼 안정적이지 않다는 지적이 제기됐다. 구글은 9월 30일(현지시간) 일부 사이버보안…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
추론 모델
최종 답을 내놓기 전에 문제를 여러 단계로 나누어 스스로 사고 과정을 생성하도록 훈련된 대규모 언어 모델을 말한다.
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

ZDNet Korea 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →