모델 817건 · 국산 131 · 가격 654 추적 중
AI 안전·정렬·평가

뉴로퓨전, 미래예측 벤치마크 ForecastBench 1위

전자신문 SW·2026-09-22

요약

금융 AI 투자 플랫폼 'Valley AI' 운영사 뉴로퓨전은 자사 금융 AI 연구팀이 글로벌 AI 미래 예측 벤치마크 'ForecastBench'의 선행 리더보드에서 1위를 기록했다고 9월 21일 밝혔다. ForecastBench는 경제·금융·정치·기술 등 다양한 영역의 실제 사건을 예측하는 문제로 구성된 벤치마크로, AI의 미래 예측 능력 평가 분야에서 정통성을 인정받고 있다. 이 벤치마크는 베스트셀러 『슈퍼 예측』의 저자 필립 테틀록과 관련이 있는 것으로 언급됐다.

큐레이터 노트

원문에 없는 맥락입니다

ForecastBench는 정답이 정해진 지식 문제가 아니라 아직 결과가 나오지 않은 실제 사건의 확률을 맞히는 방식이어서, 모델의 추론·판단 능력을 평가하는 척도로 주목받는다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

비드래프트, 허깅페이스 리더보드 10개 부문 1위 석권
ZDNet Korea · 2026-10-06

AI 딥테크 스타트업 비드래프트가 허깅페이스 공인 리더보드에서 10개 부문 1위에 올라 48개 벤치마크·95개 조직이 경쟁한 무대에서 가장 많은 1위를 기록했다고 밝혔다. 2위인 중국 지푸AI의 1위 개수(4개)보다 두 배 이상 많다. 새로 추가된 1위는 문서에서 정보를 추출하는 'Ex…

클로드 오퍼스5, 회계 벤치마크서 100% 달성
AI타임스 · 2026-10-03

데이터 분석기업 머코어가 2026년 10월 1일(현지시간) 발표한 평가에 따르면, 앤트로픽의 클로드 오퍼스 5는 월말 결산 등 실제와 유사한 회계 업무 벤치마크에서 100%에 가까운 완수율을 기록했다. 이는 같은 평가에서 인간이 보인 37%와 대비되는 결과로, 머코어가 자체적으로 측정한…

비드래프트, 법률 데이터 없이 LEXam 벤치마크 1위
AI타임스 · 2026-10-01

AI 기업 비드래프트는 자체 개발한 추론 모델 '다윈-180B-RSI'가 허깅페이스 공인 법률 추론 벤치마크 'LEXam'과 'LEXam-hard'에서 각각 1위를 기록했다고 1일 밝혔다. 이 모델은 법률 데이터를 전혀 학습하지 않았으며, 사람이 작성한 정답 풀이 대신 AI가 스스로 수…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
평가
AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

전자신문 SW 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →