모델 803건 · 국산 131 · 가격 645 추적 중
AI 안전·정렬·평가

구글, 이중맹검 AI 평가 시범 운영…벤치마크 오염 차단

AI타임스·2026-08-28

요약

구글 딥마인드가 암호화 기술을 활용한 이중맹검(Double-blind) AI 모델 평가를 시범 운영한다고 발표했다. AI 모델이 평가 전 문제 데이터를 미리 학습해 성능 점수가 부풀려지는 '벤치마크 오염' 문제를 기술적으로 해결하려는 시도다. 구글 딥마인드는 27일(현지시간) 세계 최초로 자체 개발한 이중맹검 평가 기술 보고서를 공개했다. 현재는 평가자가 벤치마크 문제를 공개하면 개발사가 이를 모델 학습에 활용할 위험이 있다는 점을 문제로 지적했다.

큐레이터 노트

원문에 없는 맥락입니다

이번 시도는 벤치마크 유출 여부를 사후에 검증하는 방식이 아니라 암호화로 문제 노출 자체를 차단하는 접근이라는 점에서, 평가 결과 조작 논란이 반복돼온 AI 업계 관행에 제도적 대응책을 마련하려는 시도로 볼 수 있다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

구글 제미나이 '콜 포 미', 픽셀11서 전화 대신 걸기 시험
ZDNet Korea · 2026-09-29

구글이 9월 24일부터 미국 픽셀 11 이용자를 대상으로 제미나이의 '콜 포 미' 기능 시험을 시작했다고 테크크런치가 보도했다. 대상은 픽셀 11, 11 프로, 11 프로 XL, 11 프로 폴드이며 유료 제미나이 구독과 전화 앱 공개 베타 버전이 필요하다. 제미나이가 이용자의 번호로 업…

비드래프트 '다윈-180B-RSI', 벤치마크 5개 1위
ZDNet Korea · 2026-09-28

국내 AI 기업 비드래프트는 추론 모델 '다윈-180B-RSI'가 허깅페이스가 공인한 5개 리더보드에서 각 1위를 기록했다고 28일 밝혔다. 이 모델은 AIME 2026과 HMMT 2026에서 100% 만점을, GPQA 다이아몬드에서 94.44%를 기록해 기존 최고점(각각 97.1%, …

구글, 인도서 제미나이 통한 플립카트 즉시구매 테스트
ZDNet Korea · 2026-09-28

구글이 인도에서 일부 이용자를 대상으로 제미나이와 'AI 모드' 화면에서 플립카트 상품을 바로 구매할 수 있는 기능을 시험하고 있다. 구매 버튼을 누르면 화면 이탈 없이 플립카트 결제 절차로 연결되며, 대상은 스마트폰·전자제품·모바일 액세서리 등 일부 상품으로 제한된다. 구글은 인도 축…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
벤치마크 오염
모델을 평가하는 벤치마크의 문제나 정답이 사전 학습 데이터에 그대로 섞여 들어가, 실제 능력보다 부풀려진 평가 점수가 나오는 현상을 말한다.
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
학습
학습은 모델이 데이터를 반복적으로 살펴보며 예측 오차를 줄이는 방향으로 내부 파라미터를 조정해 나가는 과정을 말한다.
평가
AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →