모델 803건 · 국산 131 · 가격 645 추적 중
AI 연구

구글, 벤치마크 능동화 하네스로 AI 잠재력 끌어내

AI타임스·2026-08-31

요약

구글 클라우드 연구진이 세인트루이스 워싱턴대, 노스캐롤라이나대 채플힐 캠퍼스 연구진과 함께 정적인 AI 에이전트 평가 환경을 정책 학습에 맞춰 능동적으로 바꾸는 프로그래밍 가능 레이어 '엔브하네스(EnvHarness)'를 아카이브에 공개했다. 기존 고정된 벤치마크 대신 AI의 약점을 겨냥한 맞춤형 훈련 환경을 제공한 결과, AI 모델의 실제 문제 해결 능력과 처리 효율성이 향상된 것으로 나타났다.

큐레이터 노트

원문에 없는 맥락입니다

이번 결과는 벤치마크 점수 자체보다 '평가 환경을 학습에 맞춰 조정하는 방식'이 에이전트 개선에 유효할 수 있음을 보여준다는 점에서, 고정된 리더보드형 평가의 한계를 보완하는 방향으로 읽힌다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

KB손해보험 민원 10% 감소…AI 에이전트가 기여
블로터 · 2026-09-30

KB손해보험의 2분기 민원 접수 건수가 전분기 대비 10.65% 감소한 1502건으로 집계됐다. 손해보험협회 소비자정보 통합공시에 따르면 보상 관련 민원이 두 자릿수 감소하며 전체 민원 감소를 이끌었다. KB손보는 민원 내용을 AI로 분석하고 처리 가이드를 제공하는 방식으로 민원 대응 …

무하유 카피킬러, 문서 '작성 검증' 기능 출시
ZDNet Korea · 2026-09-30

무하유가 카피킬러에 '작성 검증' 기능을 출시했다. 문서 작성 중 타이핑·수정·삭제·붙여넣기 등 150여 가지 활동을 자동 기록하고, 작성 과정을 시간순으로 확인하는 리플레이 기능을 제공한다. 별도 프로그램 설치 없이 카피킬러 문서 에디터에서 무료로 이용할 수 있으며, 향후 문서 내용 …

IT조선·NIA, 국내 에이전틱 AI 지도 그리기 나서
IT조선 · 2026-09-30

IT조선이 한국지능정보사회진흥원(NIA)과 공동으로 국내 AI 에이전트 산업 현황을 살펴보는 '에이전틱 AI 맵' 기획시리즈를 시작했다. 1차로 에이전틱 AI 얼라이언스 회원사를 대상으로 설문조사를 진행했으며, 응답 기업과 국내 주요 AI 기업을 차례로 소개하는 방식으로 시리즈를 이어간…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
AI 에이전트
AI 에이전트는 주어진 목표를 달성하기 위해 스스로 계획을 세우고 도구를 호출하며 행동한 결과를 관찰해 다음 행동을 결정하는 AI 시스템을 말한다.
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
학습
학습은 모델이 데이터를 반복적으로 살펴보며 예측 오차를 줄이는 방향으로 내부 파라미터를 조정해 나가는 과정을 말한다.
평가
AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →