모델 822건 · 국산 131 · 가격 659 추적 중
MLOps·개발도구

바이트댄스, AI 하네스 구축 능력 평가 '하네스데브' 공개

AI타임스·2026-09-12

요약

AI 에이전트 성능이 모델 자체 능력뿐 아니라 실행 환경인 '하네스'에도 좌우된다는 문제의식에서, 바이트댄스 연구진이 LLM이 에이전트 실행 시스템을 직접 구축하고 발전시키는 능력을 측정하는 평가 프레임워크 '하네스데브'를 온라인 아카이브를 통해 공개했다. 하네스는 모델을 실제 작업 수행 시스템으로 바꾸는 소프트웨어 계층으로, 실행 루프와 도구 사용 등을 포함한다.

큐레이터 노트

원문에 없는 맥락입니다

기존 에이전트 평가가 모델의 문제 해결 능력에 집중했다면, 이번 프레임워크는 모델이 자신을 둘러싼 실행 인프라까지 만들 수 있는지를 별도로 측정한다는 점에서 평가 대상의 층위를 한 단계 넓힌 시도로 볼 수 있다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

월드, AI 에이전트 뒤 '실제 사람' 증명 기술 확대
테크42 · 2026-10-08

월드(World)가 AI 에이전트와 실제 이용자를 연결하는 '인간 증명' 기술의 활용 범위를 넓히고 있다. 이용자가 월드 ID를 에이전트에 위임하면 영지식증명 기술을 통해 개인정보 공개 없이 실제 사람이 해당 에이전트 뒤에 있는지 확인할 수 있다. 이를 통해 한 사람이 여러 에이전트를 …

메타, AI 비서 '뮤즈' 아이패드 전용 앱 출시
IT조선 · 2026-10-08

메타가 AI 비서 '뮤즈'의 아이패드 전용 앱을 출시했다. 아이폰 앱 출시 후 약 한 달 만의 확장이다. 뮤즈는 이용자가 계정을 연결하면 이메일, 회의 일정, 청구서를 관리해주는 개인용 AI 에이전트로, 예약과 식료품 주문, 목표 설정, 상품 구매 등도 지원한다. 메타는 이런 기능을 계…

카카오, LLM 학습·경량화 연구 성과 COLM서 발표
전자신문 SW · 2026-10-08

카카오가 언어모델링 국제 학회 'COLM 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 기술과, 모델 크기를 줄이면서도 성능을 개선하는 경량화 기술을 발표했다고 8일 밝혔다. 이는 고성능 언어모델 개발에 필요한 자원을 효율적으로 활용하기 위한 연구 결과다. COL…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
AI 에이전트
AI 에이전트는 주어진 목표를 달성하기 위해 스스로 계획을 세우고 도구를 호출하며 행동한 결과를 관찰해 다음 행동을 결정하는 AI 시스템을 말한다.
평가
AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →