모델 801건 · 국산 131 · 가격 643 추적 중
AI 에이전트·툴 유즈

AWS, 에이전트 '스킬' 평가하는 전용 지표 공개

AWS ML Blog·2026-09-22영문 원문

요약

AWS가 Strands Evals SDK와 Amazon Bedrock AgentCore Evaluations에 에이전트의 '스킬' 사용을 진단하는 전용 평가지표를 추가했다. 스킬은 SKILL.md 형태로 저장되는 재사용 가능한 도메인별 지침 묶음으로, 에이전트가 필요할 때만 불러와 사용하는 방식이다. 새 지표는 적절한 스킬을 선택했는지 이진 판정하는 Skill Selection Accuracy, 선택한 스킬의 절차를 얼마나 충실히 따랐는지 5단계로 평가하는 Skill Instruction Following, 스킬이 실제로 로드됐는지 확인하는 결정론적 검사 Skill Invoked로 구성된다. AWS는 인사(HR) 어시스턴트 사례를 들어, 잘못된 스킬을 고르는 경우와 올바른 스킬을 고르고도 지시를 일부만 따르는 경우를 구분해 진단할 수 있다고 설명했다.

큐레이터 노트

원문에 없는 맥락입니다

그동안 에이전트 평가가 최종 응답의 그럴듯함만 봤다면, 이 지표는 스킬 선택과 지시 이행 과정을 단계별로 분리해 어느 지점에서 실패했는지 짚어낼 수 있게 한다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

OpenAI, 메타 Muse 대항마 'Dots' 출시
The Verge AI · 2026-09-29

OpenAI가 데브데이 키노트에서 상시 작동형 AI 비서 'Dots'를 발표했다. 메타의 Muse에 대응하는 제품으로, 귀엽고 커스터마이징 가능한 아바타로 표현된다. GPT-6 Astra 모델이 구동하며, 자체 클라우드 컴퓨터로 웹 브라우저와 다수의 지원 앱에 접근해 백그라운드에서 작업…

소비자용 에이전트 인스팅트, 한 달 만에 몸값 4배
AI타임스 · 2026-09-29

AI 에이전트 스타트업 인스팅트가 10억달러 규모의 시리즈 C 투자를 유치해 기업가치 100억달러를 기록했다고 28일(현지시간) 발표했다. 이는 한 달 전 평가받은 25억달러에서 네 배 뛴 수치다. 이번 투자에는 세쿼이아 캐피털, 벤치마크 캐피털, 코튜 등이 참여했다. 2025년 설립된…

마누스, 차세대 에이전트 '마누스 2.0'과 '큐' 출시
AI타임스 · 2026-09-29

마누스가 9월 28일 차세대 다목적 AI 에이전트 '마누스 2.0'과 개인용 에이전트 생성·배포 앱 '큐(Cue)'를 출시했다. 이번 발표는 단순 모델 업그레이드가 아니라 새로운 에이전트 아키텍처와 제품군을 선보이는 대규모 개편이라고 밝혔다. 마누스 2.0은 작업 속도와 자율성 향상에 …

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
평가
AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →