AWS, 멀티턴 에이전트 평가 지표 AEM 공개
요약
AWS ML Blog가 멀티턴 대화형 AI 에이전트의 정확성을 턴 단위로 측정하는 평가 지표 AEM(Agent Evaluation Metric)을 소개했다. 기존 평가 방식은 작업 전체 완료 여부나 응답 단위로만 품질을 채점해, 초기 턴의 오류가 이후 턴으로 전파돼도 어느 턴이 원인인지 구분하지 못하는 한계가 있었다는 것이다. AEM은 정확성을 '진실성'(값이 사실과 일치하는지)과 '완전성'(필요한 요소가 모두 포함됐는지) 두 하위 지표로 분해해 각 턴마다 독립적으로 측정한 뒤 종합한다. 이 방식은 도구 호출의 파라미터와 자연어 응답 모두에 동일하게 적용되며, 추후 안전성이나 지시 유지 등 다른 평가 차원으로도 확장 가능하도록 설계됐다.
큐레이터 노트
원문에 없는 맥락입니다
다른 매체는 이렇게 썼다
같은 사안을 다룬 다른 곳의 보도입니다
OpenAI가 데브데이 키노트에서 상시 작동형 AI 비서 'Dots'를 발표했다. 메타의 Muse에 대응하는 제품으로, 귀엽고 커스터마이징 가능한 아바타로 표현된다. GPT-6 Astra 모델이 구동하며, 자체 클라우드 컴퓨터로 웹 브라우저와 다수의 지원 앱에 접근해 백그라운드에서 작업…
AI 에이전트 스타트업 인스팅트가 10억달러 규모의 시리즈 C 투자를 유치해 기업가치 100억달러를 기록했다고 28일(현지시간) 발표했다. 이는 한 달 전 평가받은 25억달러에서 네 배 뛴 수치다. 이번 투자에는 세쿼이아 캐피털, 벤치마크 캐피털, 코튜 등이 참여했다. 2025년 설립된…
마누스가 9월 28일 차세대 다목적 AI 에이전트 '마누스 2.0'과 개인용 에이전트 생성·배포 앱 '큐(Cue)'를 출시했다. 이번 발표는 단순 모델 업그레이드가 아니라 새로운 에이전트 아키텍처와 제품군을 선보이는 대규모 개편이라고 밝혔다. 마누스 2.0은 작업 속도와 자율성 향상에 …
이 사안의 흐름
같은 주제를 다룬 이 사이트의 기록 — 최신순
- 2026-09-29AWS, Amazon Quick 컴포넌트별 프롬프트 작성법 공개AWS ML Blog
- 2026-09-25AWS, Bedrock 기반 LLM 답변 품질보증 5가지 기법 공개AWS ML Blog
- 2026-09-23AWS, 오픈소스 AI 에이전트 실행환경 '스트랜즈 하네스' 공개AI타임스
- 2026-09-23AWS, 오픈소스 AI 에이전트 실행환경 '스트랜즈 하네스' 공개ZDNet Korea
- 2026-09-18AWS, 멀티모델 헬스케어 AI 에이전트 AgentCore로 이전AWS ML Blog
- 2026-09-18AWS, 새 AgentCore 런타임 공개…메모리 회수·콜드스타트 개선AWS ML Blog
이 글에 나온 말
이 분야 브리핑
여러 매체가 함께 다룬 사안을 한 번에
- 국내 기업들, AI 전환·협력 잇따라기사 10건
이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.
같은 분야의 다른 소식
- OpenAI, Codex에 재사용 가능한 클라우드 개발 환경 추가TechCrunch AI · 2026-09-29
- AWS, 아마존 퀵 프롬프트 엔지니어링 가이드 공개AWS ML Blog · 2026-09-29
- 라이너, 1100개 도구 연결하는 액션즈 MCP 출시IT조선 · 2026-09-29
- 데이터도 AI가 찾는다··· 기업들의 AI 데이터 수명주기 관리CIO Korea · 2026-09-29
- HCL소프트웨어, 금융테크컨퍼런스서 AI 자산관리 소개전자신문 SW · 2026-09-29
- 엑스로그·비욘드에스앤씨, 무중단 DB 이관·동기화 협력블로터 · 2026-09-28