모델 816건 · 국산 131 · 가격 654 추적 중
MLOps·개발도구

AWS, SageMaker AI 멀티턴 RL로 검색 에이전트 파인튜닝 소개

AWS ML Blog·2026-10-02영문 원문

요약

AWS는 SageMaker AI의 멀티턴 강화학습(MTRL) 기능을 활용해 검색 에이전트용 Qwen3.6-27B 모델을 파인튜닝한 사례를 소개했다. 지도 미세조정(SFT)이나 단일 턴 RL(RLVR)은 검색 에이전트처럼 여러 턴에 걸친 의사결정 의존성을 반영하지 못하는 한계가 있다고 설명한다. MTRL은 에이전트가 BM25 키워드 검색과 벡터 검색 도구 중 상황에 맞는 것을 선택하도록 전체 대화 턴에 대해 보상을 부여해 학습한다. SageMaker AI MTRL은 모듈형 에이전트-환경 인터페이스, 서버리스 실행, 비동기 롤아웃, PPO·CISPO 등 알고리즘 라이브러리, MLflow 기반 트래젝토리 관찰 기능을 제공하며, FRAMES·BRIGHT·Enterprise RAG 데이터셋으로 학습이 이뤄졌다.

큐레이터 노트

원문에 없는 맥락입니다

검색 에이전트처럼 여러 단계에 걸쳐 도구를 선택해야 하는 작업은 한 번의 응답만 평가하는 기존 RL 방식으로는 다루기 어려웠는데, 턴 전체를 묶어 보상을 주는 방식으로 이를 보완하려는 시도다.

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
파인튜닝
사전 학습된 대규모 언어 모델을 특정 작업이나 도메인의 데이터로 추가 학습시켜 성능과 응답 방식을 맞춤화하는 과정을 말한다.
학습
학습은 모델이 데이터를 반복적으로 살펴보며 예측 오차를 줄이는 방향으로 내부 파라미터를 조정해 나가는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →