모델 801건 · 국산 131 · 가격 643 추적 중
MLOps·개발도구

AWS, SkyRL로 SageMaker HyperPod서 멀티모달 RL 학습 시연

AWS ML Blog·2026-09-25영문 원문

요약

AWS는 오픈소스 강화학습 프레임워크 SkyRL을 Amazon SageMaker HyperPod에서 활용해 Qwen3-VL-8B 비전-언어 모델이 시각적 미로를 탐색하도록 GRPO(Group Relative Policy Optimization) 기법으로 학습시키는 방법을 소개했다. HyperPod은 노드 장애를 자동으로 감지·교체하는 클러스터 복원력 기능과 체크포인트 기능을 제공해 다중 노드 RL 훈련이 중단 없이 이어지도록 돕는다. AWS에 따르면 VisGym SFT 체크포인트에서 시작해 GRPO 후속 학습을 거친 결과, 고정된 64개 미로 평가셋에서 미로 해결률이 43.75%에서 95% 이상으로 향상됐다. 학습은 GPU 워커 노드 3대와 CPU 헤드 노드 1대로 구성된 Ray 클러스터에서 진행됐으며, vLLM 추론 엔진과 FSDP로 샤딩된 정책 모델이 동일 GPU에서 함께 동작한다.

큐레이터 노트

원문에 없는 맥락입니다

미로 해결률 수치는 AWS가 자체 측정한 결과이며 원문에 별도의 독립 검증은 언급되지 않았다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

손가락으로 걷는 자율 로봇 손 개발
ZDNet Korea · 2026-09-26

스위스 ETH 취리히 소프트 로보틱스 연구진이 손가락을 다리처럼 사용해 스스로 이동하는 로봇 손을 개발했다고 IT매체 기즈모도가 보도했다. 5개 손가락과 20개 관절을 갖춘 인간 오른손 형태로 제작됐으며, 배터리·센서·컴퓨팅 하드웨어가 담긴 온보드 모듈을 탑재해 외부 자원 없이 자율 동…

샤오미, AI 모델 강화학습 훈련 과정 실시간 생중계
AI타임스 · 2026-09-21

샤오미 AI 대형모델팀이 차세대 모델 '미모(MiMo)-V2.6'의 강화학습(RL) 사후훈련 과정을 실시간으로 볼 수 있는 대시보드를 9월 15일 공개했다. 대시보드에는 '미모-V2.6 프로'와 '미모-V2.6 플래시' 두 모델이 강화학습을 거치며 점수를 높여가는 과정이 실시간으로 표시…

피어리오딕 랩스, 재료과학 특화 AI '네온' 공개
AI타임스 · 2026-09-17

오픈AI 출신 리암 페더스가 설립한 피어리오딕 랩스가 9월 15일(현지시간) 재료과학 연구에 특화한 AI 모델 '네온'을 공개했다. 네온은 대형언어모델의 추론 능력과 강화학습, 과학 도구 실행을 결합해 신소재 탐색 속도를 높이는 것을 목표로 한다. 회사는 모델 자체뿐 아니라 장시간 추론…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
멀티모달
텍스트뿐 아니라 이미지, 음성, 영상 등 여러 종류의 데이터를 함께 이해하거나 생성할 수 있는 AI 모델의 특성을 말한다.
학습
학습은 모델이 데이터를 반복적으로 살펴보며 예측 오차를 줄이는 방향으로 내부 파라미터를 조정해 나가는 과정을 말한다.
평가
AI 모델이나 시스템의 출력이 원하는 기준에 얼마나 부합하는지를 정량적·정성적으로 측정하는 절차를 말한다.
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →