모델 803건 · 국산 131 · 가격 645 추적 중
MLOps·개발도구

AWS, EKS서 NVRx로 장애 허용 분산 학습 구현

AWS ML Blog·2026-09-16영문 원문

요약

AWS가 Amazon EKS 환경에서 NVIDIA Resiliency Extension(NVRx)을 PyTorch FSDP 학습에 통합해 장애 허용 분산 학습을 구현하는 방법을 블로그로 공개했다. 비동기 체크포인트로 I/O와 학습을 병행하고, 인프로세스 재시작으로 컨테이너를 건드리지 않고 소프트 장애를 복구하며, ft_launcher로 하드 크래시 시 워커를 자동 재생성하는 3단계 복구 계층을 소개했다. 동기 체크포인트가 전체 대기 시간의 최대 40%를 차지했다고 설명했다. p5.48xlarge H100 GPU 노드와 Amazon FSx for Lustre 공유 스토리지를 활용해 2~8노드 규모에서 벤치마크를 수행했다.

큐레이터 노트

원문에 없는 맥락입니다

대규모 분산 학습에서는 장애가 통계적으로 불가피하다는 전제 아래, 체크포인트 I/O 대기와 복구 시간을 줄이는 것이 GPU 시간 낭비를 막는 실질적 방법이라는 점을 보여주는 기술 사례다.

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
학습
학습은 모델이 데이터를 반복적으로 살펴보며 예측 오차를 줄이는 방향으로 내부 파라미터를 조정해 나가는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →