AWS, EKS·EFA·DeepEP로 MoE 강화학습 처리량 40% 향상
요약
AWS는 믹스처 오브 엑스퍼트(MoE) 모델을 RLHF나 GRPO로 대규모 강화학습 후속 학습할 때 나타나는 통신 병목 문제를 다뤘다. Amazon EKS와 Elastic Fabric Adapter(EFA), DeepEP를 결합해 전문가 병렬화(Expert Parallelism)의 동적 올투올 토큰 라우팅 통신을 최적화하는 아키텍처를 제시했으며, AWS는 이 구성으로 처리량이 40% 향상됐다고 밝혔다. 대규모 비동기 RL 학습에서는 롤아웃 생성과 정책 학습 간 속도 불균형, 가속기의 컴퓨트·메모리·네트워크 대역폭 부담, 단일 인스턴스를 넘어설 때 노드 내 NVLink에서 노드 간 저대역폭 링크로 통신이 옮겨가는 문제가 동시에 발생한다고 설명했다.
큐레이터 노트
원문에 없는 맥락입니다
다른 매체는 이렇게 썼다
같은 사안을 다룬 다른 곳의 보도입니다
국내 스타트업 비드래프트는 자사 추론 모델 '다윈-180B-RSI'가 허깅페이스 공인 벤치마크 5개 리더보드에서 모두 1위를 차지했다고 9월 28일 밝혔다. 이 모델은 사람의 개입 없이 모델 스스로 풀이를 검증하고 재학습하는 '재귀적 자기개선(RSI)' 기술을 핵심으로 한다. 회사 측은…
스위스 ETH 취리히 소프트 로보틱스 연구진이 손가락을 다리처럼 사용해 스스로 이동하는 로봇 손을 개발했다고 IT매체 기즈모도가 보도했다. 5개 손가락과 20개 관절을 갖춘 인간 오른손 형태로 제작됐으며, 배터리·센서·컴퓨팅 하드웨어가 담긴 온보드 모듈을 탑재해 외부 자원 없이 자율 동…
중국 스텝펀이 에이전트 작업, 코딩, 전문 지식 업무, 금융 분석에 특화한 차세대 플래그십 모델 '스텝 5 프리뷰'를 9월 20일(현지시간) 공개했다. 희소 전문가 혼합(MoE) 구조를 적용해 높은 지능 수준을 유지하면서도 작업 비용을 낮추는 것을 목표로 개발됐다고 밝혔다. 시각적 멀티…
이 사안의 흐름
같은 주제를 다룬 이 사이트의 기록 — 최신순
- 2026-09-25AWS, SkyRL로 SageMaker HyperPod서 멀티모달 RL 학습 시연AWS ML Blog
- 2026-09-21샤오미, AI 모델 강화학습 훈련 과정 실시간 생중계AI타임스
- 2026-09-17피어리오딕 랩스, 재료과학 특화 AI '네온' 공개AI타임스
- 2026-09-16AWS, EKS서 NVRx로 장애 허용 분산 학습 구현AWS ML Blog
- 2026-09-09AWS, Qwen3.8-2.4T-A95B SageMaker HyperPod 배포 가이드 공개AWS ML Blog
이 글에 나온 말
이 분야 브리핑
여러 매체가 함께 다룬 사안을 한 번에
- HBM 이후 AI 메모리 지도가 넓어진다기사 14건
- AI 정책, 각국서 속도전과 이견 교차기사 6건
이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.
같은 분야의 다른 소식
- 심텍, SK하이닉스 우수협력사 선정…AI 기판 경쟁력 인정블로터 · 2026-09-29
- KAIST, 시간차 인식하는 AI 반도체 개발AI타임스 · 2026-09-29
- 스페이스X 스타십, 첫 지구 궤도 진입 성공AI타임스 · 2026-09-29
- 가온전선, 美 자회사 LSCUS로 AI 전력망 공급 확대블로터 · 2026-09-29
- AI를 비용 아닌 자산으로 만드는 법MIT Tech Review · 2026-09-29
- 삼성, KKR 산하 AI 인프라 기업 헬릭스에 10억 달러 투자블로터 · 2026-09-29