모델 803건 · 국산 131 · 가격 645 추적 중
MLOps·개발도구

SageMaker 하이퍼팟, 모델 캐싱으로 콜드스타트 단축

AWS ML Blog·2026-09-10영문 원문

요약

AWS가 아마존 세이지메이커 하이퍼팟의 추론 배포 시 발생하는 콜드스타트 지연을 줄이는 모델 캐싱 기능을 발표했다. 기존에는 컨테이너 이미지를 아마존 ECR에서, 모델 가중치를 S3나 FSx for Lustre, 허깅페이스 허브 등에서 순차적으로 내려받아야 해 DeepSeek-R1 같은 대형 모델은 준비까지 30분 이상 걸렸다. 모델 캐싱은 가중치와 컨테이너 이미지를 노드의 로컬 NVMe 스토리지에 미리 적재해 초당 약 7GB 속도로 읽도록 하며, 이를 통해 파드가 수 초 안에 트래픽을 처리할 수 있다. 캐시가 준비되지 않은 노드에 파드가 배치되더라도 기존 방식대로 원본 소스에서 내려받아 장애 없이 동작한다.

큐레이터 노트

원문에 없는 맥락입니다

오토스케일링 시 신규 파드마다 반복되던 다운로드 지연을 없애, 트래픽 급증에 실제로 대응하는 속도를 끌어올리는 인프라 개선이다.

이 기사에 나온 모델

단가는 이 사이트 카탈로그에서 매일 확인한 값입니다 · USD / 1M 토큰

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

삼성 관계사 6곳, AWS 전 CEO의 AI 인프라 기업 헬릭스에 투자
CIO Korea · 2026-09-29

2026년 6월 출범한 헬릭스는 데이터센터 개발·운영부터 발전·송배전·광통신망까지 AI 인프라를 통합 제공하는 기업으로, 아마존웹서비스(AWS) 전 CEO 아담 셀립스키가 이끌고 있다. 삼성전자, 삼성물산 건설부문, 삼성SDS, 삼성SDI 등 삼성 관계사 6곳이 KKR, 엔비디아, 미국…

AWS, 수요 못 채워 2200억 달러 데이터센터 투자
테크42 · 2026-09-29

AWS CEO 앤디 재시는 실적발표에서 2026년과 2027년에도 컴퓨팅 수요를 다 채우지 못할 것이라고 밝혔다. AWS는 2026년 2분기 기준 4960억 달러 수주잔고를 안고 있으며, 이를 처리하기 위해 2200억 달러를 데이터센터 인프라에 투입한다고 밝혔다. 루이지애나 한 곳에만 …

쿠팡, AI 클라우드 서비스 해외로 확장
전자신문 SW · 2026-09-27

쿠팡이 국내에서 운영하던 AI 클라우드 컴퓨팅 서비스 '쿠팡 인텔리전트 클라우드(CIC)'를 아시아·태평양(APAC)과 미국 등 해외로 확대하는 작업에 들어갔다. 이는 이커머스 사업을 위해 축적한 IT 인프라를 외부 사업으로 키운 아마존웹서비스(AWS)의 성장 전략과 유사하다는 평가다.…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →