모델 801건 · 국산 131 · 가격 643 추적 중
MLOps·개발도구

SageMaker AI, 2026년 추론 신기능 13종 공개

AWS ML Blog·2026-09-18영문 원문

요약

아마존 SageMaker AI가 2026년 들어 관리형 엔드포인트와 HyperPod Inference 두 경로에 걸쳐 13개의 신규 추론 기능을 공개했다. 관리형 엔드포인트에는 인스턴스 추천 자동화, 용량 부족 시 자동 대체 인스턴스 풀, OpenAI 호환 API 지원 등이 포함된다. 인스턴스 추천 기능은 모델과 비용·지연·처리량 목표를 지정하면 인스턴스 유형 선정부터 벤치마킹까지 자동 수행해, 기존에 수 주가 걸리던 수작업 벤치마킹 과정을 대체한다고 설명했다. AWS가 공개한 시연 사례에서는 처리량 최적화를 적용한 GPT-OSS-20B 모델이 동일 요청 지연 시간에서 초당 토큰 처리량이 2배로 늘었다. OpenAI SDK나 LangChain 기반 애플리케이션은 엔드포인트 URL만 바꾸면 SageMaker로 이전할 수 있게 됐다.

큐레이터 노트

원문에 없는 맥락입니다

용량 부족 시 자동 대체 인스턴스나 OpenAI 호환 API 지원은 그동안 각 팀이 직접 구축하던 운영·이식성 도구를 클라우드 제공사가 표준 기능으로 흡수하는 흐름을 보여준다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

삼성 관계사 6곳, AWS 전 CEO의 AI 인프라 기업 헬릭스에 투자
CIO Korea · 2026-09-29

2026년 6월 출범한 헬릭스는 데이터센터 개발·운영부터 발전·송배전·광통신망까지 AI 인프라를 통합 제공하는 기업으로, 아마존웹서비스(AWS) 전 CEO 아담 셀립스키가 이끌고 있다. 삼성전자, 삼성물산 건설부문, 삼성SDS, 삼성SDI 등 삼성 관계사 6곳이 KKR, 엔비디아, 미국…

AWS, 수요 못 채워 2200억 달러 데이터센터 투자
테크42 · 2026-09-29

AWS CEO 앤디 재시는 실적발표에서 2026년과 2027년에도 컴퓨팅 수요를 다 채우지 못할 것이라고 밝혔다. AWS는 2026년 2분기 기준 4960억 달러 수주잔고를 안고 있으며, 이를 처리하기 위해 2200억 달러를 데이터센터 인프라에 투입한다고 밝혔다. 루이지애나 한 곳에만 …

쿠팡, AI 클라우드 서비스 해외로 확장
전자신문 SW · 2026-09-27

쿠팡이 국내에서 운영하던 AI 클라우드 컴퓨팅 서비스 '쿠팡 인텔리전트 클라우드(CIC)'를 아시아·태평양(APAC)과 미국 등 해외로 확대하는 작업에 들어갔다. 이는 이커머스 사업을 위해 축적한 IT 인프라를 외부 사업으로 키운 아마존웹서비스(AWS)의 성장 전략과 유사하다는 평가다.…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
지연 시간
요청을 보낸 시점부터 응답을 받기까지 걸리는 시간을 말한다.
API
API는 서로 다른 소프트웨어가 기능이나 데이터를 주고받을 수 있도록 정해 놓은 규칙과 창구를 말한다.
처리량
처리량은 시스템이 일정 시간 동안 처리할 수 있는 요청 수나 생성 토큰 수를 나타내는 지표를 말한다.
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →