모델 817건 · 국산 131 · 가격 654 추적 중
MLOps·개발도구

SageMaker AI, 2026년 추론 신기능 13종 공개

AWS ML Blog·2026-09-18영문 원문

요약

아마존 SageMaker AI가 2026년 들어 관리형 엔드포인트와 HyperPod Inference 두 경로에 걸쳐 13개의 신규 추론 기능을 공개했다. 관리형 엔드포인트에는 인스턴스 추천 자동화, 용량 부족 시 자동 대체 인스턴스 풀, OpenAI 호환 API 지원 등이 포함된다. 인스턴스 추천 기능은 모델과 비용·지연·처리량 목표를 지정하면 인스턴스 유형 선정부터 벤치마킹까지 자동 수행해, 기존에 수 주가 걸리던 수작업 벤치마킹 과정을 대체한다고 설명했다. AWS가 공개한 시연 사례에서는 처리량 최적화를 적용한 GPT-OSS-20B 모델이 동일 요청 지연 시간에서 초당 토큰 처리량이 2배로 늘었다. OpenAI SDK나 LangChain 기반 애플리케이션은 엔드포인트 URL만 바꾸면 SageMaker로 이전할 수 있게 됐다.

큐레이터 노트

원문에 없는 맥락입니다

용량 부족 시 자동 대체 인스턴스나 OpenAI 호환 API 지원은 그동안 각 팀이 직접 구축하던 운영·이식성 도구를 클라우드 제공사가 표준 기능으로 흡수하는 흐름을 보여준다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

AWS, 데이터센터 반발에 지역투자 1조3500억원 추가
AI타임스 · 2026-10-03

AWS가 데이터센터 건설을 둘러싼 지역 주민들의 반발과 정치권 압박에 대응해 5년간 10억달러(약 1조3500억원) 이상을 지역사회에 추가 투자하겠다고 발표했다. 아울러 지자체와 맺던 비밀유지계약(NDA)도 완전히 폐지하기로 했다. 맷 가먼 AWS CEO는 2일 기고문을 통해 국가 차원…

아마존, 데이터센터 반대 지역사회에 경고 블로그 게시
The Verge AI · 2026-10-02

아마존웹서비스(AWS) CEO 맷 가먼이 3,000단어가 넘는 블로그를 통해 지역사회의 데이터센터 반대 움직임에 우려를 표했다. 그는 일자리, 전력 수요, 환경에 대한 질문은 중요하지만 소셜미디어와 24시간 뉴스 환경에서 잘못된 정보와 거짓말도 빠르게 퍼지고 있다고 주장했다. 가먼은 미…

오픈AI·AWS도 가세, '디시전 AI' 경쟁 점화
바이라인네트워크 · 2026-10-02

판단형 AI 모델 '제브(Jev)'가 등장한 지 2주 만에 경쟁 모델이 잇따라 나오고 있다. 자연어 토큰을 생성하는 대신 판단의 정확성 확률만 계산하는 방식으로, AI 에이전트 환경에서 LLM보다 효율적이라는 아이디어를 공유한다. 이는 LLM이 맡아온 '판단' 기능을 별도의 모델 계층으…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
지연 시간
요청을 보낸 시점부터 응답을 받기까지 걸리는 시간을 말한다.
API
API는 서로 다른 소프트웨어가 기능이나 데이터를 주고받을 수 있도록 정해 놓은 규칙과 창구를 말한다.
처리량
처리량은 시스템이 일정 시간 동안 처리할 수 있는 요청 수나 생성 토큰 수를 나타내는 지표를 말한다.
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →