모델 801건 · 국산 131 · 가격 643 추적 중
MLOps·개발도구

AWS 세이지메이커, 프리픽스 인식 라우팅 도입

AWS ML Blog·2026-09-10영문 원문

요약

AWS가 Amazon SageMaker Inference에 '프리픽스 인식 라우팅'이라는 새 라우팅 전략을 도입했다. 여러 인스턴스에 요청이 무작위로 분산되면 프롬프트의 동일한 앞부분(고정 지시문 등)이 매번 다른 인스턴스로 가면서 KV 캐시가 재사용되지 못하던 문제를 해결하기 위해, 같은 시작 부분을 가진 요청을 같은 인스턴스로 보내 캐시를 유지시킨다. AWS 자체 벤치마크(Llama 3.1 70B, vLLM 사용)에 따르면 P50 TTFT가 최대 77% 감소하고 처리량은 최대 16% 증가했으며, KV 캐시 적중률은 약 25%에서 80% 이상으로 올라갔다. 과부하 인스턴스로의 쏠림을 막는 보호장치와 스케일링 시 캐시 무효화를 최소화하는 안정성 기능도 함께 제공된다.

큐레이터 노트

원문에 없는 맥락입니다

AWS는 공유되는 프리픽스가 길수록, 즉 긴 컨텍스트를 반복 사용하는 워크로드일수록 효과가 크다고 밝혔다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

삼성 관계사 6곳, AWS 전 CEO의 AI 인프라 기업 헬릭스에 투자
CIO Korea · 2026-09-29

2026년 6월 출범한 헬릭스는 데이터센터 개발·운영부터 발전·송배전·광통신망까지 AI 인프라를 통합 제공하는 기업으로, 아마존웹서비스(AWS) 전 CEO 아담 셀립스키가 이끌고 있다. 삼성전자, 삼성물산 건설부문, 삼성SDS, 삼성SDI 등 삼성 관계사 6곳이 KKR, 엔비디아, 미국…

AWS, 수요 못 채워 2200억 달러 데이터센터 투자
테크42 · 2026-09-29

AWS CEO 앤디 재시는 실적발표에서 2026년과 2027년에도 컴퓨팅 수요를 다 채우지 못할 것이라고 밝혔다. AWS는 2026년 2분기 기준 4960억 달러 수주잔고를 안고 있으며, 이를 처리하기 위해 2200억 달러를 데이터센터 인프라에 투입한다고 밝혔다. 루이지애나 한 곳에만 …

쿠팡, AI 클라우드 서비스 해외로 확장
전자신문 SW · 2026-09-27

쿠팡이 국내에서 운영하던 AI 클라우드 컴퓨팅 서비스 '쿠팡 인텔리전트 클라우드(CIC)'를 아시아·태평양(APAC)과 미국 등 해외로 확대하는 작업에 들어갔다. 이는 이커머스 사업을 위해 축적한 IT 인프라를 외부 사업으로 키운 아마존웹서비스(AWS)의 성장 전략과 유사하다는 평가다.…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
KV 캐시
트랜스포머 기반 언어 모델이 토큰을 하나씩 생성할 때 이미 계산한 어텐션의 키(Key)와 값(Value) 벡터를 저장해 두었다가 다음 토큰 생성 시 재사용함으로써 중복 계산을 없애는 추론 최적화 기법을 말한다.
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
프롬프트
AI 모델에게 원하는 작업을 지시하기 위해 입력하는 텍스트를 말한다.
처리량
처리량은 시스템이 일정 시간 동안 처리할 수 있는 요청 수나 생성 토큰 수를 나타내는 지표를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AWS ML Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →