모델 801건 · 국산 131 · 가격 643 추적 중
뉴스

AWS ML Blog

검증된 피드 11개에서 자동 수집하고, AI 요약이 코드 게이트를 통과한 것만 게시합니다. 게이트는 카탈로그에 없는 모델명·원문에 없는 수치·상대 시점 표현을 막습니다.

게시3067
보류810
매체34곳
중복 병합81

AWS ML Blog 60건 · 필터 해제

xAI Grok 4.7, 아마존 베드락에 출시

AWS ML Blog·2026-09-28파운데이션 모델·LLM

xAI의 프런티어 모델 Grok 4.7이 아마존 베드락에 추가됐다. xAI는 이 모델이 코딩과 지식노동에서 자사 최고 성능을 낸다며, 어려운 과제를 더 오래 수행하고 결과를 스스로 검증하도록 설계했다고 밝혔다. 베드락에서는 리전 간 추론 프로필로 제공되며 Responses·Chat Completions·Converse API를 지원한다. 독립 평가기관 Artificial Analysis는 자체 평가 결과 Grok 4.7의 지능 지수와 코딩 에이전트 지수가 전작 Grok 4.6 대비 상승했다고 밝혔다. xAI는 새로운 안전장치 체계를 적용해 사이버보안 등 이중용도 영역에서 위험한 요청은 걸러내면서도 정당한 보안 작업은 차단하지 않도록 했다고 설명했다.

#Grok #xAI #Amazon Bedrock #AI 에이전트 #독립평가

AWS, Amazon Bedrock에 Claude Sonnet 5.5 출시

AWS ML Blog·2026-09-28파운데이션 모델·LLM

AWS는 Anthropic의 Claude Sonnet 5.5를 Amazon Bedrock과 AWS의 Claude Platform에서 제공한다고 밝혔다. Sonnet 5.5는 코딩과 지식노동에 특화된 모델로, IAM·CloudTrail·CloudWatch·Bedrock Guardrails 등 AWS의 기존 관리 도구와 함께 사용할 수 있으며 사용량은 AWS 청구서에 반영된다. AWS는 판단이 필요한 작업은 Opus 5.5, 방향이 이미 정해진 실행 작업은 Sonnet 5.5로 나눠 쓰는 방식을 제안했다. Sonnet 5.5는 글로벌 CRIS 추론 프로필을 통해 북미 등 일부 AWS 리전에서 이용 가능하다.

#Claude Sonnet 5.5 #Amazon Bedrock #AWS #Claude Opus 5.5 #Anthropic

AWS, SageMaker AI서 vLLM-Omni로 실시간 음성 스트리밍 구현 튜토리얼 공개

AWS ML Blog·2026-09-28MLOps·개발도구

AWS ML 블로그가 Amazon SageMaker AI에 vLLM-Omni 딥러닝 컨테이너(DLC)를 활용해 Qwen3-TTS 모델을 배포하는 방법을 다룬 시리즈 1편을 공개했다. 이 구성은 텍스트를 입력하고 오디오를 출력하는 양방향 지속 연결(HTTP/2 웹소켓)을 통해 응답 생성이 끝나기 전에 음성 재생을 시작할 수 있게 한다. Gradio 애플리케이션으로 워크플로를 시연했으며, 앞서 공개된 Voxtral-Mini-4B Realtime 기반 음성 인식(STT) 튜토리얼과 짝을 이뤄 음성 파이프라인의 출력 측을 담당한다. 2편에서는 같은 vLLM-Omni DLC를 이미지·비디오 생성에 적용할 예정이다.

#SageMaker AI #vLLM-Omni #Qwen3-TTS #음성 스트리밍 #AWS

AWS, SageMaker AI로 이미지·영상 생성 배포 가이드 공개

AWS ML Blog·2026-09-28MLOps·개발도구

AWS는 SageMaker AI에서 AWS vLLM-Omni 딥러닝 컨테이너를 사용해 텍스트 프롬프트로 이미지를 생성하고 이를 짧은 영상으로 변환하는 방법을 소개했다. 이미지 생성에는 FLUX.2-klein 모델을 실시간 엔드포인트로, 영상 생성에는 Wan2.1-VACE 모델을 비동기 엔드포인트로 각각 배포한다. 생성된 이미지는 Amazon S3를 거쳐 영상 모델로 전달되고, 완성된 MP4 파일도 S3에 저장된다. 명령줄 워크플로와 Streamlit 인터페이스를 포함한 샘플 코드가 GitHub 저장소로 공개됐다.

#AWS #SageMaker AI #vLLM-Omni #이미지생성 #영상생성 사진 Kelly Sikkema / Unsplash

AWS, Textract 어댑터 계정 간 자동 관리 방법 공개

AWS ML Blog·2026-09-28MLOps·개발도구

AWS ML 블로그가 Amazon Textract Custom Queries 어댑터를 훈련 환경에서 프로덕션 환경으로 계정 간 승격 관리하는 방법을 소개했다. 어댑터 ID를 AWS Systems Manager Parameter Store에 분리해 저장하면 애플리케이션 재배포 없이 프로덕션 참조를 업데이트할 수 있다. 문서 사전분류, 어댑터 선택, Textract 처리, 결과 전달로 이어지는 다단계 파이프라인 구조와 CloudFormation·Terraform 인프라 템플릿, PrivateLink·IAM·CloudTrail 기반 프로덕션 보안 구성도 함께 제공됐다.

#AmazonTextract #AWS #문서처리자동화 #MLOps #인프라템플릿

AWS, EKS·EFA·DeepEP로 MoE 강화학습 처리량 40% 향상

AWS ML Blog·2026-09-25AI 인프라·반도체

AWS는 믹스처 오브 엑스퍼트(MoE) 모델을 RLHF나 GRPO로 대규모 강화학습 후속 학습할 때 나타나는 통신 병목 문제를 다뤘다. Amazon EKS와 Elastic Fabric Adapter(EFA), DeepEP를 결합해 전문가 병렬화(Expert Parallelism)의 동적 올투올 토큰 라우팅 통신을 최적화하는 아키텍처를 제시했으며, AWS는 이 구성으로 처리량이 40% 향상됐다고 밝혔다. 대규모 비동기 RL 학습에서는 롤아웃 생성과 정책 학습 간 속도 불균형, 가속기의 컴퓨트·메모리·네트워크 대역폭 부담, 단일 인스턴스를 넘어설 때 노드 내 NVLink에서 노드 간 저대역폭 링크로 통신이 옮겨가는 문제가 동시에 발생한다고 설명했다.

#MoE #강화학습 #Amazon EKS #EFA #DeepEP

AWS, SkyRL로 SageMaker HyperPod서 멀티모달 RL 학습 시연

AWS ML Blog·2026-09-25MLOps·개발도구

AWS는 오픈소스 강화학습 프레임워크 SkyRL을 Amazon SageMaker HyperPod에서 활용해 Qwen3-VL-8B 비전-언어 모델이 시각적 미로를 탐색하도록 GRPO(Group Relative Policy Optimization) 기법으로 학습시키는 방법을 소개했다. HyperPod은 노드 장애를 자동으로 감지·교체하는 클러스터 복원력 기능과 체크포인트 기능을 제공해 다중 노드 RL 훈련이 중단 없이 이어지도록 돕는다. AWS에 따르면 VisGym SFT 체크포인트에서 시작해 GRPO 후속 학습을 거친 결과, 고정된 64개 미로 평가셋에서 미로 해결률이 43.75%에서 95% 이상으로 향상됐다. 학습은 GPU 워커 노드 3대와 CPU 헤드 노드 1대로 구성된 Ray 클러스터에서 진행됐으며, vLLM 추론 엔진과 FSDP로 샤딩된 정책 모델이 동일 GPU에서 함께 동작한다.

#SageMaker HyperPod #SkyRL #GRPO #Qwen3-VL #강화학습

AWS, Bedrock 기반 LLM 답변 품질보증 5가지 기법 공개

AWS ML Blog·2026-09-25MLOps·개발도구

AWS는 자사 블로그에서 4,000명이 넘는 AWS 경영진이 사용하는 대화형 비즈니스 인텔리전스 도구 'NarrateAI'의 실시간 품질보증 기법을 소개했다. 데이터 양에 따라 처리 경로를 나누는 적응형 파이프라인 오케스트레이션, 계정·모델 간 장애 대응(failover), 문단 단위 실시간 스트리밍 검증, 복수 평가기를 병렬로 돌리는 복합 평가 프레임워크, 정확 일치와 의미 검증을 단계적으로 적용하는 데이터 정확도 검증 등 5가지 기법을 결합했다. AWS는 이 시스템이 실시간 스트리밍을 유지하면서 약 99%의 수치 정확도를 달성했다고 밝혔다. Amazon Bedrock AgentCore 플랫폼 위에 구축됐다.

#AWS #Bedrock #LLM 품질보증 #AI 에이전트 #환각 방지

AWS, SageMaker서 Qwen3-TTS 음성 복제 모델 배포 지원

AWS ML Blog·2026-09-25MLOps·개발도구

AWS는 Alibaba Cloud Qwen팀이 공개한 텍스트음성변환 모델 Qwen3-TTS-12Hz-1.7B-Base를 Amazon SageMaker JumpStart를 통해 실시간 추론 엔드포인트로 배포하는 방법을 공개했다. 이 모델은 짧은 참조 음성과 그 대본만으로 재훈련 없이 특정 화자의 음색·억양을 복제해 새 텍스트를 말하게 할 수 있다. 중국어, 영어, 일본어, 한국어 등 10개 언어를 지원하며, 한 언어로 캡처한 음성을 다른 언어로 재생성하는 교차언어 복제도 가능하다. SageMaker AI가 GPU 서버 프로비저닝과 확장을 관리해 사용자는 인프라를 직접 운영하지 않아도 된다.

#Qwen3-TTS #SageMaker #음성복제 #AWS #TTS

SageMaker HyperPod-Qumulo, 리전 간 분산 학습 검증

AWS ML Blog·2026-09-25AI 인프라·반도체

AWS와 Qumulo가 Amazon SageMaker HyperPod와 Qumulo의 Cloud Data Fabric(CDF)을 결합해 학습 데이터와 GPU 컴퓨팅이 서로 다른 AWS 리전에 있어도 데이터 복제 없이 학습을 수행하는 아키텍처를 공개했다. 데이터는 미국 오하이오 리전(허브)에 두고 컴퓨팅은 오리건 리전(스포크)에 배치해 60ms 네트워크 지연 환경에서 동일한 학습 작업을 각각 돌려 처리량을 비교했다. AWS·Qumulo의 자체 검증에 따르면 초기 워밍업 구간이 지나면 원격 리전 클러스터가 데이터와 동일 리전에 있는 클러스터와 같은 수준의 처리량에 도달했으며, 이 워밍업 비중은 배치 수가 늘어날수록 전체 학습 시간에서 미미해진다고 밝혔다. Qumulo의 NeuralCache가 데이터 로더 접근 패턴을 학습해 다음에 필요한 데이터 블록을 미리 로컬 캐시로 가져오는 방식이 핵심이다.

#SageMaker HyperPod #Qumulo #분산학습 #크로스리전 스토리지 #GPU 클러스터

AWS, WhisperX 기반 화자 분리 전사 SageMaker 배포 가이드 공개

AWS ML Blog·2026-09-24MLOps·개발도구

AWS ML 블로그가 오픈소스 WhisperX를 SageMaker AI에 배포하는 방법을 다뤘다. WhisperX는 OpenAI Whisper에 wav2vec2 강제 정렬로 단어 단위 타임스탬프를, 화자 분리 기능으로 '누가 말했는지' 라벨을 추가한다. AWS WhisperX 딥러닝 컨테이너는 GPU 이미지로 제공되며 실시간·비동기 SageMaker 엔드포인트 배포를 지원하고, 출력 형식으로 json, verbose_json, srt, vtt를 제공한다. 짧은 대화형 클립은 실시간 엔드포인트, 긴 오디오나 대량 배치는 비동기 엔드포인트 사용이 권장된다.

#WhisperX #AWS SageMaker #음성인식 #화자분리 #딥러닝컨테이너

AWS, AgentCore Gateway로 멀티계정 AI 에이전트 구축법 공개

AWS ML Blog·2026-09-24AI 에이전트·툴 유즈

AWS가 여러 AWS 계정에 흩어진 데이터를 옮기지 않고도 AI 에이전트가 통합 조회할 수 있는 아키텍처를 블로그에 소개했다. 각 사업부(LOB) 계정은 자체 데이터를 MCP 서버로 노출하고, 중앙 플랫폼 계정의 Amazon Bedrock AgentCore Gateway가 이를 단일 엔드포인트로 통합해 도구 탐색과 호출을 제공한다. 인증은 AgentCore Identity와 Okta의 OAuth 2.0 M2M 자격증명으로 처리되며, Cedar 기반 Policy로 세밀한 접근 제어를 적용한다. 플랫폼 계정은 Amazon Bedrock을 통한 LLM 추론, Guardrails 적용, 비용 추적을 담당해 계정별로 모델 쿼터를 관리하는 부담을 줄인다.

#AgentCore #MCP #AWS #AI에이전트 #Bedrock

HEMA, MCP·베드록으로 사내 AI 어시스턴트 HAL 구축

AWS ML Blog·2026-09-23AI 에이전트·툴 유즈

네덜란드의 100년 역사 소매업체 HEMA는 750개 이상 매장을 운영하며, 엔지니어들이 흩어진 위키·서비스 카탈로그·IT 포털을 오가며 정보를 찾던 '포털 호핑' 문제를 겪어왔다. 이를 해결하기 위해 Model Context Protocol(MCP)과 Amazon Bedrock AgentCore를 활용해 사내 AI 어시스턴트 HAL을 구축했다. HAL은 흩어진 지식을 한 곳에 모으고, MCP를 통해 HAL 챗, Kiro, Claude 등 직원들이 이미 쓰던 도구 안에서 바로 답을 제공한다. 보안은 Microsoft Entra ID 기반이며 클라이언트에는 AWS 자격 증명을 두지 않는다. 회사 측은 과거 서너 개 포털을 오가며 한나절 걸리던 정보 탐색이 이제 IDE나 채팅창 안에서 수초 만에 끝난다고 설명했다.

#MCP #Amazon Bedrock AgentCore #HEMA #사내 AI 어시스턴트 #지식관리

AWS, 자연어로 영상 질의하는 AI 에이전트 솔루션 공개

AWS ML Blog·2026-09-23AI 에이전트·툴 유즈

AWS는 Strands Agents SDK로 만든 AI 에이전트가 Amazon Bedrock, Rekognition, Transcribe를 질문 내용에 따라 선택적으로 호출해, 업로드된 영상에 자연어로 질문하면 답을 얻는 솔루션을 소개했다. 질문 유형마다 별도 파이프라인을 미리 구축하는 대신 에이전트가 실행 시점에 어떤 서비스를 쓸지 판단하며, 이미 분석된 영상은 1초 이내, 새 영상은 5~10분 내 응답이 나온다. AWS 프로페셔널 서비스와 협업한 한 미디어·엔터테인먼트 기업은 200건 이상의 다중 시간 녹화 백로그에서 분석가의 수작업 검토 시간을 약 80% 줄였다고 밝혔는데, 이는 해당 고객사의 자체 전후 비교 결과이며 독립적으로 검증되지는 않았다.

#AWS #에이전틱AI #Amazon Bedrock #영상분석 #Strands Agents

AWS, 오픈웨이트 모델로 코딩 에이전트 구축하는 법 소개

AWS ML Blog·2026-09-23AI 에이전트·툴 유즈

AWS ML 블로그가 오픈소스 터미널 기반 코딩 에이전트 OpenCode를 Amazon Bedrock의 오픈웨이트 모델과 연결해 사용하는 방법을 소개했다. OpenCode는 Go로 개발됐으며 파일 편집, 셸 명령 실행, LSP 기반 프로젝트 구조 분석 기능을 갖추고 75개 이상의 LLM 제공업체와 연동된다. 이 구성을 쓰면 코드와 데이터가 자체 AWS 계정 내에 머무르며, 작업 성격에 따라 Moonshot AI Kimi K3, OpenAI GPT-OSS 120B, NVIDIA Nemotron 3 Super 120B 등 모델을 전환해 사용할 수 있다. 글은 Ethara.AI가 이 구조를 멀티에이전트 오케스트레이션 방식으로 실제 서비스에 적용하고 있다고 소개했으며, McKinsey 보고서를 인용해 조직의 76%가 오픈소스 AI 사용을 늘릴 것으로 예상한다고 전했다.

#OpenCode #Amazon Bedrock #오픈웨이트 모델 #AI 코딩에이전트 #Kimi K3

OpenAI GPT-6 Sol·Luna, 아마존 베드록서 정식 출시

AWS ML Blog·2026-09-22파운데이션 모델·LLM

OpenAI의 GPT-6 Sol과 GPT-6 Luna가 아마존 베드록에서 정식 출시됐다. GPT-6 Sol은 코딩·디버깅·다단계 작업 등 반복적인 고난도 업무에, GPT-6 Luna는 문서 추출·요약·분류 등 대량 반복 작업에 적합하도록 설계됐다. OpenAI의 내부 사실성 평가에 따르면 GPT-6 Sol은 GPT-5.6 Sol 대비 사실 오류가 약 절반 수준으로 줄었다. 두 모델 모두 베드록의 프롬프트 캐싱을 지원하며, IAM 정책·클라우드트레일 감사·PrivateLink VPC 엔드포인트 등 보안·통제 기능과 함께 제공된다.

#GPT-6 #Amazon Bedrock #OpenAI #AWS #프롬프트 캐싱

클로드 오퍼스 5.5, AWS 베드록서 출시

AWS ML Blog·2026-09-22파운데이션 모델·LLM주요

Anthropic의 신규 모델 클로드 오퍼스 5.5가 아마존 베드록과 AWS의 클로드 플랫폼에 출시됐다. 클로드 5.5 모델군 중 첫 모델로, 에이전틱 코딩과 지식 노동, 장시간 실행 작업에 적합하도록 만들어졌다. Anthropic에 따르면 이전 모델인 오퍼스 5보다 적은 토큰으로 더 많은 작업을 처리하며, 작업 중 수행한 일과 발견한 내용, 필요한 사항을 더 명확히 전달하도록 훈련됐다. 별도의 사고 예산 설정 없이 작업에 맞춰 추론량을 스스로 조절하는 적응형 사고 기능이 항상 켜져 있다. 생물학·사이버보안·AI 개발 분야에서 클로드 페이블 5.1과 유사한 안전 분류기가 처음 탑재되어, 이전 오퍼스 모델보다 요청을 거부하는 빈도가 높아졌다.

#Claude Opus 5.5 #Anthropic #AWS #Amazon Bedrock #에이전틱 코딩

AWS, 에이전트 '스킬' 평가하는 전용 지표 공개

AWS ML Blog·2026-09-22AI 에이전트·툴 유즈

AWS가 Strands Evals SDK와 Amazon Bedrock AgentCore Evaluations에 에이전트의 '스킬' 사용을 진단하는 전용 평가지표를 추가했다. 스킬은 SKILL.md 형태로 저장되는 재사용 가능한 도메인별 지침 묶음으로, 에이전트가 필요할 때만 불러와 사용하는 방식이다. 새 지표는 적절한 스킬을 선택했는지 이진 판정하는 Skill Selection Accuracy, 선택한 스킬의 절차를 얼마나 충실히 따랐는지 5단계로 평가하는 Skill Instruction Following, 스킬이 실제로 로드됐는지 확인하는 결정론적 검사 Skill Invoked로 구성된다. AWS는 인사(HR) 어시스턴트 사례를 들어, 잘못된 스킬을 고르는 경우와 올바른 스킬을 고르고도 지시를 일부만 따르는 경우를 구분해 진단할 수 있다고 설명했다.

#Strands Evals #Amazon Bedrock AgentCore #AI 에이전트 #Agent Skills #평가

Reactiv, Bedrock AgentCore로 모바일 커머스 앱 자동 업데이트

AWS ML Blog·2026-09-22AI 에이전트·툴 유즈

Shopify 상점의 네이티브 모바일 앱을 만들어주는 Reactiv가 Amazon Bedrock AgentCore와 Strands Agents SDK를 활용해 'AI 스케줄러'를 구축했다. 상점 운영자가 자연어로 요청하면 감독 에이전트, 분석 에이전트, 빌더 에이전트로 구성된 3개 에이전트 시스템이 일정에 맞춰 홈페이지 구성을 자동으로 갱신한다. AgentCore의 관리형 실행 환경, 세션 간 지속되는 메모리, MCP 서버 연동, 상점별 격리 기능을 활용해 기존에 직접 관리하던 인증 계층과 도구 정의 작업을 줄였다. Reactiv는 이를 통해 상점 운영자의 설정 시간을 80% 줄이고 제품 출시 속도를 33% 앞당겼다고 밝혔다.

#Amazon Bedrock AgentCore #Strands Agents #Shopify #멀티에이전트 #AWS

AWS, SageMaker '동시성 스윕'으로 AI 엔드포인트 용량 산정

AWS ML Blog·2026-09-22MLOps·개발도구

AWS가 Amazon SageMaker AI Inference Recommendations에 내장된 '동시성 스윕' 기능을 소개했다. 엔드포인트에 동시 요청 수를 점진적으로 늘리며 처리량과 지연시간을 측정해, 별도의 부하테스트 인프라 없이 최적의 인스턴스 유형과 서빙 구성을 찾을 수 있다. AWS는 NVIDIA Nemotron-3 Nano 모델을 vLLM 컨테이너로 배포하고 CreateAIBenchmarkJob API로 스윕을 실행하는 과정을 보여줬다. 이 과정을 통해 처리량이 최대화되는 지점, 지연시간이 서비스수준협약(SLA)을 넘는 지점, 피크 트래픽에 필요한 인스턴스 수를 파악할 수 있다.

#SageMaker #vLLM #추론 최적화 #AWS #Nemotron

Trane, Bedrock AgentCore로 빌딩 진단 60배 단축

AWS ML Blog·2026-09-22AI 에이전트·툴 유즈

Trane Technologies가 Amazon Bedrock AgentCore와 Strands 프레임워크로 에이전트형 AI 솔루션을 구축해, 여러 화면을 오가며 20분 걸리던 HVAC 진단 작업을 20초짜리 자연어 대화로 단축했다. 이는 Trane이 수 주간 기술자들과 진행한 내부 벤치마킹 결과이며, 솔루션은 3~4주 만에 개발됐다. 아키텍처는 Resources, Knowledge, Analytics Insights, Expert Advisor, Navigation 등 역할별로 특화된 다중 에이전트 구조로 설계됐고, 중앙 툴 게이트웨이를 통해 Trane Cloud의 실시간 원격 계측 데이터를 통합한다. 이를 통해 기술자, 계정 관리자, 건물주 등 이용자별로 필요한 정보 수준에 맞춘 응답을 제공한다.

#Amazon Bedrock AgentCore #Trane #Strands #멀티에이전트 #HVAC

타타 엘렉시, AWS 기반 실시간 산업안전 플랫폼 IRIS 구축

AWS ML Blog·2026-09-22멀티모달

타타 엘렉시는 공장·창고 등의 CCTV 영상을 실시간 분석해 위험 상황을 감지하는 산업용 컴퓨터비전 플랫폼 IRIS를 AWS 위에 구축했다. 기존에는 사람이 수백 개 카메라를 감시하며 15~45분 걸리던 위험 감지를, AWS IoT Greengrass와 GPU 엣지 서버(예: NVIDIA Jetson AGX Orin)로 카메라 현장에서 1차 분석해 실시간화했다. 안전 관련 프레임만 Amazon S3에 저장하고 메타데이터는 Amazon Kinesis Data Streams로 스트리밍해 원본 영상을 클라우드로 보내지 않는다. 타타 엘렉시의 실제 운영 사례 측정에 따르면 이 방식으로 클라우드에 전송되는 프레임 양이 약 70~80% 줄었으며, 플랫폼은 데이터 주권과 지연시간 문제로 AWS 아시아태평양(뭄바이) 리전에서 운영된다.

#산업안전 #컴퓨터비전 #엣지컴퓨팅 #AWS #IoT 사진 Kawê Rodrigues / Pexels

AWS·세일즈포스, 공공기관 증거자료 AI 분석 연동

AWS ML Blog·2026-09-22행정과 공공

AWS는 Salesforce Agentforce와 Amazon Bedrock Data Automation을 Model Context Protocol(MCP)로 연동해, 바디캠 영상·CCTV·스캔 문서 같은 비정형 증거자료를 구조화된 인사이트로 변환하는 아키텍처를 소개했다. Amazon S3에 업로드된 파일은 이벤트 기반으로 Lambda와 Bedrock Data Automation을 거쳐 처리되고 결과는 DynamoDB와 S3에 저장된다. 세일즈포스 사용자는 Agentforce 콘솔에서 자연어로 질의하면 Bedrock AgentCore Gateway를 통해 AWS 측 데이터를 조회해 답변받는다. AWS는 이 구조가 증거관리 외에도 다른 업무로 확장 가능한 모듈형 패턴이라고 설명했다.

#Agentforce #Bedrock Data Automation #MCP #공공부문 #AWS

xAI 그록 4.6, 아마존 베드록에 출시

AWS ML Blog·2026-09-21파운데이션 모델·LLM

xAI의 그록(Grok) 4.6이 2026년 8월 18일 아마존 베드록에서 이용 가능해졌다. xAI가 베드록에 제공한 두 번째 모델로, 기존 bedrock-mantle에 더해 bedrock-runtime 엔드포인트와 Converse API(스트리밍 포함)를 새로 지원하며, 추론 강도를 낮음·중간·높음·xhigh 네 단계로 설정할 수 있다. xAI는 장기 실행 에이전트, 코딩, 지식노동 작업에 초점을 맞춰 훈련했다고 밝혔으며, 2026년 8월 12일 발표한 자체 벤치마크에서 GDPVal-AA v2, AA-Briefcase 등 다수 평가 결과를 공개했다. 이 중 일부 지표는 xAI 자체 측정이 아니라 독립 평가기관인 Artificial Analysis가 산출한 것이다.

#Grok 4.6 #xAI #Amazon Bedrock #AI 에이전트 #벤치마크

BMW, 1만4000개 클라우드 계정 비용 이상 자동 탐지 시스템 구축

AWS ML Blog·2026-09-21MLOps·개발도구

BMW 그룹은 AWS와 협력해 자체 FinOps 시스템 CLEA를 운영하며, 1만4000개 이상 클라우드 계정의 비용 이상 징후를 매일 자동으로 탐지한다. AWS Cost and Usage Reports 등 청구 데이터를 수집해 계정·서비스별 일일 비용 시계열을 만들고, 메타의 오픈소스 예측 라이브러리 Prophet으로 365일치 이력을 학습해 예상 지출 기준선을 계산한다. 실제 지출이 신뢰구간을 벗어나고 예상 대비 40% 이상 편차가 발생하면 계정 담당자에게 이메일 알림을 보낸다. AWS Step Functions와 Lambda 기반 서버리스 구조로 전체 계정 처리를 약 20분 만에 완료한다.

#FinOps #클라우드 비용관리 #이상 탐지 #Prophet #AWS Step Functions

Posit의 Positron IDE, AWS 세이지메이커서 실행 가능

AWS ML Blog·2026-09-21MLOps·개발도구

Posit의 데이터 과학용 통합개발환경(IDE) Positron이 Amazon SageMaker AI에서 실행되도록 지원된다. 데이터 과학자는 Space 실행 역할을 통해 별도 자격 증명 관리 없이 Amazon Athena, AWS Glue 데이터 카탈로그, Amazon S3에 직접 접근할 수 있다. Posit의 AI 코딩 어시스턴트인 Posit Assistant는 Amazon Bedrock을 모델 제공자로 사용해 사용자의 AWS 계정과 리전 내에서 동작한다. Posit이 SageMaker Distribution 이미지를 기반으로 배포한 Positron 컨테이너 이미지 정의를 관리자가 Amazon ECR에 등록하고 Studio 도메인에 연결하면, 데이터 과학자는 Space 생성 시 Positron을 선택해 사용할 수 있다.

#Positron #SageMaker #Posit #AWS #Bedrock

벤클링, Bedrock AgentCore로 멀티테넌트 AI 에이전트 보안 구축

AWS ML Blog·2026-09-21MLOps·개발도구

생명과학 소프트웨어 기업 벤클링(Benchling)이 수천 개 테넌트를 대상으로 AI 에이전트가 생성한 과학 코드를 실행하기 위해 아마존 베드록 애전트코어(Amazon Bedrock AgentCore)의 코드 인터프리터를 VPC 모드로 도입해 심층 방어 보안 구조를 구축했다고 AWS ML 블로그가 소개했다. 이 구조는 인터넷·NAT 게이트웨이가 없는 별도의 미신뢰 코드 실행용 AWS 계정, Route 53 리졸버 DNS 방화벽, VPC 엔드포인트 정책을 결합해 DNS를 통한 데이터 유출까지 차단한다. 테넌트별 IAM 역할을 두는 대신 AWS STS를 통해 작업 단위로 임시 자격 증명을 발급해 접근을 동적으로 제한한다. AWS에 따르면 이 시스템은 하루 600건 이상의 코드 실행 세션과 주간 250개 이상의 테넌트를 보안 사고 없이 처리하고 있다.

#Bedrock AgentCore #코드 인터프리터 #멀티테넌트 보안 #AWS #생명과학

EXL, AWS 기반 의료기록 자동처리로 보험 심사 지원

AWS ML Blog·2026-09-21AI 에이전트·툴 유즈

보험사 손해사정사가 건당 100분 넘게 의료기록을 수작업으로 검토하는 문제를 해결하기 위해 EXL이 AWS 기반 AI 솔루션을 공개했다. 템플릿 비종속형 지능형 문서처리(IDP) 애플리케이션 Xtrakto.AI가 문서 수집·분류·추출을 담당하고, 보험·의료 도메인 데이터로 파인튜닝된 EXL Insurance LLM이 의료 용어와 진단-치료 관계를 이해해 요약·질의응답·구조화된 출력을 생성한다. 두 애플리케이션은 Amazon SageMaker AI와 Amazon Bedrock을 중심으로 API Gateway, Step Functions, Textract, DynamoDB 등 AWS 서비스를 결합한 파이프라인에서 작동하며, 보호대상 건강정보를 다루는 만큼 AWS IAM으로 접근을 통제한다.

#EXL #AWS #SageMaker #Bedrock #보험

SageMaker AI, 2026년 추론 신기능 13종 공개

AWS ML Blog·2026-09-18MLOps·개발도구

아마존 SageMaker AI가 2026년 들어 관리형 엔드포인트와 HyperPod Inference 두 경로에 걸쳐 13개의 신규 추론 기능을 공개했다. 관리형 엔드포인트에는 인스턴스 추천 자동화, 용량 부족 시 자동 대체 인스턴스 풀, OpenAI 호환 API 지원 등이 포함된다. 인스턴스 추천 기능은 모델과 비용·지연·처리량 목표를 지정하면 인스턴스 유형 선정부터 벤치마킹까지 자동 수행해, 기존에 수 주가 걸리던 수작업 벤치마킹 과정을 대체한다고 설명했다. AWS가 공개한 시연 사례에서는 처리량 최적화를 적용한 GPT-OSS-20B 모델이 동일 요청 지연 시간에서 초당 토큰 처리량이 2배로 늘었다. OpenAI SDK나 LangChain 기반 애플리케이션은 엔드포인트 URL만 바꾸면 SageMaker로 이전할 수 있게 됐다.

#SageMaker #AWS #추론 인프라 #OpenAI API 호환 #HyperPod

AWS 베드록, 문샷AI 'Kimi K3' 모델 추가 지원

AWS ML Blog·2026-09-18MLOps·개발도구

AWS가 아마존 베드록에 문샷AI의 오픈웨이트 모델 Kimi K3를 추가했다. 문샷AI에 따르면 Kimi K3는 자사 최고 성능 모델로 네이티브 비전 처리와 긴 컨텍스트 유지 기능을 갖췄으며, 이전 모델 Kimi K2 대비 스케일링 효율이 개선됐다고 밝혔다. Kimi K3는 베드록에서 명시적 프롬프트 캐싱을 지원하는 첫 오픈웨이트 모델로, 반복되는 프롬프트를 재사용할 때 지연시간과 입력 비용을 줄일 수 있다. AWS는 2025년부터 딥시크, 구글, 미니맥스, 미스트랄AI, 엔비디아, OpenAI, Qwen 등의 오픈웨이트 모델을 베드록에 계속 추가해왔고, 2026년에는 툴 콜링, 구조화된 출력, 추론, 응답 스트리밍 등 플랫폼 차원의 추론 기능을 확장했다. 오픈웨이트 모델 이용 시에도 데이터는 AWS 경계 내에서 처리되며 모델 제공자와 공유되거나 학습에 사용되지 않는다.

#Kimi K3 #Moonshot AI #Amazon Bedrock #오픈웨이트 모델 #프롬프트 캐싱

AWS, 멀티모델 헬스케어 AI 에이전트 AgentCore로 이전

AWS ML Blog·2026-09-18AI 에이전트·툴 유즈

AWS는 Amazon ECS·Fargate 기반 자체 관리 인프라에서 운영되던 멀티모델 헬스케어 AI 에이전트를 Amazon Bedrock AgentCore 런타임으로 이전하는 방법을 소개했다. 이 에이전트는 Amazon SageMaker AI의 BioM-ELECTRA-Large-SQuAD2, Amazon Bedrock의 Llama 3.1 70B Instruct by Meta, 컨테이너화된 자체 호스팅 모델 서버 등 세 가지 모델 백엔드를 질의 유형에 따라 오케스트레이션하며, Amazon OpenSearch Service를 통한 벡터 기반 지식 검색도 지원한다. AgentCore 런타임은 컨테이너 생명주기, 스케일링, 자격 증명, 관측성을 자동으로 관리해 개발자가 인프라 관리 대신 에이전트 로직 개발에 집중할 수 있게 한다. 구현에는 Hugging Face smolagents 프레임워크를 사용했으며, 기존 에이전트 코드를 다시 작성하지 않고 배포하는 BYO(bring-your-own) 에이전트 방식을 시연했다.

#AWS #Bedrock AgentCore #AI 에이전트 #헬스케어 AI #smolagents

AWS, 새 AgentCore 런타임 공개…메모리 회수·콜드스타트 개선

AWS ML Blog·2026-09-18AI 인프라·반도체

AWS는 에이전트 실행을 위한 관리형 컴퓨팅 계층인 Amazon Bedrock AgentCore 런타임을 새로 개편해 공개했다. 기존에는 세션이 할당한 메모리를 종료 시점까지 그대로 유지해 사용량과 무관하게 최고치 기준으로 비용이 발생했지만, 새 런타임은 세션이 끝날 때 즉시 메모리를 회수한다. 또한 컨테이너 크기나 동시성 수준과 무관하게 일관된 콜드스타트 시간을 제공한다고 밝혔다. AWS는 이번 개선이 대화형 챗봇부터 장시간 자율 실행되는 에이전트까지 전 영역에서 반응성과 비용 효율성을 높이기 위한 것이라고 설명했다.

#AWS #AgentCore #Bedrock #AI 에이전트 #서버리스

AWS, Hugging Face 모델 배포용 에이전트 스킬 공개

AWS ML Blog·2026-09-18MLOps·개발도구

AWS는 Amazon SageMaker AI에 Hugging Face 모델을 배포할 때 Kiro와 Claude Code 같은 코딩 에이전트가 활용할 수 있는 여섯 가지 에이전트 스킬을 Hugging Face Skills 저장소를 통해 공개했다. 테스트에서 스킬 없이 작동한 에이전트는 서빙 컨테이너로 TGI를 먼저 선택했다가 Qwen3 모델의 헬스 체크 실패를 겪은 뒤 vLLM으로 전환했고, 새로 나온 멀티모달 MoE 확산 모델 배포에서도 TGI를 잘못 적용해 엔드포인트가 조용히 실패했다. 스킬을 설치하면 에이전트가 리소스 생성 전에 vLLM을 올바르게 선택하고, AWS Deep Learning Containers 카탈로그에서 이미지 URI를 확인하며, 오토스케일링과 지연시간·오류·오버헤드용 CloudWatch 알람을 자동으로 구성한다. 스킬은 오픈소스로 Python과 AWS CLI만 사용해 macOS, Linux, Windows에서 동일하게 동작한다.

#Hugging Face #SageMaker #코딩 에이전트 #Claude Code #에이전트 스킬

AWS, GPU 인식 추론 라우팅 '하이퍼팟 게이트웨이' 공개

AWS ML Blog·2026-09-18MLOps·개발도구

AWS는 아마존 세이지메이커 하이퍼팟용 쿠버네티스 네이티브 라우팅 시스템 'SageMaker HyperPod Inference Gateway'를 발표했다. 기존 라운드로빈·최소연결 방식 로드밸런서와 달리 KV 캐시 사용률, 요청 큐 깊이, LoRA 어댑터 탑재 여부 등 실시간 GPU 지표를 활용해 요청을 최적의 파드로 배분한다. EKS 관리형 애드온으로 설치되며 기존 모델 서버나 클라이언트 코드 변경 없이 OpenAI 호환 엔드포인트를 그대로 사용할 수 있다. AWS는 자체 사례로 첫 토큰 응답 지연이 4.4초에서 800밀리초 미만으로 줄었다고 밝혔다. 여러 클러스터·리전을 연결하는 2단계 '글로벌 추론 라우터'는 추후 제공될 예정이다.

#SageMaker #HyperPod #Kubernetes #추론 라우팅 #AWS

아마존, AI 면접·평가 채용 솔루션 'Connect Talent' 출시

AWS ML Blog·2026-09-17일자리와 노동

AWS가 대규모 채용을 위한 AI 기반 솔루션 'Amazon Connect Talent'를 출시했다. 채용 담당자가 평가 기준과 면접 질문을 설정하면 AI 에이전트가 후보자와 면접을 진행하고 평가 점수, 전체 대화 기록, 평가 근거를 담은 대시보드를 제공한다. 후보자는 시간과 기기에 구애받지 않고 AI 면접에 응할 수 있으며, 평가 시 후보자 정보는 익명화되어 처리된다. 최종 채용 결정 권한은 채용 담당자에게 있으며, AWS 인프라 기반의 보안 통제가 적용된다.

#AI 채용 #Amazon Connect Talent #AI 면접 #AWS #인사관리

AWS, Bedrock 지식베이스용 벡터 스토어 3종 비교 가이드 공개

AWS ML Blog·2026-09-17MLOps·개발도구

AWS가 Amazon Bedrock Knowledge Bases의 RAG(검색 증강 생성) 구축 시 선택 가능한 세 가지 고객 관리형 벡터 스토어인 Amazon OpenSearch Service, Aurora PostgreSQL(pgvector), Amazon S3 Vectors를 용도별로 비교하는 가이드를 게시했다. 상품 카탈로그 검색 사례에서는 하이브리드 검색과 필터링·집계 기능을 갖춘 Amazon OpenSearch Serverless가 적합하다고 설명했다. Amazon S3 Vectors는 기존 벡터 데이터베이스 대비 저장 비용을 최대 90%까지 낮추는 것을 목표로 한다고 소개했다. 글은 OpenSearch Serverless NextGen 컬렉션이 2026년 5월 정식 출시됐지만 아직 Bedrock Knowledge Bases와는 호환되지 않는다고 밝혔다.

#AmazonBedrock #RAG #벡터데이터베이스 #AWS #OpenSearch 사진 cottonbro studio / Pexels

AWS, Git 메트릭 서버리스 대시보드 솔루션 공개

AWS ML Blog·2026-09-17MLOps·개발도구

AWS ML Blog가 GitHub·GitLab 저장소 활동 데이터를 자동 수집해 Amazon QuickSight로 시각화하는 서버리스 파이프라인을 소개했다. EventBridge 스케줄러가 주기적으로 워크플로를 실행하면 Step Functions와 Lambda가 변경 감지, 전체·증분 수집, 대규모 저장소의 병렬 처리를 담당한다. 수집된 데이터는 Secrets Manager로 인증 정보를 보호하며 S3에 JSON·CSV로 저장되고, QuickSight 대시보드에서 조회할 수 있다. 이 솔루션은 AI 코딩 도구 도입 전후 개발 속도 변화를 측정하는 AWS AI-DLC 프레임워크의 관측성 원칙과 연계된다고 설명됐다.

#AWS #QuickSight #서버리스 #개발생산성 #Git메트릭 사진 olia danilevich / Pexels

독일 보험사 MRH Trowe, 금융권용 AI 에이전트 도입

AWS ML Blog·2026-09-17AI 에이전트·툴 유즈

독일 보험 브로커 MRH Trowe가 Strands Agents, Amazon Bedrock AgentCore, LibreChat을 결합해 약 400명의 직원에게 자율형 AI 에이전트를 제공했다고 AWS가 밝혔다. 이 규모는 프로덕션 가동 첫 달 만에 달성됐다. 첫 적용 사례는 Microsoft Teams 회의를 구조화된 회의록으로 정리하는 에이전트로, 직원은 로그인된 Microsoft Entra ID 신원으로만 자신의 캘린더와 회의록에 접근할 수 있도록 설계됐다. 모든 처리는 독일 내 데이터 보호 요건을 충족하기 위해 AWS 유럽(프랑크푸르트) 리전에서만 이뤄진다.

#AI 에이전트 #Bedrock AgentCore #금융 규제 #LibreChat #데이터 리전

AWS, Amazon Quick의 MCP 툴에 다중 게이트 인가 패턴 적용

AWS ML Blog·2026-09-17AI 에이전트·툴 유즈

AWS ML 블로그는 Amazon Quick에서 MCP 툴 호출 시 토큰 인증만으로는 부족하다며, OIDC JWT 클레임을 순차 평가하는 다중 게이트 인가 패턴을 소개했다. 이 패턴은 MFA 확인, 지역(국가) 제한, 그룹 기반 역할 매핑, 툴 단위 권한 검사의 4개 게이트로 구성되며, 각 게이트는 환경 변수로 개별 활성화·비활성화할 수 있다. Microsoft Entra ID를 신원 공급자로 사용했고, Amazon Bedrock AgentCore Gateway에 연결된 AWS Lambda 인터셉터가 요청마다 클레임을 검사한다. 가상의 기업 사례를 들어 읽기 전용 사용자와 관리자 권한을 구분하고, 모든 데이터 변경에는 불변 감사 기록을 남기도록 구성했다.

#MCP #AWS #Amazon Bedrock AgentCore #인가 #Entra ID

AWS, 합성 데이터로 산업안전 AI 사람 탐지 성능 개선

AWS ML Blog·2026-09-17MLOps·개발도구

AWS는 SageMaker AI와 Amazon Rekognition을 결합한 합성 데이터 증강 파이프라인을 공개했다. 중장비 근처의 위험한 상황에 사람이 있는 실제 학습 이미지는 안전·윤리적 이유로 구하기 어렵고 실제 데이터셋에서도 드물어, 이를 보완하기 위해 디퓨전 모델 Qwen-Image-Edit-2509로 실제 장면 이미지에 사람을 합성해 삽입하고, Rekognition의 DetectLabels API로 바운딩박스 라벨을 자동 생성한다. 배경·조명·비율을 보존하는 방식으로 이미지를 편집해 완전 합성 장면 생성 시 발생하는 도메인 갭 문제를 줄였다. AWS는 자체 실험에서 사람 탐지 모델의 mAP50 지표가 수작업 라벨링이나 위험한 촬영 없이 최대 160% 개선됐다고 밝혔다.

#합성데이터 #산업안전 #SageMaker #Rekognition #컴퓨터비전

AWS, 의료 AI 에이전트용 오픈소스 '스킬' 38종 공개

AWS ML Blog·2026-09-16AI 에이전트·툴 유즈

AWS는 의료·생명과학(HCLS) 분야 AI 에이전트가 가이드라인 지식은 있어도 판단 절차를 잘못 적용해 발생하는 오류를 줄이기 위해 11개 도메인, 38종의 오픈소스 '에이전트 스킬' 모음을 공개했다. 스킬은 SKILL.md라는 마크다운 문서 형태로 유전체 변이 해석, 신약 개발, 보험 청구, 의료 영상 분석 등 분야별 의사결정 절차와 코드 패턴을 담고 있으며 MIT-0 라이선스로 배포된다. AWS 자체 평가에 따르면 이 스킬을 적용한 에이전트는 미적용 동일 에이전트와의 비교에서 70~86%의 승률을 기록했고, 특히 비판적 사고 항목에서 78~85% 승률을 보였다. Kiro, AWS Strands Agents SDK, Amazon Bedrock AgentCore, Claude Code, OpenAI Codex 등 여러 에이전트 서비스에서 설치해 사용할 수 있다.

#AI 에이전트 #오픈소스 #의료AI #AWS #HCLS 사진 Daniel Frank / Pexels

AWS, EKS서 NVRx로 장애 허용 분산 학습 구현

AWS ML Blog·2026-09-16MLOps·개발도구

AWS가 Amazon EKS 환경에서 NVIDIA Resiliency Extension(NVRx)을 PyTorch FSDP 학습에 통합해 장애 허용 분산 학습을 구현하는 방법을 블로그로 공개했다. 비동기 체크포인트로 I/O와 학습을 병행하고, 인프로세스 재시작으로 컨테이너를 건드리지 않고 소프트 장애를 복구하며, ft_launcher로 하드 크래시 시 워커를 자동 재생성하는 3단계 복구 계층을 소개했다. 동기 체크포인트가 전체 대기 시간의 최대 40%를 차지했다고 설명했다. p5.48xlarge H100 GPU 노드와 Amazon FSx for Lustre 공유 스토리지를 활용해 2~8노드 규모에서 벤치마크를 수행했다.

#NVRx #PyTorch FSDP #Amazon EKS #분산학습 #체크포인트 사진 Markus Spiske / Pexels

AWS, AgentCore로 에이전트 시스템 프롬프트 자동 최적화

AWS ML Blog·2026-09-16MLOps·개발도구

AWS는 Amazon Bedrock AgentCore의 시스템 프롬프트 최적화 기능을 상세히 소개하는 기술 후속 글을 공개했다. 이 기능은 AgentCore Observability에 기록된 실제 운영 트레이스와 평가 결과(리워드 신호)를 바탕으로 개선된 시스템 프롬프트를 제안한다. 제안된 변경은 오프라인 배치 평가와 실시간 트래픽 A/B 테스트를 거쳐 검증된 뒤 승격되며, 플랫폼 가드레일이 후보안을 사전에 걸러낸다. 추천 엔진은 하나의 리플렉터가 전체 트레이스를 분석하는 'Single Agent Reflector'와, 여러 서브에이전트가 트레이스를 분담 분석하는 실험적 오픈소스 'Sub-Agent Reflector' 두 방식으로 구성된다.

#AWS #Bedrock AgentCore #시스템 프롬프트 최적화 #AI 에이전트 #A/B 테스트 사진 Nemuel Sereti / Pexels

AWS, Bedrock 활용한 서버리스 PII 레닥션 파이프라인 공개

AWS ML Blog·2026-09-16MLOps·개발도구

AWS는 대량의 스캔 문서에서 개인식별정보(PII)를 자동으로 탐지·삭제하는 서버리스 파이프라인 구축 방법을 소개했다. Amazon Bedrock Data Automation의 커스텀 블루프린트 기능으로 문서 내 민감 필드를 자연어 지침으로 정의하고, 필드별 신뢰도 점수와 바운딩 박스 좌표를 얻어 AWS Step Functions·Lambda로 처리한다. 사례로는 보험 청구 전 의사소견서(Attending Physician Statement)에서 환자 이름·생년월일·주소 등만 골라 검게 칠하고, 의사 정보나 진료 기록은 남기는 방식을 제시했다. 기존 OCR과 패턴 매칭 기반 방식이 문서 손상이나 필드 단위 로직 처리에 한계가 있었던 점을 생성형 AI의 문맥 이해로 보완한다는 설명이다.

#PII레닥션 #AmazonBedrock #서버리스 #문서자동화 #AWS 사진 Christina Morillo / Pexels

AWS, 베드록 프롬프트 캐싱으로 비용·지연시간 절감법 소개

AWS ML Blog·2026-09-15MLOps·개발도구

AWS는 Amazon Bedrock의 프롬프트 캐싱 기능을 활용해 반복되는 프롬프트 컨텍스트의 입력 토큰 비용과 응답 지연시간(TTFT)을 줄이는 방법을 설명하는 블로그 글을 게시했다. 요청에 cachePoint 마커를 포함하면 이전 요청과 동일한 앞부분 콘텐츠는 다시 처리하지 않고 캐시된 상태에서 이어서 응답을 생성한다. 문서 캐싱, 시스템 프롬프트 캐싱, 툴 정의 캐싱, 혼합 TTL 적용, 멀티테넌트 격리, LangChain 연동 등 여섯 가지 활용 시나리오를 Converse API 예제로 소개한다. 캐시는 AWS 계정과 리전 단위로 범위가 지정되며, 모델에 따라 캐시 체크포인트별 최소 토큰 임계값과 TTL 설정이 다르게 적용된다.

#Amazon Bedrock #프롬프트 캐싱 #AWS #Converse API #LangChain 사진 Mikhail Nilov / Pexels

AWS, SageMaker 서버리스로 상품 태깅 시스템 구축법 공개

AWS ML Blog·2026-09-15MLOps·개발도구

AWS ML 블로그는 Amazon SageMaker 서버리스 모델 커스터마이징을 활용해 상품 카탈로그 태깅 시스템을 만드는 방법을 소개했다. Qwen3-8B 모델을 지도 미세조정(SFT)한 뒤, 검증 가능한 보상 기반 강화학습(RLVR)을 GRPO 방식으로 적용해 최적화하는 절차를 설명한다. 학습 과정은 SageMaker 서버리스 커스터마이징이 컴퓨팅 자원 할당을 관리하며, 최적화된 모델은 SageMaker 비동기 추론에 배포해 배치 방식으로 카탈로그 태깅에 사용한다. 실습에는 Kaggle의 Amazon Sales Dataset(1,000개 이상의 상품 레코드)을 활용했다.

#SageMaker #Qwen3-8B #파인튜닝 #RLVR #상품태깅 사진 Christina Morillo / Pexels

SageMaker AI, 학습 작업용 인스턴스 우선순위 목록 지원

AWS ML Blog·2026-09-15MLOps·개발도구

AWS가 Amazon SageMaker AI의 학습(Training) 및 처리(Processing) 작업에 '인스턴스 선호 목록' 기능을 추가했다고 발표했다. 사용자는 최대 5개의 인스턴스 유형을 우선순위대로 지정할 수 있고, SageMaker AI가 목록을 순서대로 평가해 가용 용량이 있는 첫 번째 유형으로 작업을 자동 실행한다. 선호 유형 모두 즉시 가용하지 않으면 작업은 이벤트 기반 대기열에 들어가 용량이 생기는 대로 재시도하며, 이 대기 시간은 MaxPendingTimeInSeconds로 제어된다. 이 기능은 Flexible Training Plan 예약 용량과도 연동되어, 예약분을 우선 확인한 뒤 온디맨드 대체 인스턴스로 전환할 수 있다.

#AWS #SageMaker #GPU #학습 인프라 #클라우드 사진 Kevin Ku / Pexels

어보노멀AI, 베드록 에이전트코어로 이메일 위협 탐지

AWS ML Blog·2026-09-14AI 에이전트·툴 유즈

이메일 보안 기업 어보노멀 AI가 포춘 500대 기업의 25% 이상을 보호하는 실시간 위협 탐지 시스템에 아마존 베드록 에이전트코어의 코드 인터프리터를 도입했다고 AWS가 밝혔다. 이 시스템은 하루 수십억 건의 이메일을 처리하는 3단계 구조로, 1단계는 경량 분류기가 대량 트래픽을, 2단계는 중간 규모 모델이 불확실한 사례를, 3단계는 코드 인터프리터를 쓰는 에이전트가 사람 분석가 수준의 판단이 필요한 어려운 사례를 처리한다. 3단계 에이전트는 위협 인텔리전스 데이터를 받아 스크립트를 직접 작성해 분석하고 최종 판정을 내린다. 별도의 배치 분석 에이전트는 오탐 데이터를 학습해 1·2단계 규칙과 모델을 개선하며 주당 약 100건의 작업을 수행한다. 회사는 코드 변경의 80%에 에이전트를 활용하고 40%는 백그라운드 에이전트가 전 과정을 자동으로 작성한다고 밝혔다.

#AWS #Bedrock AgentCore #코드 인터프리터 #이메일 보안 #AI 에이전트

AWS, AI 에이전트용 OAuth 동의 관리 포털 출시

AWS ML Blog·2026-09-14AI 에이전트·툴 유즈

AWS는 Amazon Bedrock AgentCore Identity에 'Consent 포털' 기능을 추가했다고 밝혔다. 이는 AI 에이전트가 GitHub, Slack 등 서비스에 사용자를 대신해 접근할 때 필요한 OAuth 인증과 세션 바인딩을 처리하는 관리형 웹 경험이다. 기존에는 고객이 인가 URL 표시, HTTPS 콜백 호스팅, 사용자 인증, 브라우저 세션 관리 등 관련 인프라를 직접 구축·운영해야 했다. 관리자가 게이트웨이용 포털을 만들어 URL을 공유하면, 사용자는 조직의 ID 공급자로 로그인한 뒤 에이전트가 사용할 서비스 목록을 확인하고 개별적으로 동의할 수 있으며, 발급된 토큰은 AgentCore Identity의 토큰 볼트에 저장된다. AWS는 이 기능이 Kiro, Claude Code, Cursor, Visual Studio Code 같은 IDE 및 MCP 클라이언트로 접근하는 에이전트에 특히 유용하다고 설명했다.

#AgentCore #OAuth #AI 에이전트 #MCP #AWS

나인스웨이브, 베드록 기반 오픈파이낸스 온보딩 AI 구축

AWS ML Blog·2026-09-14AI 에이전트·툴 유즈

금융데이터 연결기업 나인스웨이브가 Amazon Bedrock AgentCore를 활용해 오픈파이낸스 온보딩 지원 AI 'Compass'를 구축했다. 은행마다 제각각인 API를 FDX 표준에 맞춰 검증·매핑하는 작업은 기존에 이메일과 스프레드시트를 거치는 수 주간의 전문 인력 작업이 필요했다. Compass는 단일 모델 RAG 대신 작업별로 특화된 다중 에이전트 구조를 채택해, 오케스트레이터가 사용자 의도를 분류한 뒤 전문 에이전트로 라우팅하고 작업 복잡도에 따라 모델을 다르게 배정한다. 은행별 데이터는 테넌트 단위로 격리되며, AWS WAF·IAM·KMS 등을 통해 SOC 2·PCI DSS 등 금융 보안·컴플라이언스 요건을 충족하도록 설계됐다.

#Amazon Bedrock #AgentCore #멀티에이전트 #오픈파이낸스 #핀테크

AWS, 수요예측-발주 자동화 에이전트 루프 공개

AWS ML Blog·2026-09-14AI 에이전트·툴 유즈

AWS 머신러닝 블로그가 Databricks의 Many Model Forecasting과 Chronos-2, Amazon Quick을 결합해 소매 재고 보충을 자동화하는 아키텍처를 소개했다. 이 시스템은 SKU별 수요 급증을 감지(Detect)하고 공급업체 재고와 대조해 공급처를 결정(Decide)하며 발주 API로 주문을 실행(Act)하는 4단계 루프로 작동한다. Databricks Genie 에이전트가 수요 급증 SKU를 찾아내면 Amazon Quick이 Amazon S3 Tables의 공급업체 재고 데이터와 대조해 조건에 맞는 공급처를 선택하고, 단일 공급업체로 해결되지 않는 경우에는 사람의 검토를 요청하는 예외 처리 단계로 넘어간다. 관련 리포지토리를 통해 재현 가능한 설정과 스크립트가 함께 제공된다.

#재고관리자동화 #AI에이전트 #AWS #Databricks #수요예측

AWS, 에이전트 수명주기 모니터링에 DevOps 에이전트와 AgentCore 결합

AWS ML Blog·2026-09-11MLOps·개발도구

AWS ML 블로그는 다중 에이전트 시스템에서 인프라 지표는 정상인데도 에이전트가 잘못된 도구를 선택하거나 요청을 엉뚱한 전문 에이전트로 라우팅하는 문제가 발생할 수 있다고 설명했다. 이를 해결하기 위해 네 개의 전문 에이전트로 구성된 항공 예약 시스템에 Amazon Bedrock AgentCore Evaluations와 AWS DevOps Agent를 결합했다. AgentCore Evaluations는 실제 상호작용 일부를 지속적으로 채점해 도움이 되는지, 목표를 완료했는지를 평가하고 품질 저하 시 원인 패턴을 분석해 개선안을 제시한다. AWS DevOps Agent는 CloudWatch 로그와 IAM 정책, 호출 추적을 자동으로 분석해 장애 원인을 파악한다. 이 시스템은 Amazon Bedrock, AgentCore 런타임, Strands Agents, OpenTelemetry 등을 활용한다.

#AWS #AgentCore #멀티에이전트 #옵저버빌리티 #Bedrock

토큰 가격 아닌 '정답당 비용'으로 AI 모델 비교해야

AWS ML Blog·2026-09-11MLOps·개발도구

AWS는 Amazon Bedrock의 OpenAI 모델(gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol)과 OpenAI API의 gpt-5.4-mini, gpt-5.4-nano를 오픈소스 벤치마킹 도구로 비교한 결과를 공개했다. 단순 토큰 가격이 아니라 정답 하나를 얻는 데 드는 실제 비용, 에이전트 작업에서 턴 수가 늘어날 때 누적되는 비용, 실제 업무 결과물 품질을 함께 측정해야 한다는 점을 강조했다. AIME, GPQA Diamond, MMLU-Pro 등에서 gpt-5.6-sol이 가장 높은 정답률을 보였고, gpt-5.6-luna는 추론 기능을 끈 상태에서 적은 토큰으로도 정답당 비용이 가장 낮았다고 AWS는 설명했다. 다만 Bedrock 모델은 추론을 비활성화하고 OpenAI API 모델은 기본 설정으로 실행돼, 모델 자체 성능을 엄밀히 통제 비교한 것은 아니라고 밝혔다.

#Amazon Bedrock #OpenAI #벤치마킹 #모델 비교 #AI 에이전트

AWS, Bedrock AgentCore로 MCP 앱 인터랙티브 위젯 구현

AWS ML Blog·2026-09-11AI 에이전트·툴 유즈

AWS는 블로그를 통해 Model Context Protocol(MCP)을 확장한 'MCP Apps' 표준과 Amazon Bedrock AgentCore를 이용해 ChatGPT, Claude 등 여러 AI 호스트에서 동일하게 작동하는 인터랙티브 HTML 위젯 서비스를 구축하는 방법을 소개했다. 예시로 만든 'Unicorn Rentals' 앱은 유니콘 목록 조회, 예약, 예약 확인, 반납 등을 카드형 UI와 텍스트 응답으로 자연어 대화 안에서 처리한다. AgentCore 런타임과 Gateway가 보안·세션 격리·라우팅을 담당하고, 실제 비즈니스 로직은 AWS Lambda와 DynamoDB로 처리된다. AWS는 이 구조가 특정 AI 호스트에 종속되지 않고 여러 호스트에 동일한 서비스를 노출할 수 있게 해준다고 설명했다.

#MCP #AgentCore #AWS #AI 에이전트 #인터랙티브 위젯

AWS 세이지메이커, 프리픽스 인식 라우팅 도입

AWS ML Blog·2026-09-10MLOps·개발도구

AWS가 Amazon SageMaker Inference에 '프리픽스 인식 라우팅'이라는 새 라우팅 전략을 도입했다. 여러 인스턴스에 요청이 무작위로 분산되면 프롬프트의 동일한 앞부분(고정 지시문 등)이 매번 다른 인스턴스로 가면서 KV 캐시가 재사용되지 못하던 문제를 해결하기 위해, 같은 시작 부분을 가진 요청을 같은 인스턴스로 보내 캐시를 유지시킨다. AWS 자체 벤치마크(Llama 3.1 70B, vLLM 사용)에 따르면 P50 TTFT가 최대 77% 감소하고 처리량은 최대 16% 증가했으며, KV 캐시 적중률은 약 25%에서 80% 이상으로 올라갔다. 과부하 인스턴스로의 쏠림을 막는 보호장치와 스케일링 시 캐시 무효화를 최소화하는 안정성 기능도 함께 제공된다.

#SageMaker #프리픽스 캐싱 #LLM 서빙 #AWS #추론 최적화

SageMaker 하이퍼팟, 모델 캐싱으로 콜드스타트 단축

AWS ML Blog·2026-09-10MLOps·개발도구

AWS가 아마존 세이지메이커 하이퍼팟의 추론 배포 시 발생하는 콜드스타트 지연을 줄이는 모델 캐싱 기능을 발표했다. 기존에는 컨테이너 이미지를 아마존 ECR에서, 모델 가중치를 S3나 FSx for Lustre, 허깅페이스 허브 등에서 순차적으로 내려받아야 해 DeepSeek-R1 같은 대형 모델은 준비까지 30분 이상 걸렸다. 모델 캐싱은 가중치와 컨테이너 이미지를 노드의 로컬 NVMe 스토리지에 미리 적재해 초당 약 7GB 속도로 읽도록 하며, 이를 통해 파드가 수 초 안에 트래픽을 처리할 수 있다. 캐시가 준비되지 않은 노드에 파드가 배치되더라도 기존 방식대로 원본 소스에서 내려받아 장애 없이 동작한다.

#SageMaker HyperPod #모델 캐싱 #콜드스타트 #AWS #추론 인프라

AWS 베드록, TwelveLabs 임베딩으로 영상·이미지 자연어 검색 지원

AWS ML Blog·2026-09-10멀티모달

AWS가 TwelveLabs의 Marengo Embed 3.0을 Amazon Bedrock Knowledge Bases의 임베딩 모델로 정식 출시했다. 이 모델은 영상, 오디오, 이미지, 텍스트를 하나의 벡터 공간으로 함께 인코딩해 별도의 전사·프레임 추출·벡터DB 파이프라인 없이 영상 콘텐츠를 자연어로 검색할 수 있게 한다. 예시로 2022 FIFA 월드컵 결승전 영상 클립을 업로드해 '페널티킥 장면을 보여줘' 같은 질의로 해당 구간을 찾아내는 과정을 소개했다. Amazon S3, SharePoint, Confluence 등과 연동되며 결과에는 구간 시작·종료 시간 등 메타데이터가 포함된다.

#Amazon Bedrock #TwelveLabs #Marengo #멀티모달 검색 #RAG

아마존 퀵, 데스크톱 앱 정식 출시

AWS ML Blog·2026-09-10AI 에이전트·툴 유즈

아마존이 기업용 AI 어시스턴트 'Quick'의 데스크톱 앱을 macOS와 윈도우에서 정식 출시했다고 밝혔다. iOS·안드로이드 모바일 앱에는 이메일, 캘린더, CRM, 메시징을 한데 모은 액티비티 피드가 새로 추가된다. Quick은 AWS 인프라에서 구동돼 데이터가 기업 환경 내에 머무르고 대화 내용이 비공개로 유지되며, HIPAA·FedRAMP·SOC 2·ISO 27001 등 컴플라이언스 인증이 기본 탑재됐다고 회사는 설명했다. 사우스웨스트 항공과 랩콥 등이 프리뷰 기간 동안 제조·의료·스포츠 분야에서 이 도구를 사용해왔다고 회사는 전했다.

#Amazon Quick #AWS #AI 어시스턴트 #엔터프라이즈 AI #생산성 도구

AWS, 'Quick Automate'로 RFI 설문 처리 자동화 구축법 공개

AWS ML Blog·2026-09-10AI 에이전트·툴 유즈

AWS ML 블로그는 Amazon Quick Automate를 활용해 여러 탭으로 구성된 RFI(정보요청서) 워크북을 자동 처리하는 방법을 소개했다. 자연어로 처리 로직을 설명하면 에이전트가 Amazon S3에서 데이터를 읽어 질문과 카테고리, 응답 유형을 추출하고 구조화된 CSV 파일로 출력하는 워크플로를 생성한다. 사용자는 대화를 통해 워크플로를 수정하고, 검증 후 다른 AWS 리전이나 프로덕션 계정으로 배포할 수 있다. 이 과정은 S3 커넥터 설정, 자동화 프로젝트 생성, 처리 로직 작성, 결과 검증, 배포의 단계로 구성된다.

#AWS #Quick Automate #자동화 #Amazon S3 #업무자동화

AWS, 모델 비종속 LLM 기반 PII 탐지기 공개

AWS ML Blog·2026-09-10MLOps·개발도구

AWS는 파인튜닝용 학습 데이터에 포함된 개인식별정보(PII)가 모델에 암기되어 이후 유출될 수 있는 문제를 다루기 위해, 어떤 LLM에서도 작동하는 설정 가능한 PII 탐지기를 소개했다. 이 탐지기는 프롬프트 지침만으로 탐지 대상 항목과 출력 형식을 정의해, 재학습이나 재배포 없이 새로운 항목을 추가할 수 있다. Amazon Bedrock의 관리형 모델을 쓰거나 자체 인프라에 배포한 오픈모델로도 실행 가능하다. AWS는 이 탐지기를 OpenAI PrivacyFilter를 포함한 9종의 LLM 기반 탐지기와 함께 공개된 5개 PII 코퍼스로 비교 평가했으며, 구현 코드는 pii-detector 패키지로 공개했다.

#PII탐지 #Amazon Bedrock #LLM #개인정보보호 #AWS