모델 801건 · 국산 131 · 가격 643 추적 중
AI 에이전트·툴 유즈

우버 AI 예산 고갈, 진짜 원인은 비용 측정 실패

CIO Korea·2026-09-28

요약

우버는 2025년 12월 클로드 코드를 도입한 뒤 에이전트 기반 코딩 도구 사용률이 크게 늘면서 2026년 AI 예산을 넉 달 만에 소진했다. 우버는 대응으로 직원별 도구 사용 한도를 설정했지만, 우버 COO는 지출 증가가 실제로 더 많은 기능 출시로 이어졌는지 확인하기 어렵다고 말했다. 칼럼은 문제의 핵심이 토큰 가격 자체가 아니라, 에이전트가 매 단계마다 전체 대화 기록을 다시 전송하면서 청구 대상 입력 토큰이 단계 수에 비례해 눈덩이처럼 불어나는 구조에 있다고 지적한다. 프롬프트 캐싱과 검색 범위 좁히기, 재정렬, 의미 기반 문서 분할, 요약, 중복 제거 같은 검색 설계 개선으로 비용을 줄이면서 관련 없는 컨텍스트를 걸러내 답변 품질도 높일 수 있다고 제안한다.

큐레이터 노트

원문에 없는 맥락입니다

사용량 한도는 예산 초과라는 급한 불을 끄는 임시조치일 뿐, 근본 해법은 작업당 비용을 측정해 재무팀에 예산 확대를 설득할 근거를 만드는 엔지니어링 문제라는 지적이다.

깊이 읽기

이 기사 한 건이 아니라, 같은 사안을 다룬 이 사이트의 기록을 근거로 정리했습니다

이 일이 어디서 왔나

우버는 2025년 12월 클로드 코드를 도입한 뒤 에이전트 사용이 급증해 2026년 AI 예산을 넉 달 만에 소진했다. 비슷한 시기 업계에서는 오픈AI가 9월 22일 GPT-6 프롬프트 캐싱을 강화하고 AWS가 9월 18일 Kimi K3에 캐싱 지원을 추가하는 등, 반복되는 컨텍스트 재전송 비용을 줄이려는 움직임이 이어지고 있다. 앤트로픽도 9월 17일 여러 세션에 걸쳐 장기 작업을 조율하는 '클로드 코드 프로젝트'를 내놓아 에이전트 사용 범위를 넓히는 중이다.

짚어야 할 점

  • 우버 사례의 핵심은 토큰 단가가 아니라 에이전트가 매 단계 전체 대화 기록을 재전송하면서 입력 토큰이 단계 수에 비례해 불어나는 구조 자체다.
  • 오픈AI·AWS가 캐싱 기능을 모델·플랫폼 차원에서 강화하는 동안, 우버는 검색 설계 개선(캐싱, 재정렬, 요약, 중복 제거)을 자체적으로 구현해야 하는 상황이다.
  • 사용량 한도 설정은 예산 초과를 막는 임시조치일 뿐, COO 스스로 지출 증가가 기능 출시로 이어졌는지 확인하기 어렵다고 말한 대목이 근본 문제를 보여준다.
  • 앤트로픽의 클로드 코드 프로젝트처럼 에이전트가 여러 세션·작업을 병렬로 조율하는 방향으로 발전할수록, 우버가 겪은 컨텍스트 누적 비용 문제는 다른 조직에서도 반복될 소지가 있다.

아직 확인되지 않은 것

  • 우버가 책정했던 2026년 AI 예산 규모와 실제 초과 액수는 얼마인지 확인되지 않았다.
  • 직원별 도구 사용 한도 도입 이후 개발 생산성이나 기능 출시 속도에 실제로 어떤 변화가 있었는지는 나오지 않았다.
  • 우버가 칼럼이 제안한 프롬프트 캐싱, 검색 범위 좁히기 같은 개선책을 실제로 도입했는지는 확인되지 않았다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

AWS, 계약서 전체 분석용 AI 에이전트 플랫폼 공개
AWS ML Blog · 2026-09-29

AWS는 Amazon Quick과 Bedrock AgentCore를 활용해 벤더 계약서를 구조화된 데이터로 변환하는 계약 인텔리전스 플랫폼 아키텍처를 소개했다. 기존 RAG 기반 AI 챗 도구는 단일 문서 질의응답에는 강하지만, 수백 개 계약서 전체를 합산·비교하는 질문에는 답하지 못하…

포지큐브, 하나은행에 AI 에이전트 서비스 구축
AI타임스 · 2026-09-28

포지큐브가 자체 멀티 에이전트 기반 AI 플랫폼 '로비 G 맥스'를 활용해 하나은행의 AI 에이전트 서비스를 구축했다고 28일 밝혔다. 로비 G 맥스는 자연어 기반 에이전트 워크플로우 구축, 사내 문서 기반 검색증강생성(RAG) 시스템, 맞춤형 서비스 설계, 할루시네이션 최소화, 정보 …

오픈AI, GPT-6 프롬프트 캐싱 강화로 비용·속도 개선
AI타임스 · 2026-09-25

오픈AI가 9월 22일(현지시간) GPT-6 제품군에 기본 캐시 적중률을 높인 향상된 프롬프트 캐싱 시스템을 출시했다. 코드베이스 리팩터링, 대규모 조사, 문서·프레젠테이션 제작처럼 여러 차례 API 요청이 이어지는 장시간 작업에서 반복되는 컨텍스트를 재사용해 응답 속도와 비용 효율을 …

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
프롬프트 캐싱
프롬프트 캐싱은 반복적으로 사용되는 긴 프롬프트의 앞부분(시스템 프롬프트, 도구 정의, 참고 문서 등)을 서버에 저장해 두었다가 이후 요청에서 재사용함으로써 응답 속도를 높이고 비용을 줄이는 기능을 말한다.
프롬프트
AI 모델에게 원하는 작업을 지시하기 위해 입력하는 텍스트를 말한다.
토큰
언어 모델이 텍스트를 처리할 때 사용하는 최소 단위로, 단어나 단어의 일부, 문장 부호 등을 가리키는 말이다.
정렬
AI 시스템의 행동과 산출물이 인간이 의도한 목표, 가치, 지시와 어긋나지 않도록 만드는 기법과 연구 분야를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

CIO Korea 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →