모델 801건 · 국산 131 · 가격 643 추적 중
용어집 · 인프라

GPU 메모리

GPU Memory (VRAM) · 고급

GPU 메모리(VRAM)는 그래픽 처리 장치에 탑재되어 모델 가중치, 활성화 값, 중간 연산 결과 등을 저장하는 고속 전용 메모리를 말한다.

딥러닝 모델은 학습과 추론 과정에서 대량의 파라미터와 중간 텐서를 끊임없이 읽고 써야 하는데, 일반 시스템 메모리는 GPU와의 전송 대역폭이 낮아 병목이 되므로 GPU 연산 유닛 바로 옆에 붙은 고대역폭 전용 메모리가 필요하다. VRAM은 모델 가중치, 옵티마이저 상태, 배치 단위 활성화 값, KV 캐시 등을 담아 GPU가 매우 빠르게 접근하도록 해주며, 필요한 데이터가 VRAM 용량을 넘으면 일부를 시스템 메모리나 디스크로 내리는 오프로딩이 일어나 처리 속도가 크게 떨어진다. 실무에서는 모델을 서빙하다가 OOM(Out of Memory) 오류를 만나거나, 배치 크기나 컨텍스트 길이를 늘렸을 때 VRAM 부족으로 추론이 실패하는 상황, 또는 여러 GPU에 모델을 나누는 텐서 병렬화·모델 병렬화를 설계할 때 VRAM 용량이 핵심 제약으로 작용하는 경우에 자주 마주친다. VRAM 용량만 크면 성능이 무조건 좋아진다고 오해하기 쉽지만, 실제 처리 속도는 메모리 대역폭과 GPU 연산 성능이 함께 맞물려 결정되며, 양자화나 KV 캐시 압축처럼 VRAM 사용량 자체를 줄이는 기법도 중요한 최적화 수단이다.

함께 보기

인프라 분야의 다른 용어

NPU모델 서빙텐서 병렬화