양자화
Quantization · 중급
모델의 가중치와 활성값을 32비트나 16비트 부동소수점 대신 더 적은 비트 수의 정수나 저정밀도 형식으로 표현해 모델 크기와 연산량을 줄이는 최적화 기법을 말한다.
대형 언어 모델은 파라미터 수가 많아 그대로 저장하고 연산하면 메모리와 연산 자원이 많이 필요한데, 양자화는 각 값이 갖는 정밀도를 낮춰 이 부담을 줄이는 방법이다. 원래 부동소수점 값들의 분포를 분석해 스케일과 영점을 정하고, 이를 기준으로 값을 정수 격자에 매핑한 뒤 연산 시점에 다시 근사 복원하는 방식으로 동작하며, 가중치만 낮추는 방식과 가중치·활성값을 함께 낮추는 방식이 있다. 실무에서는 서버 여러 대 대신 한 대의 GPU나 개인 PC, 모바일 기기에서 모델을 돌리고 싶을 때, 또는 추론 비용과 지연 시간을 줄여야 할 때 양자화된 모델을 선택하게 된다. 다만 비트 수를 지나치게 낮추면 특정 작업에서 정확도가 눈에 띄게 떨어질 수 있어, 압축률과 성능 저하 사이의 균형을 실험을 통해 확인해야 한다는 점을 흔히 놓친다.