모델 698건 · 국산 131 · 가격 519 추적 중
용어집 · 학습

스케일링 법칙

Scaling Law · 고급

모델 파라미터 수, 학습 데이터 양, 연산량(컴퓨트)을 늘릴수록 손실(loss)이 일정한 규칙, 주로 멱법칙(power law)을 따라 예측 가능하게 줄어드는 경험적 관계를 말한다.

대규모 모델을 학습시키는 데는 막대한 자원이 들기 때문에, 실제로 학습을 돌려보기 전에 모델 크기·데이터 양·연산량을 어떻게 배분해야 성능이 가장 좋을지 미리 알아야 할 필요에서 이 개념이 나왔다. 작은 규모의 여러 모델을 다양한 파라미터 수와 데이터 양 조합으로 학습시켜 손실을 측정하면, 로그-로그 그래프 위에서 그 값들이 거의 직선을 이루는 추세가 관찰되며, 이 추세선을 연산량이 큰 영역까지 외삽해 특정 예산에서 기대할 수 있는 성능이나 최적의 모델 크기 대 데이터 양 비율을 추정한다. 실무에서는 조직이 다음 세대 모델을 본격적으로 학습시키기 전, 소규모 실험 결과로부터 예상 성능과 필요한 데이터·연산 규모를 산정해 학습 예산과 아키텍처를 결정하는 단계에서 이 개념을 근거로 삼는다. 흔한 오해는 스케일링 법칙을 불변의 물리 법칙처럼 여기는 것인데, 실제로는 특정 데이터 분포·아키텍처·학습 설정 아래서 관찰된 경험적 추세일 뿐이라 데이터 품질이 달라지거나 양질의 데이터가 고갈되는 등 조건이 바뀌면 곡선의 기울기가 꺾이거나 다른 형태로 바뀔 수 있다.

함께 보기

학습 분야의 다른 용어

LoRA모델 붕괴사전학습합성 데이터
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.