모델 698건 · 국산 131 · 가격 519 추적 중
용어집 · 학습

사전학습

Pretraining · 고급

사전학습은 특정 작업에 맞춰 조정되기 전에, 대량의 텍스트나 데이터로부터 언어와 세계에 대한 일반적인 패턴을 모델이 스스로 학습하는 과정을 말한다.

작업마다 모델을 처음부터 학습시키려면 방대한 양의 레이블된 데이터와 연산 자원이 필요한데, 사전학습은 레이블 없는 대규모 텍스트에서 문법, 사실 지식, 문맥 추론 패턴을 먼저 익혀 이 부담을 크게 줄여준다. 다음 단어를 예측하거나 가려진 부분을 맞히는 등 자기지도학습 방식의 목표를 통해 코퍼스를 반복 학습하며, 이 과정에서 모델 가중치에 언어와 세계에 대한 일반적 표현이 형성된다. 이렇게 만들어진 모델을 파운데이션 모델이라 부르고, 이후 특정 도메인이나 작업에 맞춰 파인튜닝하거나 프롬프트만으로 활용하는 것이 실무에서 훨씬 흔한 흐름이다. 새 모델을 밑바닥부터 설계할 일은 드물지만, 어떤 데이터로 무엇을 사전학습했는지를 파악하는 것은 모델의 능력과 한계를 가늠하는 출발점이 되므로 모델 선택이나 문제 진단 과정에서 자주 마주치게 된다. 흔한 오해는 사전학습이 끝났으니 모델이 항상 최신 정보를 알고 있으리라 생각하는 것인데, 실제로는 학습에 사용된 데이터의 시점과 범위에 따라 지식의 경계가 존재한다.

함께 보기

학습 분야의 다른 용어

LoRA모델 붕괴스케일링 법칙합성 데이터
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.