거대 언어 모델
Large Language Model (LLM) · 입문
거대 언어 모델(LLM)은 방대한 양의 텍스트 데이터를 학습해 자연어를 이해하고 생성하는 대규모 인공지능 모델을 말한다.
기존의 규칙 기반이나 소규모 통계 모델은 문맥을 폭넓게 이해하거나 다양한 주제에 걸쳐 자연스러운 문장을 만들어내는 데 한계가 있었고, 이를 극복하기 위해 신경망의 크기와 학습 데이터를 크게 늘리는 방향으로 발전한 것이 거대 언어 모델이다. 트랜스포머라는 신경망 구조를 기반으로 문장 속 단어들 사이의 관계를 학습하며, 주어진 텍스트 다음에 올 단어를 예측하는 방식으로 훈련된 뒤 질문에 답하거나 글을 요약·번역·작성하는 등 다양한 작업에 활용된다. 실무에서는 챗봇이나 코드 어시스턴트를 만들 때, 문서 요약이나 정보 추출 파이프라인을 구축할 때, 혹은 사내 데이터에 맞게 특정 작업을 자동화하려 할 때 거대 언어 모델을 API나 오픈소스 형태로 가져와 프롬프트를 설계하거나 미세 조정하는 과정에서 마주치게 된다. 흔히 오해하는 점은 거대 언어 모델이 사실을 '검색'해서 답한다고 생각하는 것인데, 실제로는 학습된 패턴을 바탕으로 가장 그럴듯한 다음 단어를 예측하는 방식이라 사실과 다른 내용을 그럴듯하게 생성하는 환각 현상이 발생할 수 있다.
기초 분야의 다른 용어
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.