모델 698건 · 국산 131 · 가격 519 추적 중
용어집 · 기초

멀티모달

Multimodal · 입문

텍스트뿐 아니라 이미지, 음성, 영상 등 여러 종류의 데이터를 함께 이해하거나 생성할 수 있는 AI 모델의 특성을 말한다.

초기 AI 모델은 대부분 한 가지 형태의 데이터만 다뤘다. 텍스트 모델은 글만, 이미지 모델은 그림만 처리하는 식이어서, 사진을 보고 설명하거나 그래프를 읽고 답하는 것 같은 작업은 여러 모델을 따로 조합해야 했다. 멀티모달 모델은 서로 다른 종류의 데이터를 하나의 모델 안에서 함께 학습해, 이미지와 텍스트를 동시에 입력받아 그 관계를 이해하고 답을 내놓을 수 있다. 실무에서는 스크린샷을 첨부해 오류를 물어보거나, 표나 차트가 담긴 문서를 업로드해 내용을 요약시키거나, 손으로 그린 스케치를 보여주고 코드를 생성시키는 상황에서 이 기능을 쓰게 된다. 다만 모델마다 지원하는 입력 형태(이미지, 음성, 영상 등)와 처리 방식이 다르므로, 모든 멀티모달 모델이 같은 종류의 데이터를 똑같이 다룰 수 있는 것은 아니라는 점에 주의해야 한다.

함께 보기

기초 분야의 다른 용어

API거대 언어 모델레이트 리밋생성형 AI시스템 프롬프트오픈 웨이트온도챗봇
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.