멀티모달
Multimodal · 입문
텍스트뿐 아니라 이미지, 음성, 영상 등 여러 종류의 데이터를 함께 이해하거나 생성할 수 있는 AI 모델의 특성을 말한다.
초기 AI 모델은 대부분 한 가지 형태의 데이터만 다뤘다. 텍스트 모델은 글만, 이미지 모델은 그림만 처리하는 식이어서, 사진을 보고 설명하거나 그래프를 읽고 답하는 것 같은 작업은 여러 모델을 따로 조합해야 했다. 멀티모달 모델은 서로 다른 종류의 데이터를 하나의 모델 안에서 함께 학습해, 이미지와 텍스트를 동시에 입력받아 그 관계를 이해하고 답을 내놓을 수 있다. 실무에서는 스크린샷을 첨부해 오류를 물어보거나, 표나 차트가 담긴 문서를 업로드해 내용을 요약시키거나, 손으로 그린 스케치를 보여주고 코드를 생성시키는 상황에서 이 기능을 쓰게 된다. 다만 모델마다 지원하는 입력 형태(이미지, 음성, 영상 등)와 처리 방식이 다르므로, 모든 멀티모달 모델이 같은 종류의 데이터를 똑같이 다룰 수 있는 것은 아니라는 점에 주의해야 한다.
함께 보기
프롬프트AI 모델에게 원하는 작업을 지시하기 위해 입력하는 텍스트를 말한다.파인튜닝사전 학습된 대규모 언어 모델을 특정 작업이나 도메인의 데이터로 추가 학습시켜 성능과 응답 방식을 맞춤화하는 과정을 말한다.파운데이션 모델대규모 데이터로 미리 학습되어 다양한 하위 작업에 재사용할 수 있는 범용 인공지능 모델을 말한다.