비전 언어 모델
Vision-Language Model (VLM) · 중급
이미지, 영상 등 시각 정보와 텍스트를 함께 입력받아 이해하고 자연어로 응답을 생성하는 인공지능 모델을 말한다.
텍스트만 다루는 언어 모델은 그래프, 사진, 화면 캡처처럼 시각 정보가 담긴 질문에 답할 수 없다는 한계가 있었고, 이를 해결하기 위해 이미지 인식 능력과 언어 생성 능력을 하나의 모델로 결합한 것이 비전 언어 모델이다. 보통 이미지를 벡터로 변환하는 비전 인코더와 텍스트를 처리하는 언어 모델을 연결하는 구조로 동작하며, 두 모달리티의 표현을 정렬하는 학습 과정을 거쳐 이미지 속 내용을 언어 모델이 이해할 수 있는 형태로 넘겨준다. 실무에서는 스크린샷을 보고 UI 버그를 설명하게 하거나, 문서 이미지에서 표와 수치를 추출하거나, 차트를 해석해 요약하는 작업, 제품 사진을 보고 상세 설명을 자동 생성하는 작업 등에 활용된다. 또한 웹페이지 화면을 인식해 클릭할 요소를 판단하는 컴퓨터 사용 에이전트의 기반 기술로도 쓰인다. 다만 이미지 속 미세한 텍스트나 정확한 개수 세기, 공간적 위치 관계 파악에서는 여전히 오류를 낼 수 있으므로, 정밀한 판독이 필요한 작업에는 결과를 그대로 신뢰하기보다 검증 절차를 거치는 것이 좋다.