모델 798건 · 국산 131 · 가격 640 추적 중
용어집 · 활용

스트리밍

Streaming · 중급

모델이 응답 전체를 다 만들 때까지 기다리지 않고, 생성되는 토큰을 그때그때 순서대로 전송하는 응답 방식을 말한다.

LLM은 긴 답변을 만드는 데 시간이 걸리는데, 생성이 끝난 뒤 한 번에 결과를 돌려주면 그동안 사용자는 빈 화면을 보며 기다려야 한다. 스트리밍은 이 대기 시간을 줄이기 위해, 모델이 토큰을 하나씩 만들어내는 즉시 그 조각을 클라이언트로 보내는 방식이다. 보통 서버는 이벤트 스트림(SSE) 형태로 토큰 조각을 순차 전송하고, 클라이언트는 받은 조각을 이어 붙여 마치 타이핑되듯 화면에 표시한다. 챗봇 UI에서 답변이 실시간으로 흘러나오는 화면이나, API 호출 시 스트리밍 옵션을 켜고 응답 조각을 순서대로 파싱하는 코드에서 실무자가 흔히 마주친다. 긴 코드나 문서를 생성할 때 전체 완료를 기다리지 않고 중간에 내용을 확인하거나 생성을 중단할 수 있다는 것도 실무적으로 중요한 이점이다. 다만 스트리밍은 전체 생성 시간 자체를 줄여주는 것이 아니라 첫 결과가 보이기까지의 체감 지연을 줄여주는 것이며, 함수 호출이나 구조화된 출력처럼 완성된 형태가 필요한 응답을 다룰 때는 조각난 데이터를 다시 조립하는 처리를 별도로 구현해야 한다는 점에 주의해야 한다.

함께 보기

활용 분야의 다른 용어

검색 증강 생성구조화 출력사고 사슬임베딩컨텍스트 엔지니어링퓨샷 학습프롬프트 캐싱