지연 시간
Latency · 중급
요청을 보낸 시점부터 응답을 받기까지 걸리는 시간을 말한다.
AI 서비스는 얼마나 많은 요청을 처리하는지(처리량)뿐 아니라 사용자가 응답을 얼마나 빨리 받는지가 경험을 좌우하기 때문에 지연 시간을 별도 지표로 관리한다. 전체 응답이 끝날 때까지 걸리는 시간과, 첫 토큰이 나오기까지 걸리는 시간(TTFT)을 구분해서 측정하며, 여기에는 네트워크 왕복 시간, 모델 추론 시간, 요청이 처리를 기다리는 큐잉 대기 시간이 모두 포함된다. 실무에서는 챗봇처럼 실시간 대화가 오가는 서비스를 설계할 때 스트리밍 응답을 도입해 체감 지연 시간을 줄이거나, 트래픽이 몰리는 시간대에 큐잉 지연이 급증하는 현상을 모니터링하고 대응하는 상황에서 이 지표를 확인한다. 흔한 오해는 평균 지연 시간만 보고 안심하는 것인데, 평균은 낮아도 일부 요청만 유독 느려지는 꼬리 지연 문제를 가릴 수 있어 p95·p99 같은 백분위수 지표를 함께 확인해야 한다.