모델 797건 · 국산 131 · 가격 639 추적 중
용어집 · 안전

가드레일

Guardrails · 중급

가드레일은 AI 모델이 유해하거나 부적절하거나 정책에 어긋나는 입력과 출력을 만들지 않도록 시스템 차원에서 걸어두는 제약과 점검 장치를 말한다.

모델은 주어진 프롬프트에 따라 예측하기 어려운 답을 내놓을 수 있어서, 서비스에 배포하기 전에 개인정보 유출, 차별·폭력 조장, 잘못된 의료·법률 조언 같은 위험한 출력을 걸러낼 장치가 필요하다. 가드레일은 보통 여러 층으로 구성되는데, 입력 단계에서 유해 질의나 프롬프트 인젝션을 탐지하고, 시스템 프롬프트로 모델의 역할과 답변 범위를 제한하며, 출력이 나온 뒤에는 별도의 분류 모델이나 규칙 기반 필터로 다시 검사하고, 에이전트가 외부 도구나 시스템을 호출할 때는 실행 권한 자체를 제한하는 방식으로 작동한다. 실무에서는 고객 응대 챗봇이 회사 정책을 벗어난 발언을 하지 않도록 막을 때, 의료·금융처럼 규제가 엄격한 산업에서 민감한 주제에 대한 답변을 회피시킬 때, 또는 에이전트가 실제 데이터베이스나 파일 시스템에 접근하는 상황에서 위험한 명령을 사전에 차단할 때 가드레일을 설계하게 된다. 다만 가드레일을 한 번 설정해두면 영구히 안전하다고 오해하기 쉬운데, 이를 우회하려는 시도(탈옥)는 계속 새로운 방식으로 등장하므로 지속적인 레드팀 테스트와 업데이트가 뒤따라야 실효성이 유지된다.

함께 보기

안전 분야의 다른 용어

AI 음성 사기딥페이크레드팀프롬프트 인젝션해석 가능성