모델 798건 · 국산 131 · 가격 640 추적 중
용어집 · 안전

프롬프트 인젝션

Prompt Injection · 중급

신뢰할 수 없는 외부 입력에 악의적인 지시문을 숨겨 넣어, AI 모델이 원래 지침을 무시하고 공격자가 의도한 동작을 하도록 유도하는 공격 기법을 말한다.

LLM은 시스템 프롬프트, 사용자 입력, 외부에서 가져온 텍스트를 명확히 구분하지 않고 하나의 문맥으로 처리하기 때문에, 신뢰할 수 없는 텍스트에 지시문이 섞여 있으면 모델이 이를 정상 명령으로 착각하고 따르는 취약점이 생긴다. 공격자는 웹페이지, 이메일, 문서, 검색 결과처럼 모델이 참고할 만한 콘텐츠 안에 눈에 띄지 않는 명령을 심어두고, 모델이 그 콘텐츠를 읽는 시점에 원래 임무 대신 삽입된 명령을 실행하도록 만든다. 실무에서는 웹 브라우징이나 문서 요약 기능이 있는 에이전트가 악성 페이지를 읽다가 사용자 몰래 민감한 정보를 외부로 전송하려 하거나, 이메일 비서가 첨부 파일 속 숨은 문구에 따라 내용을 유출하는 형태로 드러난다. 도구 호출 권한이나 외부 데이터 접근 권한을 가진 에이전트일수록 피해 범위가 커지므로, RAG나 플러그인 연동 기능을 추가할 때 입력 검증과 권한 분리를 함께 설계해야 한다. 흔히 탈옥(jailbreak)과 혼동되는데, 탈옥은 사용자 본인이 모델의 안전장치를 직접 우회하려는 시도인 반면 프롬프트 인젝션은 제3자가 신뢰할 수 없는 데이터 경로를 통해 명령을 몰래 주입한다는 점에서 다르다.

함께 보기

안전 분야의 다른 용어

AI 음성 사기가드레일딥페이크레드팀해석 가능성