레드팀
Red Teaming · 고급
AI 모델이나 시스템을 실제 공격자의 관점에서 시험해 안전장치를 우회하거나 유해한 결과를 유도할 수 있는 취약점을 체계적으로 찾아내는 활동을 말한다.
모델을 정상적인 방식으로만 검증하면 탈옥, 유해 콘텐츠 생성, 개인정보 유출 같은 위험이 실제 배포 이후 악의적 사용자에 의해 드러날 수 있어, 배포 전에 공격자 시각에서 미리 결함을 찾아낼 필요가 생긴다. 사람 전문가나 별도의 평가용 모델이 프롬프트 인젝션, 역할극 설정, 우회적 표현, 점진적 유도 등 다양한 전략으로 시스템의 한계를 시험하고, 성공한 공격 사례를 분류해 재학습이나 안전 필터 보강에 반영하는 방식으로 진행된다. 신규 모델을 출시하기 전 안전성 평가 단계, 챗봇에 파일 업로드나 도구 호출 같은 새 기능을 추가할 때, 또는 규제 기관 제출용 안전 보고서를 준비할 때 레드팀 결과가 실무에서 요구된다. 한 번 레드팀 평가를 통과했다고 영구히 안전한 것은 아니며, 모델이나 프롬프트, 사용 맥락이 바뀔 때마다 반복해야 하는 지속적인 과정이라는 점을 흔히 놓친다.
함께 보기
프롬프트 인젝션신뢰할 수 없는 외부 입력에 악의적인 지시문을 숨겨 넣어, AI 모델이 원래 지침을 무시하고 공격자가 의도한 동작을 하도록 유도하는 공격 기법을 말한다.가드레일가드레일은 AI 모델이 유해하거나 부적절하거나 정책에 어긋나는 입력과 출력을 만들지 않도록 시스템 차원에서 걸어두는 제약과 점검 장치를 말한다.