레드팀
Red Teaming · 고급
AI 모델이나 시스템을 실제 공격자의 관점에서 시험해 안전장치를 우회하거나 유해한 결과를 유도할 수 있는 취약점을 체계적으로 찾아내는 활동을 말한다.
모델을 정상적인 방식으로만 검증하면 탈옥, 유해 콘텐츠 생성, 개인정보 유출 같은 위험이 실제 배포 이후 악의적 사용자에 의해 드러날 수 있어, 배포 전에 공격자 시각에서 미리 결함을 찾아낼 필요가 생긴다. 사람 전문가나 별도의 평가용 모델이 프롬프트 인젝션, 역할극 설정, 우회적 표현, 점진적 유도 등 다양한 전략으로 시스템의 한계를 시험하고, 성공한 공격 사례를 분류해 재학습이나 안전 필터 보강에 반영하는 방식으로 진행된다. 신규 모델을 출시하기 전 안전성 평가 단계, 챗봇에 파일 업로드나 도구 호출 같은 새 기능을 추가할 때, 또는 규제 기관 제출용 안전 보고서를 준비할 때 레드팀 결과가 실무에서 요구된다. 한 번 레드팀 평가를 통과했다고 영구히 안전한 것은 아니며, 모델이나 프롬프트, 사용 맥락이 바뀔 때마다 반복해야 하는 지속적인 과정이라는 점을 흔히 놓친다.
안전 분야의 다른 용어
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.