모델 698건 · 국산 131 · 가격 519 추적 중
용어집 · 안전

레드팀

Red Teaming · 고급

AI 모델이나 시스템을 실제 공격자의 관점에서 시험해 안전장치를 우회하거나 유해한 결과를 유도할 수 있는 취약점을 체계적으로 찾아내는 활동을 말한다.

모델을 정상적인 방식으로만 검증하면 탈옥, 유해 콘텐츠 생성, 개인정보 유출 같은 위험이 실제 배포 이후 악의적 사용자에 의해 드러날 수 있어, 배포 전에 공격자 시각에서 미리 결함을 찾아낼 필요가 생긴다. 사람 전문가나 별도의 평가용 모델이 프롬프트 인젝션, 역할극 설정, 우회적 표현, 점진적 유도 등 다양한 전략으로 시스템의 한계를 시험하고, 성공한 공격 사례를 분류해 재학습이나 안전 필터 보강에 반영하는 방식으로 진행된다. 신규 모델을 출시하기 전 안전성 평가 단계, 챗봇에 파일 업로드나 도구 호출 같은 새 기능을 추가할 때, 또는 규제 기관 제출용 안전 보고서를 준비할 때 레드팀 결과가 실무에서 요구된다. 한 번 레드팀 평가를 통과했다고 영구히 안전한 것은 아니며, 모델이나 프롬프트, 사용 맥락이 바뀔 때마다 반복해야 하는 지속적인 과정이라는 점을 흔히 놓친다.

안전 분야의 다른 용어

해석 가능성
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.