모델 698건 · 국산 131 · 가격 519 추적 중
용어집 · 안전

해석 가능성

Interpretability · 고급

인공지능 모델이 특정 입력에 대해 왜 그런 출력을 내놓았는지, 내부에서 어떤 계산과 표현이 일어나는지를 사람이 이해할 수 있는 형태로 설명하는 연구 분야를 말한다.

대형 신경망은 수많은 파라미터로 이루어진 블랙박스여서, 정확한 답을 내더라도 그 근거를 알 수 없으면 오작동이나 편향, 기만적 행동을 사전에 발견하기 어렵다. 이 때문에 뉴런이나 어텐션 헤드가 어떤 개념에 반응하는지 분석하는 방법, 희소 오토인코더로 내부 표현을 사람이 읽을 수 있는 특징으로 분해하는 기계적 해석 가능성 기법, 입력의 각 요소가 출력에 얼마나 기여했는지 계산하는 귀속 방법 등이 쓰인다. 실무에서는 모델이 학습 과정에서 유해하거나 편향된 표현을 내부에 갖게 되었는지 점검할 때, 특정 뉴런이나 회로를 조작해 모델 행동을 통제할 수 있는지 실험할 때, 배포 전 모델이 사용자를 속이거나 숨겨진 목표를 추구하는 징후가 있는지 감사할 때 이 접근이 활용된다. 다만 특정 뉴런이나 특징에 그럴듯한 이름을 붙였다고 해서 그것이 모델의 실제 내부 메커니즘과 정확히 일치한다고 단정할 수는 없으며, 이는 해석 가능성 연구에서 흔히 지적되는 한계다.

안전 분야의 다른 용어

레드팀
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.