해석 가능성
Interpretability · 고급
인공지능 모델이 특정 입력에 대해 왜 그런 출력을 내놓았는지, 내부에서 어떤 계산과 표현이 일어나는지를 사람이 이해할 수 있는 형태로 설명하는 연구 분야를 말한다.
대형 신경망은 수많은 파라미터로 이루어진 블랙박스여서, 정확한 답을 내더라도 그 근거를 알 수 없으면 오작동이나 편향, 기만적 행동을 사전에 발견하기 어렵다. 이 때문에 뉴런이나 어텐션 헤드가 어떤 개념에 반응하는지 분석하는 방법, 희소 오토인코더로 내부 표현을 사람이 읽을 수 있는 특징으로 분해하는 기계적 해석 가능성 기법, 입력의 각 요소가 출력에 얼마나 기여했는지 계산하는 귀속 방법 등이 쓰인다. 실무에서는 모델이 학습 과정에서 유해하거나 편향된 표현을 내부에 갖게 되었는지 점검할 때, 특정 뉴런이나 회로를 조작해 모델 행동을 통제할 수 있는지 실험할 때, 배포 전 모델이 사용자를 속이거나 숨겨진 목표를 추구하는 징후가 있는지 감사할 때 이 접근이 활용된다. 다만 특정 뉴런이나 특징에 그럴듯한 이름을 붙였다고 해서 그것이 모델의 실제 내부 메커니즘과 정확히 일치한다고 단정할 수는 없으며, 이는 해석 가능성 연구에서 흔히 지적되는 한계다.