전문가 혼합
Mixture of Experts (MoE) · 중급
전문가 혼합(MoE)은 여러 개의 전문가 서브네트워크 중 입력에 따라 일부만 선택적으로 활성화해 연산하는 신경망 구조를 말한다.
모델 성능을 높이려면 보통 파라미터 수를 늘려야 하지만, 모든 파라미터를 매번 계산에 사용하면 연산량이 그만큼 커진다는 문제가 있다. MoE는 네트워크의 특정 층(주로 피드포워드 층)을 여러 개의 '전문가'로 나누고, 라우터라는 작은 네트워크가 입력마다 그중 일부 전문가만 골라 계산을 맡기는 방식으로 이 문제를 푼다. 그 결과 전체 파라미터 규모는 크게 유지하면서도 각 입력을 처리할 때 실제로 켜지는 파라미터 수는 일부로 줄일 수 있다. 실무에서는 대형 언어 모델의 아키텍처를 설명하는 문서나 논문에서 '희소(sparse) 모델'이라는 표현과 함께 자주 등장하며, 모델 카드에 총 파라미터 수와 활성 파라미터 수가 따로 표기된 경우 대부분 MoE 구조를 쓴다는 뜻이다. 흔한 오해는 MoE가 항상 추론을 빠르게 만든다고 생각하는 것인데, 활성 파라미터가 적어 연산량은 줄어도 전문가 전체를 메모리에 올려야 하므로 메모리 사용량은 오히려 크게 유지된다는 점을 주의해야 한다.