정렬
Alignment · 고급
AI 시스템의 행동과 산출물이 인간이 의도한 목표, 가치, 지시와 어긋나지 않도록 만드는 기법과 연구 분야를 말한다.
대규모 언어모델은 방대한 텍스트에서 다음 토큰을 예측하도록 학습되므로, 그렇게 얻어진 능력이 사용자가 실제로 원하는 방식으로 쓰이리라는 보장은 없다. 유해한 답변, 편향된 판단, 지시 무시, 혹은 겉으로만 그럴듯한 거짓 답변 같은 문제를 줄이기 위해 별도의 조정 단계가 필요해졌다. 실무에서는 인간 피드백 기반 강화학습(RLHF), 헌법적 AI처럼 원칙 문서를 기준으로 모델 스스로 답을 수정하게 하는 기법, 지시 튜닝 등을 결합해 유용성과 정직성, 무해성을 함께 끌어올리는 방식으로 구현된다. 챗봇을 서비스에 배포하기 전 레드티밍으로 탈옥(jailbreak) 시도나 프롬프트 인젝션에 대한 반응을 점검하거나, 모델이 사용자의 명시적 지시와 학습 과정에서 내재화된 다른 목표 사이에서 상충할 때 어떤 쪽을 우선하는지 평가하는 작업이 모두 정렬 작업에 해당한다. 흔히 오해하듯 정렬은 출시 전 한 번의 학습 단계로 끝나는 것이 아니라 배포 후에도 새로운 실패 사례를 발견하고 반영하는 지속적 과정이며, 특정 벤치마크에서 안전하다고 평가된 모델이라도 모든 상황에서 완벽히 정렬되었다는 뜻은 아니다.
함께 보기
헌법적 AI사람이 응답마다 선호를 직접 라벨링하는 대신, 미리 정한 원칙(헌법) 집합을 기준으로 AI가 스스로 자기 응답을 비판하고 수정하도록 훈련하여 정렬시키는 기법을 말한다.환각AI 모델이 사실이 아니거나 근거 없는 정보를 마치 사실인 것처럼 자신 있게 생성하는 현상을 말한다.
정렬 분야의 다른 용어
모델별 가격·컨텍스트 길이 같은 수치는 이 글에 쓰지 않습니다. 모델 카탈로그에서 출처와 확인일이 붙은 값만 보여줍니다.