Beyond RLHF: A Unified Theoretical Framework of Alignment
본 논문은 LLM 정렬을 쌍별 선호도 기반의 분포 학습으로 재해석하여 강력한 비점근적 수렴 보장을 제공하는 세 가지 원칙적 목적 함수를 도출하고, RLHF 에 대한 엄밀한 정당성을 제시하며, 가능도 기반 접근법보다 온-정책 방법의 경험적 우월성을 설명하는 통합 이론적 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 재능이 있지만 약간 혼란스러운 학생 (대규모 언어 모델, 또는 LLM) 이 있다고 상상해 보세요. 이 학생은 많은 사실을 알고 있지만, 항상 도움이 되거나, 정중하거나, 안전하도록 행동하는 방법을 아는 것은 아닙니다. 당신은 이 학생을 "좋은" 학생으로 가르치고 싶습니다.
오랫동안 이를 수행하는 표준 방식은 RLHF(Human Feedback 기반 강화 학습) 였습니다. 이는 매 답변마다 점수 ("보상") 를 부여하는 엄격한 교사를 고용하는 것과 같습니다. 학생은 교사가 원하는 것을 추측하고, 가장 높은 점수를 받기 위해 답변을 조정하려 합니다.
문제점:
이 논문의 저자들은 이 "점수 기반" 방식이 작동은 하지만, 수학적 관점에서 왜 작동하는지는 아무도 정확히 알지 못한다고 주장합니다. 소금이 왜 음식을 더 맛있게 만드는지 그 화학적 원리를 모른 채 "맛이 좋을 때까지 소금을 넣으세요"라고 적힌 레시피를 따르는 것과 같습니다. 또한, 레시피를 너무 많이 수정하면 학생이 너무 경직되어 (지루해지거나) 혹은 터무니없는 말로 무너질 수 있습니다.
새로운 아이디어:
저자들은 문제를 바라보는 새로운 방식을 제안합니다. "점수"나 "보상"을 생각하는 대신, 선호도의 지도를 학습해야 한다고 제안합니다.
완벽한 답변을 하는 "완벽한 학생"(목표 모델) 이 있다고 상상해 보세요. 당신은 이 완벽한 학생을 직접 볼 수는 없지만, 두 가지 답변을 비교할 때 그들의 선택은 볼 수 있습니다.
- 상황: 완벽한 학생에게 A 와 B 두 가지 답변을 보여줍니다.
- 관찰: 완벽한 학생은 A 를 선택합니다.
- 논문의 통찰: 저자들은 완벽한 학생이 A 를 선택하는 것은 단순히 A 를 B 보다 생성할 확률이 더 높기 때문이라고 가정합니다. 그들은 결정을 내리기 위해 "점수"가 필요하지 않으며, 그저 자신의 내부 확률을 따를 뿐입니다.
이 간단한 가정을 통해 그들은 학생을 훈련시키는 세 가지 새로운 방법을 유도했는데, 이를 PMLE, Preference Distillation(선호도 증류), Reverse KL이라고 부릅니다.
세 가지 새로운 방법 (레시피)
PMLE("투표" 방식):
- 유사성: 완벽한 학생의 마음을 수천 개의 투표를 통해 추측한다고 상상해 보세요. 완벽한 학생이 90% 의 확률로 B 대신 "A"를 투표했다면, 당신의 학생은 90% 의 확률로 "A"라고 말하도록 배워야 합니다.
- 작동 원리: 중개자 역할을 하는 "점수" 없이 완벽한 학생의 선택 확률을 직접 맞추려 합니다. 로봇이 쓴 문법책을 읽는 대신 원어민을 듣고 언어를 배우는 것과 같습니다.
Preference Distillation("번역가" 방식):
- 유사성: 때로는 완벽한 학생에게 직접 배우기 어렵습니다. 그래서 완벽한 학생의 마음을 읽고 그들이 선호하는 것을 요약해 쓰는 "번역가"(더 작고 간단한 모델) 를 고용합니다. 그런 다음 당신의 학생은 번역가의 요약본에서 배웁니다.
- 작동 원리: 먼저 선호도를 추측하도록 작은 모델을 훈련시킵니다. 그런 다음 주요 학생이 그 선호도를 모방하도록 가르칩니다. 이는 원시 투표 데이터에서 직접 배우는 것보다 빠르고 종종 더 안정적입니다.
Reverse KL("교정" 방식):
- 유사성: 이것이 이 논문의 큰 "아하!" 순간입니다. 그들은 오래된 "점수 기반" 방식 (RLHF) 이 실제로는 이 새로운 방식의 약간 결함이 있는 버전임을 깨달았습니다.
- 해결책: 오래된 방식에는 결함이 있었습니다. 데이터에서 너무 많이 배우려고 하면, 학생은 자연스럽게 말하는 법을 잊고 로봇이 되어버렸습니다. 새로운 방식은 학생이 선호도를 배우면서도 창의적이고 자연스럽게 남도록 강제하는 "안전망"(엔트로피 항) 을 추가합니다. 이는 학생에게 "완벽한 학생이 하는 일을 하되, 자신의 개성을 잃지 마라"라고 말하는 것과 같습니다.
왜 이것이 중요한가 (결과)
저자들은 단순히 방정식을 쓴 것이 아니라, 이러한 새로운 방법들이 더 많은 데이터를 제공할수록 개선될 수 있음이 수학적으로 보장됨을 증명했습니다.
- "수렴" 약속: 그들은 학생에게 더 많은 예시를 보여줄수록, 학생의 답변이 수학적으로 완벽한 학생의 답변으로 수렴함을 증명했습니다. 오래된 방법들은 이러한 보장이 없었으며, 그저 "희망"에 의존했을 뿐입니다.
- 딜레마 해결: 오래된 방식 (RLHF) 은 딜레마가 있었습니다. 많이 배우려고 하면 학생이 퇴화하여 (터무니없게) 되고, 안전을 지키려고 하면 학생이 충분히 배우지 못했습니다. 새로운 "Reverse KL" 방식은 이를 수정하여 학생이 정신을 잃지 않고 깊이 학습할 수 있게 합니다.
- 실제 테스트: 텍스트 요약 및 채팅 대화를 수행할 때 이러한 방법들을 테스트한 결과, 새로운 방법들은 오래된 "금표준" 방법들과同等하거나 더 나은 성능을 보였습니다.
결론
이 논문은 유명한 자동차 (RLHF) 의 엔진이 작동은 하지만 그 뒤에 있는 물리학을 알지 못하는 정비공이 깨닫는 것과 같습니다. 그들은 엔진을 역설계하여 누락된 볼트 (확률론적 가정) 를 찾고, 더 신뢰할 수 있는 세 가지 새로운 엔진을 구축합니다.
그들은 오래된 "점수" 시스템이 실제로는 인간이 선호하는 분포를 자연스럽게 학습하려는 어색한 시도였음을 발견했습니다. 수학을 수정함으로써 그들은 훈련 과정을 더 안정적이고, 이론적으로 타당하며, 실제에서도 동일하게 효과적으로 만들었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.