← 최신 논문
💬 NLP

Offline Preference Optimization via Maximum Marginal Likelihood Estimation

이 논문은 한계 로그 가능도(marginal log-likelihood)를 최대화함으로써 명시적인 보상 모델의 필요성을 제거하고 정렬 품질과 일반 능력 보존 측면에서 베이스라인을 능가하는, 대규모 언어 모델을 인간의 선호도에 정렬시키기 위한 안정적이고 단순화된 오프라인 선호도 최적화 방법인 MMPO를 소개한다.

원저자: Saeed Najafi, Alona Fyshe

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Saeed Najafi, Alona Fyshe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 로봇에게 "예의"를 가르치는 법

당신에게 인터넷에 있는 거의 모든 것을 읽은 매우 똑똑한 로봇(거대 언어 모델)이 있다고 상상해 보세요. 이 로봇은 이야기를 쓰고, 수학 문제를 풀고, 질문에 답할 수 있습니다. 하지만 이 로봇은 마치 천재적이지만 제멋대로인 십 대와 같습니다. 말하는 법은 알지만, 인간이 실제로 무엇을 듣고 싶어 하는지는 항상 알지 못합니다. 때로는 무례하고, 때로는 혼란스러우며, 때로는 그냥 지어내기도 합니다.

이를 해결하기 위해, 우리는 로봇을 인간의 선호도에 "정렬(align)"시켜야 합니다. 현재 이 작업을 수행하는 표준적인 방법은 RLHF(인간 피드백으로부터의 강화 학습)라고 불립니다. 이것은 로봇을 지켜보며 좋은 답변에는 점수를 주고 나쁜 답변에는 점수를 깎는 엄격한 코치를 고용하는 것과 같습니다. 하지만 이 과정은 번거롭고 비용이 많이 들며, 로봇은 코치의 일관성 없는 규칙 때문에 종종 혼란을 겪습니다.

최근에는 DPO라는 더 단순한 방법이 발명되었습니다. 이것은 코치를 건너뛰고 로봇에게 두 가지 답변(하나의 좋은 답변과 하나의 나쁜 답변)을 보여준 뒤, "좋은 것을 골라봐"라고 말하는 것과 같습니다. 이 방법은 더 효과적이지만, 여전히 몇 가지 특이한 점이 있고 설정을 너무 많이 조정하면 불안정해질 수 있습니다.

이 논문은 MMPO라는 새로운 방법을 소개합니다. 저자들은 이렇게 말합니다. "완전히 다른 각도에서 접근해 봅시다." 로봇에게 승자를 고르는 법을 가르치는 대신, 그들은 이 문제를 주변 가능도(marginal likelihood) 추정 문제로 취급합니다.

핵심 아이디어: "최선의 추측" 게임

MMPO를 이해하기 위해, 당신이 미스터리 소설의 결말을 추측하려고 한다고 상상해 보세요. 당신은 도입부(프롬프트)를 알고 있고, 두 가지 가능한 결말을 가지고 있습니다:

  1. 좋은 결말: 인간이 선호하는 결말.
  2. 나쁜 결말: 인간이 싫어하는 결말.

기존 방식 (DPO/RLHF):
기존 방식은 "뜨겁다/차갑다(Hot and Cold)" 게임과 같습니다. 좋은 결말에 대한 점수와 나쁜 결말에 대한 점수를 계산한 다음, 좋은 결말의 점수는 높이고 나쁜 결말의 점수는 낮추려고 시도합니다. 이것은 마치 시소의 균형을 맞추려는 것과 같습니다. 한쪽을 너무 세게 밀면 전체가 뒤집혀 버립니다(불안정성).

새로운 방식 (MMPO):
저자들은 **최대 주변 가능도(Maximum Marginal Likelihood, MML)**에 기반한 다른 접근 방식을 제안합니다.

당신이 탐정이 되어, 단 몇 가지 단서(당신이 보고 있는 두 가지 결말)만 주어졌을 때, 특정 "좋은 결말"이 이야기의 진짜 결말일 가능성이 얼마나 되는지 알아내려고 한다고 상상해 보세요.

두 결말을 직접적으로 비교하는 대신, MMPO는 다음과 같이 묻습니다: "만약 이 이야기가 끝날 수 있는 모든 가능한 방식들을 살펴본다면, '좋은 결말'이 실제로 일어난 결말일 확률은 얼마나 될까?"

이를 위해, 수학적 계산은 두 가지 결말 모두를 그 가능성을 추정하기 위한 "샘플"(단서)로 사용합니다.

  • 별도의 "코치"(보상 모델)가 무엇이 좋은지 알려줄 필요가 없습니다.
  • 단순히 "창의적"이 되도록 로봇에게 강요(엔트로피 극대화)할 필요도 없습니다.

마법의 기술: 코치 없이 작동하는 법

이 논문은 이 "최선의 추측" 수학을 사용함으로써, 로봇이 명시적으로 지시받지 않아도 암묵적으로 좋은 답변을 선호하도록 배운다고 주장합니다.

여기 비유가 있습니다:
당신이 강아지에게 "앉아"를 가르치고 있다고 상상해 보세요.

  • RLHF: 훈련사가 클릭커와 간식을 가지고 있습니다. 강아지가 앉으면 클릭 소리를 내고, 앉지 않으면 소리를 내지 않습니다.
  • DPO: 강아지에게 앉아 있는 사진과 서 있는 사진을 보여주며, "나는 앉아 있는 사진이 더 좋아"라고 말합니다.
  • MMPO: 당신은 단순히 "앉아 있는" 사진을 보고, 당신이 가진 증거를 바탕으로 이것이 올바른 행동일 확률을 계산합니다.

논문은 이 계산을 수행할 때, 수학이 자연스럽게 로봇이 "좋은 결말"을 더 자주 선택하도록 유도한다는 것을 수학적으로 증명합니다. 이는 수학 자체가 보상 시스템 역할을 하는 것과 같습니다. 로봇은 좋은 답변의 확률을 높이고 나쁜 답변의 확률을 약간 낮추는 과정을 하나의 매끄러운 움직임 속에서 학습합니다.

왜 더 나은가? (결과)

저자들은 다양한 크기의 로봇(작은 "장난감" 로봇부터 거대한 "두뇌형" 로봇까지)을 대상으로 테스트했습니다. 결과는 다음과 같습니다:

  1. 더 안정적입니다:
    라디오 튜닝을 생각해보세요. 기존 방식(DPO)에서는 다이얼( β\beta 라고 불리는 설정값)을 아주 조금만 돌려도 음악이 잡음으로 변하거나 끊길 수 있습니다. 하지만 MMPO를 사용하면, 다이얼을 어떻게 돌리더라도 라디오 소리가 깨끗하게 유지됩니다. 학습을 "망가뜨리기가" 훨씬 어렵습니다.

  2. 로봇의 지능을 유지합니다:
    때때로 로봇에게 예의를 가르치다 보면, 로봇이 수학을 풀거나 농담을 하는 법을 잊어버리기도 합니다. 로봇이 안전하지만 지루한 "예스맨"이 되어버리는 것입니다.
    논문은 MMPO가 로봇의 원래 지능을 유지하는 데 더 뛰어나다는 것을 보여줍니다. 로봇은 범용 어시스턴트로서의 능력을 잃지 않으면서도 예의 바르게 되는 법을 배웁니다.

  3. 더 자주 승리합니다:
    그들이 새로운 방식을 기존 방식들과 경쟁(AlpacaEval)시켰을 때, MMPO는 특히 작고 효율적인 모델에서 일관되게 1위를 차지하거나 공동 1위를 기록했습니다.

"비법 소스" 재료들

논문은 이 레시피에서 어떤 부분이 필수적이었는지 확인하기 위해 실험을 진행했습니다. 그들은 마법을 가능하게 만든 두 가지 핵심 재료를 발견했습니다:

  • 인배치 정규화(In-Batch Normalization): 이것은 교실의 모든 학생이 동일한 기준으로 성적을 받도록 하는 것과 같습니다. 한 학생은 A+를 받고 다른 학생은 F를 받는다면, 교사는 비교가 공정하도록 점수를 조정합니다. 이는 하나의 이상한 예시가 전체 수업을 망치는 것을 방지합니다.
  • "추가적인" 엔트로피 없음: 그들은 로봇에게 "다양성"을 강요하는 것(엔트로피 극대화)이 오히려 성능을 떨어뜨린다는 것을 발견했습니다. 그들은 수학이 자연스럽게 작동하도록 내버려 두었습니다.

요요약

요컨대, 이 논문은 다음과 같이 말합니다: "로봇에게 인간이 무엇을 좋아하는지 가르치기 위해 복잡한 보상 시스템을 구축하려고 애쓰지 마세요. 대신, 인간의 선호도를 '단서'로 취급하는 간단한 통계적 기법을 사용하세요. 이 기법은 자연스럽게 로봇이 도움이 되도록 가르치며, 안정성을 유지하고, 로봇이 똑똑함을 잊지 않도록 보장합니다."

그들은 이 새로운 방법을 MMPO(최대 주변 가능도 선호도 최적화)라고 부르며, 이것이 AI를 인간의 가치에 정렬시키는 더 단순하고 신뢰할 수 있는 방법이라고 믿습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →