← 최신 논문
💬 NLP

When Are Two RLHF Objectives the Same?

이 논문은 RLHF 선호 목적 함수들의 대수적 동등성을 결정하는 정규화 알고리즘인 Opal을 소개하며, 이를 통해 널리 사용되는 많은 방법들이 실제로는 동일한 근본적 목표의 재매개변수화임을 밝히고 진정으로 구별되는 목적을 만들어내는 구체적인 구조적 메커니즘을 식별한다.

원저자: Madhava Gaikwad

게시일 2026-02-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Madhava Gaikwad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 새로운 요리의 레시피를 완벽하게 만들기 위해 노력하는 셰프라고 상상해 보세요. 지난 몇 년 동안 수백 명의 다른 셰프들이 자신만의 "개선된" 버전의 레시피를 발표했습니다. 어떤 이들은 향신료를 바꿨다고 하고, 어떤 이들은 조리 온도를 미세하게 조정했다고 하며, 또 어떤 이들은 재료를 섞는 완전히 새로운 방법을 발명했다고 주장합니다.

여기 큰 질문이 있습니다: 이것들은 실제로 서로 다른 레시피일까요, 아니면 그저 이름만 바꾼 똑같은 요리일까요?

이 논문은 바로 그 질문에 답하기 위해 Opal(이것을 "레시피 번역기" 또는 "풍미 지문 스캐너"라고 생각하세요)이라는 도구를 소개합니다. 이 도구는 RLHF(인간 피드백으로부터의 강화 학습)라고 알려진 AI 훈련 방법들을 대상으로 합니다.

다음은 이 논문이 발견한 내용을 쉬운 비유를 사용하여 정리한 내용입니다:

1. 문제점: 이름은 다르지만 맛은 같다

AI의 세계에서 연구자들은 AI 모델이 인간의 선호도를 따르도록 가르치는 수십 가지의 다양한 방법들을 제안해 왔습니다. 그들은 DPO, SPPO, SimPO, GRPO와 같은 화려한 이름을 붙여줍니다. 각 논문은 자신들의 방법이 "획기적"이거나 "확연히 더 나은" 것이라고 주장합니다.

저자들은 궁금했습니다: 이것들이 정말로 서로 다른 수학적 목표일까요, 아니면 그저 다른 언어로 쓰인 똑같은 목표일까요?

2. 해결책: Opal (번역기)

저자들은 Opal이라는 알고리즘을 만들었습니다. Opal은 두 가지 서로 다른 레시피(수학 공식)를 가져와서 하나의 표준적인 "정형(canonical)" 언어로 번역하려고 시도하는 기계라고 생각하면 됩니다.

  • 만약 레시피들이 정확히 같은 표준 언어로 번역된다면: Opal은 "이것들은 같습니다"라고 말합니다. 그리고 그들에게 동일한 "지문"(해시 코드)을 부여합니다.
  • 만약 동일한 언어로 번st될 수 없다면: Opal은 "증거물(witness)"을 생성합니다. 이것은 왜 그들이 다른지를 보여주는 구체적인 예시와 같습니다. 예를 들어, "레시 Recipe A에서는 소금을 넣으면 짠맛이 납니다. 하지만 Recipe B에서는 냄비에 무엇이 들어있느냐에 따라 소금을 넣었을 때 단맛이 날 수도 있습니다."와 같은 식입니다.

3. 주요 발견: 많은 "새로운" 방법들이 사실 변장한 옛날 방식이다

저자들이 33가지 서로 다른 방법에 대해 Opal을 실행했을 때, 놀라운 사실을 발견했습니다:

  • "DPO" 패밀리: SPPO나 Nash-MD를 포함한 10가지 방법이 유명한 DPO 방식과 대수적으로 동일함이 드러났습니다.

    • 비유: 이것은 누군가 "열상 전이(Thermal Phase Transition)"라고 부르며 물을 끓이는 새로운 방법을 발명했다고 주장하는 것과 같습니다. 그것은 그저 화려한 이름이 붙은 똑같은 물 끓이기일 뿐입니다.
    • 결과: DPO에서 SPPO로 바꾸는 것은 AI가 달성하려는 실제 목표를 바꾸는 것이 아니라, 단지 수학을 어떻게 쓰느냐를 바꾸는 것뿐입니다.
  • "진짜" 혁신들: 오직 소수의 방법만이 진정으로 달랐습니다.

    • GRPO (배치 효과): 이 방법은 유명한 DeepSeek-R1 모델에 사용됩니다. Opal은 GRPO가 DPO와 근본적으로 다르다는 것을 증명했습니다.
      • 비유: 여러분이 학생들을 채점한다고 상상해 보세요. 표준적인 방법(DPO)에서는 학생 A를 오직 학생 A 자신의 시험 점수에 기반하여 채점합니다. 반면 GRGRO에서는 학생 A를 그날 방 안에 함께 있는 다른 학생들과 비교하여 채점합니다. 만약 방 안에 천재가 있다면 학생 A는 성적이 낮아 보일 것입니다. 만약 방 안에 고전하는 학생이 있다면 학생 A는 성적이 좋아 보일 것입니다. "배치(group)"가 성적을 바꿉니다. Opal은 이 "배치 의존성"이 GRPO를 완전히 다른 존재로 만든다는 것을 증证明했습니다.
    • KTO 및 기타: 이 방법들은 "승리"와 "패배"를 다르게 취급합니다 (마치 잃는 것을 즐기는 것보다 두려워하는 도박꾼처럼 말이죠). 이러한 비대칭성은 구조적으로 독특함을 만듭니다.

4. 진짜 차이를 만드는 네 가지 "비밀 재료"

논문은 어떤 방법이 (단순한 재진술이 아니라) 진정으로 새로운 방법이 되기 위해서는 네 가지 규칙 중 하나를 깨야 한다고 명시합니다. 만약 이 규칙을 깨지 못한다면, 그것은 아마도 기존 방법의 재탕일 가능성이 높습니다.

  1. 그룹 정규화 (Group Normalization): 그룹 내의 다른 구성원들에 따라 점수를 변경하는 것 (GRPO와 같이).
  2. 쌍 의존적 가중치 (Pair-Dependent Weighting): 특정 쌍의 고유한 특성에 따라 답변을 다르게 취급하는 것 (KTO와 같이).
  3. 토큰 수준 구조 (Token-Level Structure): 문장 전체가 아닌 AI의 답변을 단어 단위로 살펴보는 것.
  4. 궤적 수준 (Trajectory-Level): 최종 답변이 아닌, AI가 내린 결정의 전체 경로를 살펴보는 것.

5. 실무자들에게 주는 의미

만약 당신이 어떤 방법을 선택하려는 엔지니어라면:

  • 이름에 속지 마세요. 만약 어떤 새로운 방법이 DPO처럼 보이지만 화려한 유도 과정을 가지고 있다면, 그것은 그저 턱시도를 입은 DPO일 뿐일 수 있습니다.
  • "배치(Batch)"를 확인하세요. 만약 어떤 방법이 훈련 배치 내의 다른 예시들에 따라 행동이 변한다면, 그것은 독특한 무언가를 하고 있는 것입니다 (GRPO처럼).
  • 목표는 같습니다. 수학적으로는 달라 보일지라도, 만약 Opal이 그것들이 동등하다고 말한다면, 그것들은 동일한 "완벽한" AI 행동을 목표로 할 것입니다. 다만, 도달하는 속도나 안정성은 다를 수 있습니다.

요약

이 논문은 AI 분야에 대한 "현실 점검"입니다. 수학적 도구(Opal)를 사용하여 화려한 전문 용어를 벗겨내고, 최근의 "새로운" 방법들 대부분이 사실은 다르게 쓰인 똑같은 오래된 목적 함수라는 것을 보여줍니다. 진정한 혁신은 단순히 대수를 재배열할 때가 아니라, AI가 답변을 비교하는 방식(전체 그룹을 보거나 전체 경로를 보는 것과 같이)을 근본적으로 바꿀 때 일어납니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →