← 최신 논문
🤖 machine learning

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

본 논문은 여러 롤아웃으로 유도된 전체 선호도 그래프를 활용하여 전이성과 집합적 감독을 강제함으로써 쌍별 방법의 한계를 극복하고 추론 및 프로그램 합성 작업에서 우수한 성능을 달성하는 Direct Preference Optimization의 원칙에 기반한 일반화인 GraphDPO를 소개합니다.

원저자: Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 셰프에게 완벽한 한 끼를 요리하는 법을 가르친다고 상상해 보세요.

구식 방법: "두 가지 맛" 테스트
전통적으로 로봇을 가르치기 위해 두 가지 요리를 제시합니다. 로봇이 만든 요리 (이를 '맛 A'라고 부르겠습니다) 와 당신이 만든 요리 (또는 더 나은 버전인 '맛 B') 입니다. 그리고 "맛 B 가 맛 A 보다 낫다"고 말합니다. 로봇은 이 단일 비교로부터 학습합니다. 이는 현재 표준 방법인 DPO(Direct Preference Optimization, 직접 선호도 최적화) 와 유사합니다.

문제는 무엇일까요? 현실 세계에서는 단순히 두 가지 요리만 얻는 것이 아닙니다. 로봇에게 같은 요리를 다섯 번 만들어달라고 요청할 수 있습니다. 그러면 다섯 가지 다른 버전이 나옵니다:

  1. 타버린 토스트.
  2. 약간 덜 익은 요리.
  3. 완벽하게 황금빛으로 익은 요리.
  4. 완벽하게 황금빛으로 익었으나 모양이 약간 다른 요리.
  5. 완전히 다른 기괴한 요리.

구식인 "두 가지 맛" 방법을 사용한다면, 이 다섯 가지 요리를 쌍 (1 대 2, 1 대 3, 2 대 3 등) 으로 나누어야 합니다. 이는 혼란을 초래합니다. 큰 그림을 잃게 됩니다. 로봇에게 "완벽하게 황금빛"이 "덜 익은 것"보다 낫고, "덜 익은 것"이 "타버린 것"보다 낫다고 말할 수는 있지만, 로봇은 "완벽하게 황금빛"이 "타버린 것"보다 낫다는 것을 단일하고 명확한 연결고리로 명시적으로 알려주지 않았기 때문에 혼란스러워할 수 있습니다. 이는 부모와 조부모를 무시하고 사촌끼리의 쌍만 살펴봄으로써 가계도를 이해하려는 것과 같습니다.

신식 방법: 맛의 "가계도" (GraphDPO)
이 논문의 저자들은 GraphDPO라는 새로운 방법을 제안합니다. 쌍을 보는 대신 로봇의 시도 전체를 "가계도"로 바라봅니다.

  1. 그래프 (나무): 다섯 가지 요리를 모두 가져와 위계질서로 배열합니다.

    • "타버린"과 "기괴한" 요리는 맨 아래에 배치합니다.
    • "덜 익은" 요리는 중간에 배치합니다.
    • 두 가지 "완벽하게 황금빛" 요리는 맨 위에 배치합니다.
    • 결정적으로, 두 가지 "완벽하게 황금빛" 요리는 동점이라는 사실을 인식합니다. 그들은 같은 "클럽"에 속합니다. 로봇은 두 가지 완벽한 요리 중 어느 것이 약간 더 나은지 알지 못한다고 해서 처벌받을 필요가 없습니다. 로봇은 단지 둘 다 나쁜 요리들보다 낫다는 것을 알면 됩니다.
  2. 규칙 (전이성): 시스템은 논리의 규칙을 강제합니다. A 가 B 보다 낫고, B 가 C 보다 낫다면, A 는 C 보다 반드시 낫아야 합니다. 구식 방법은 쌍으로 나누는 과정에서 이 규칙을 종종 잊어버렸습니다. GraphDPO 는 이 규칙을 학습 과정에 직접 구축하여 로봇의 이해가 위에서 아래까지 일관되도록 보장합니다.

  3. "오라클" 앵커: 때로는 실제 레시피 (ground truth) 를 가지고 있습니다. GraphDPO 는 이 완벽한 레시피를 나무의 꼭대기에 고정할 수 있게 합니다. 훈련 시작 시 로봇에게 "이것이 금표준이므로 이를 목표로 하라"고 말합니다. 로봇이 더 똑똑해짐에 따라 시스템은 이 고정점을 서서히 풀어서 로봇이 미세 관리 없이 스스로 최상위까지 가는 길을 찾도록 탐구하게 합니다.

왜 이것이 더 나은가요?

  • 혼란 방지: 실제로 동점인 것들에 대해 엄격한 순위를 강제할 때 발생하는 모순된 지시로 로봇이 혼란을 겪는 것을 막습니다.
  • 효율성: 전체 나무를 보지만 놀랍도록 빠릅니다. 모든 요리 쌍을 서로 비교할 필요가 없으며, 그룹만 보면 됩니다.
  • 더 나은 결과: 이 논문은 수학 문제와 코딩 작업에서 이를 테스트했습니다. "옳은" 답과 "틀린" 답이 종종 존재하는 이러한 영역 (타버린 요리 대 완벽한 요리와 같이) 에서 GraphDPO 는 로봇이 구식 쌍별 방법보다 더 빠르게 학습하고 더 좋은 점수를 얻도록 도왔습니다.

한 줄 요약
이 논문은 AI 에게 한 번에 두 가지 옵션을 보여주는 대신, 옵션 전체를 보여주고 명확한 위계질서 (그래프) 로 분류한 뒤, 모든 옵션 간의 관계를 한 번에 학습하게 해야 한다고 주장합니다. 이는 특히 답이 명확히 옳거나 명확히 틀린 경우 AI 를 위한 더 안정적이고 논리적이며 효과적인 교사를 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →