← 최신 논문
🤖 machine learning

Towards General Preference Alignment: Diffusion Models at Nash Equilibrium

본 논문은 전통적인 Bradley-Terry 기반 선호 방법의 한계를 극복하기 위해 모델이 스스로와 자기 대결을 수행하도록 장려함으로써 확산 모델이 우수한 텍스트-이미지 정렬을 달성할 수 있게 하는 게임 이론적 프레임워크인 Diffusion Nash Preference Optimization(Diff.-NPO)을 소개한다.

원저자: Jiaming Hu, Jiamu Bai, Haoyu Wang, Debarghya Mukherjee, Ioannis Ch. Paschalidis

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiaming Hu, Jiamu Bai, Haoyu Wang, Debarghya Mukherjee, Ioannis Ch. Paschalidis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신의 설명에 따라 그림을 그릴 수 있는 매우 재능 있는 화가 ( 확산 모델 ) 가 있다고 가정해 봅시다. 그러나 이 화가는 인터넷 전체로 훈련되었기 때문에, 기술은 뛰어나지만 그 스타일이 반드시 당신이 특히 좋아하는 것과 일치하는 것은 아닙니다. 때로는 개처럼 보이는 고양이를 그리거나, 수프처럼 보이는 일몰을 그리기도 합니다.

이를 해결하기 위해 우리는 보통 화가에게 그림 쌍을 보여주며 가르칩니다. "저 그림이 이 그림보다 더 좋아요." 이것이 바로 선정 정렬 (Preference Alignment) 입니다.

구식 방법: "점수판정자" 문제

대부분의 기존 방법 ( DPO 와 같은) 은 숨겨진 "점수판정자" (보상 모델) 가 있다고 가정하며 화가를 가르치려 합니다. 만약 그림 A 가 그림 B 보다 좋고, 그림 B 가 그림 C 보다 좋다면, 그림 A 는 반드시 그림 C 보다 좋다고 가정하는 것입니다.

이 논문은 이러한 가정이 결함이 있다고 주장합니다. 인간의 취향은 messy 하며 때로는 순환적입니다. 마치 가위바위보 게임과 같습니다:

  • 당신은 가위보다 바위를 선호할 수 있습니다.
  • 당신은 바위보다 가위를 선호할 수 있습니다.
  • 하지만 당신은 를 바위보다 선호할 수도 있습니다.

구식 방법들은 이러한 선택들을 A > B > C 와 같은 직선으로 강제하려 합니다. 이는 실제 인간의 취향의 복잡성을 포착하지 못합니다. 또한 컴퓨터가 추측해야 하는 "점수판정자"에 의존하기 때문에 부정확할 수 있습니다.

신식 방법: "스파링 파트너" 게임 (Diff.-NPO)

저자들은 Diff.-NPO(Diffusion Nash Preference Optimization) 라는 새로운 방법을 제안합니다. 점수를 추측하는 대신, 훈련 과정을 화가 두 명 사이의 게임으로 전환합니다:

  1. 현재 화가: 개선하려는 모델의 버전.
  2. 이전 화가: 마지막 훈련 단계의 모델 버전 (상대방 역할).

게임의 작동 방식:
현재 화가와 이전 화가가 복싱 링에 있다고 상상해 보세요. 둘 다 동일한 프롬프트 (예: "고양이 그리기") 를 받습니다.

  • 둘 다 그림을 그립니다.
  • 심판 (선정 확인자) 이 두 그림을 보고 어느 것이 더 나은지 결정합니다.
  • 현재 화가는 이전 화가의 그림보다 심판이 선호하는 그림을 그려 라운드를 이기려고 노력합니다.
  • 중요한 점은, 현재 화가는 게임을 이기기 위해 이상하고 터무니없는 것을 그리기 시작하지 않도록, 일반적으로 잘 그리는 법을 잊지 않도록 기억해야 한다는 것입니다 (원래 훈련에 가깝게 유지).

이를 내쉬 균형 (Nash Equilibrium) 이라고 합니다. 목표는 다른 어떤 전략으로도 일관되게 이길 수 없을 정도로 현재 화가가 훌륭해지는 지점에 도달하는 것입니다. 정적인 점수를 만족시키려는 것이 아니라, 모델이 스스로와 싸우며 더 나아지는 "자기 대결 (self-play)" 루프입니다.

"적정선" 균형

이 논문은 게임이 어떻게 진행되는지 조절하는 특별한 "노브" ( τ/η\tau/\eta 라는 수학적 비율) 를 소개합니다:

  • 노브를 한쪽으로 돌리면: 화가는 오직 "이전 화가"를 이기려고만 합니다. 이는 순수한 자기 대결과 같습니다. 공격적이고 빠르게 학습하지만, 화가는 제멋대로 행방을 잃고 정상적인 것을 그리는 법을 잊을 수 있습니다.
  • 노브를 다른 쪽으로 돌리면: 화가는 오직 "참조 화가" (고정된 원래 버전) 를 이기려고만 합니다. 이는 안전하고 안정적이지만, 목표가 너무 쉽거나 너무 경직되어 화가가 갇혀 크게 개선되지 않을 수 있습니다.
  • 적정선: Diff.-NPO 는 완벽한 중간 지점을 찾습니다. 이전 화가를 통해 개선 (온라인 학습) 을 촉진하고, 참조 화가를 통해 모델을 현실에 발을 붙여 있게 (안정성) 합니다.

시도했을 때 어떤 일이 일어났나요?

연구자들은 Pick-a-Pic이라는 거대한 인간 선호 데이터 세트를 사용하여 인기 있는 이미지 생성기 (Stable Diffusion 1.5 및 SDXL) 에서 이를 테스트했습니다.

  • 결과: Diff.-NPO 는 기존 방법들을 꾸준히 능가했습니다.
  • 증거: 새로운 모델을 구식 모델과 "맞대결" 시켰을 때, Diff.-NPO 모델이 더 자주 승리했습니다. 인간 (및 자동화된 심사자) 이 더 좋아하는 이미지를 생성했습니다.
  • 시각적 품질: 나란히 비교했을 때, Diff.-NPO 이미지는 더 사실적이었고, 프롬프트를 더 잘 따랐으며, 구식 방법으로 만든 이미지보다 더 일관성 있게 보였습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: "인간의 취향이 너무 복잡하기 때문에 인간이 무엇을 좋아하는지에 대한 완벽한 점수를 계산하려 하지 마십시오. 대신, AI 가 미치지 않도록 안전장치가 있는 상태에서 자신의 과거 버전과 게임을 하도록 하십시오. 이러한 '스파링' 접근법은 더 훌륭하고 정렬된 화가를 만들어냅니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →