← 최신 논문
🤖 machine learning

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

이 논문은 생성 모델의 추론 시 여러 목표 간의 최적 균형을 재학습 없이 실시간으로 조절할 수 있도록, 단일 확산 모델을 다양한 선호도 가중치로 조건부 학습하여 파레토 프론트를 근사하는 'ParetoSlider'라는 다목적 강화학습 프레임워크를 제안합니다.

원저자: Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

게시일 2026-04-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"파레토 슬라이더 (ParetoSlider)"**라는 새로운 기술을 소개합니다. 이 기술을 쉽게 설명하기 위해 **'요리사'**와 **'레시피'**에 비유해 보겠습니다.

1. 문제 상황: "한 가지 맛만 내는 요리사"

기존의 AI 이미지 생성 모델 (예: 그림을 그리는 AI) 은 강화 학습을 통해 사람 취향에 맞춰 학습합니다. 하지만 기존 방식은 한 번에 하나의 목표만 잡았습니다.

  • 비유: 요리사가 "매운맛"을 극대화하는 레시피를 배우면, 그 요리는 정말 매워집니다. 하지만 "단맛"을 더하고 싶다면? 아예 다른 요리사를 새로 고용하거나, 처음부터 완전히 다른 레시피를 다시 만들어야 합니다.
  • 현실: 그림을 그릴 때 "사진처럼 사실적인지 (Photorealism)"와 "연필 스케치 같은지 (Sketch)"는 서로 충돌하는 목표입니다. 기존 AI 는 이 둘을 섞을 때 "50 대 50"으로 섞인 레시피 하나만 고정해 두었습니다. 사용자가 "조금 더 사실적으로 해줘"라고 하면, AI 는 그 요청을 들어줄 수 없었습니다.

2. 해결책: "모든 맛을 조절할 수 있는 마법 레시피"

이 논문이 제안한 파레토 슬라이더는 이 문제를 해결합니다.

  • 핵심 아이디어: AI 에게 "이제부터는 너가 그리는 그림의 스타일을 조절하는 **스ライダー (Slider)**를 줘. 네가 그 슬라이더를 움직이면, 내가 원하는 대로 사진과 스케치 사이의 균형을 맞춰줘."라고 가르치는 것입니다.
  • 비유: 마치 스마트폰의 밝기 조절이나 음악 플레이어의 볼륨 조절처럼, AI 는 하나의 모델로 모든 스타일 (사실적 ↔ 스케치, 원본 보존 ↔ 편집 강도) 을 부드럽게 조절할 수 있게 됩니다.

3. 어떻게 작동할까? (두 가지 핵심 기술)

이 기술이 성공한 이유는 두 가지 지혜로운 전략 때문입니다.

① "늦은 합치기" (Late Scalarization) - 소금과 설탕을 따로 재는 법

기존 방식은 "사실성 점수"와 "스케치 점수"를 미리 섞어서 (예: 0.7 × 사실성 + 0.3 × 스케치) 하나의 숫자로 만든 뒤 AI 에게 가르쳤습니다. 하지만 이 방법은 "사실성 점수"가 숫자가 너무 크면 AI 가 스케치 점수를 무시하게 만드는 문제가 있었습니다.

  • 새로운 방식: AI 는 먼저 "사실성"과 "스케치"를 각각 따로 평가합니다. 그다음, 사용자가 원하는 비율 (예: 70% 사실, 30% 스케치) 에 맞춰 마지막 단계에서만 두 점수를 섞습니다.
  • 비유: 요리사가 소금과 설탕을 미리 섞어 놓는 게 아니라, 각각의 맛을 따로 테스트한 뒤, 마지막에 사용자의 기호에 따라 "소금 70%, 설탕 30%"로 섞어주는 것입니다. 이렇게 하면 어떤 맛도 지배당하지 않고 균형 잡힌 요리를 만들 수 있습니다.

② "선호도 조건부 학습" - 주문서를 보고 요리하는 법

AI 는 학습하는 동안 "사용자가 어떤 스타일을 원할지"를 미리 알려주는 **주문서 (Preference Vector)**를 받습니다.

  • 비유: 요리사가 "오늘은 매운맛을 원해"라고 주문하면 매운 요리를, "단맛을 원해"라고 하면 달콤한 요리를 그 자리에서 만들어냅니다. 더 이상 "매운맛용 요리사"와 "단맛용 요리사"를 따로 고용할 필요가 없습니다. 한 명의 요리사가 모든 주문을 처리할 수 있게 된 것입니다.

4. 실제 효과: 어떤 변화가 일어날까?

이 기술을 적용하면 다음과 같은 놀라운 일들이 가능합니다.

  1. 부드러운 이동: "사진 같은 느낌"에서 "만화 같은 느낌"으로 넘어갈 때, 중간 단계가 뚝뚝 끊기지 않고 매우 자연스럽게 변합니다. 슬라이더를 조금씩 움직일 때마다 그림이 부드럽게 변형됩니다.
  2. 이미지 편집의 정교함: "이 사진을 픽사 (Pixar) 스타일로 바꿔줘"라고 할 때, 원본의 얼굴 특징 (이목구비) 을 너무 잃지 않으면서도 스타일을 바꿀 수 있습니다. "원본 보존"과 "지시사항 준수" 사이의 균형을 사용자가 직접 조절할 수 있습니다.
  3. 비용 절감: 예전에는 스타일마다 모델을 따로 훈련시켜야 했지만, 이제는 하나의 모델로 모든 스타일을 다룰 수 있어 저장 공간과 계산 비용을 크게 아낄 수 있습니다.

5. 결론: AI 와의 대화 방식이 바뀐다

이 논문은 AI 가 단순히 "명령을 따르는 기계"가 아니라, 사용자의 취향에 따라 유연하게 반응하는 파트너가 될 수 있음을 보여줍니다.

  • 과거: "이걸 그려줘." (AI 는 고정된 스타일만 그림)
  • 현재 (파레토 슬라이더): "이걸 그려줘. 근데 사실적인 느낌은 80%, 스케치 느낌은 20% 정도로 해줘." (AI 는 사용자가 원하는 대로 완벽하게 조절해 그림)

이 기술은 앞으로 우리가 AI 를 사용할 때, 더 이상 "최고의 결과물" 하나만 고르는 것이 아니라, 내 상황에 딱 맞는 결과물을 실시간으로 만들어낼 수 있는 시대를 열 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →