← 최신 논문
🤖 machine learning

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models

이 논문은 PG-MAP을 소개하는데, 이는 디퓨전 및 플로우 매칭 모델 모두에 대해 추론 시점의 정렬을 향상시키기 위해 해당 과정을 조건부 변수와 잠재 변수에 대한 결합 깁스-MAP 최적화로 정식화함으로써, 기존의 단일 축 방식들에 비해 다양한 지표와 인간 평가에서 우수한 성능을 달성하는 학습이 필요 없는 프레임워크이다.

원저자: Ruolan Sun, Pawel Polak

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ruolan Sun, Pawel Polak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽한 요리를 만들기 위해 고객의 주문에 따라 요리하는 숙련된 셰프라고 상상해 보십시오. AI 이미지 생성의 세계에서 '셰프'는 복잡한 모델(예: Stable Diffusion)이고, '주문'은 텍텍스트 프롬프트(예: "우주비행사 복장을 한 레서판다")이며, '요리'는 최종 이미지입니다.

보통 셰프가 실수를 했을 때, 한 번에 한 가지 방법으로만 수정할 수 있습니다:

  1. 주문을 변경하기: 텍스트 프롬프트를 더 구체적으로 다시 작성합니다 (예: 셰프에게 "판다가 빨간색인지 확인해줘"라고 말하는 것과 같습니다).
  2. 재료를 조절하기: 질감이나 조명을 고치기 위해 요리하는 동안 가공되지 않은 혼합물을 조정합니다 (예: 소금을 더 넣거나 열기를 조절하는 것과 같습니다).

기존 방식들은 당신이 이 두 가지 경로 중 하나를 선택하도록 강요합니다. 만약 텍스트를 고치면, 질감을 망칠 수 있습니다. 만약 질감을 고치면, 프롬프트의 의미를 잃을 수 있습니다.

PG-MAP은 요리가 만들어지는 동안 두 가지를 동시에, 동적으로 수행하는 새로운 "슈퍼 셰프 조수"입니다.

핵심 아이디어: 역동적인 춤

이 논문은 PG-MAP(Preference-Guided Adaptive MAP)을 소개합니다. 시작할 때 단 한 번의 결정을 내리거나 끝에 한 번 조절하는 대신, PG-MAP은 이미지 생성 과정을 하나의 연속적인 여정으로 취급합니다.

이미지 생성 과정을 안개 낀 시작점(무작위 노이즈)에서 선명한 목적지(최종 이미지)로 향하는 길고 구불구불한 자동차 여행이라고 생각해 보십시오.

  • 문제점: 이 길 위에서 "안개"(노이즈)는 초반에는 짙고 마지막에는 걷힙니다. 기존 방식들은 정적인 지도나 단 한 번의 조정을 사용하여 차를 조종하려고 합니다.
  • PG-MAP의 솔루션: PG-MAP은 매 단계마다 경로를 끊임없이 재계산하는 GPS처럼 작동합니다. 현재 이미지의 상태를 보고 다음 두 가지 질문을 동시에 던집니다:
    1. "텍스트 설명이 우리가 보고 있는 것과 여전히 일치하는가?" (조건화, 즉 c-side).
    2. "시각적 품질이 좋아 보이는가?" (잠재 상태, 즉 z-side).

PG-MAP은 "텍스트 설명"과 "시각적 재료"를 함께 조정하여, 서로 싸우는 것이 아니라 조화를 이루며 작동하도록 보장합니다.

작동 원리: "순방향 일관성" 규칙

논문은 "순방향 일관성 결합(forward-consistency coupling)"이라는 멋진 용어를 사용합니다. 여기 간단한 비유가 있습니다:

당신이 어두운 숲(생성 과정)을 걷고 있다고 상상해 보십시오. 당신에게는 지금 어디에 있는지 보여주는 손전등(AI 모델)이 있습니다.

  • 기존 방식들은 "나는 어디서 시작했는지 알기 때문에 그냥 직선으로 계속 걸어가겠다"라고 하거나, "끝에 가서 한 번 경로를 조정하겠다"라고 말합니다.
  • PG-MAP은 "지금 손전등이 어디를 비추고 있는지 보자"라고 말합니다. 만약 빛이 우리가 경로를 벗어나고 있음을 암시한다면, 우리는 경로로 돌아오기 위해 방향(텍스트)과 발걸음(이미지 디테일)을 동시에 부드럽게 조정할 것입니다.

이는 모든 작은 단계마다 "점수"(보상)를 계산함으로써 이루어집니다. 만약 이미지가 "레서판다"처럼 보이지만 털이 흐릿하다면, 털을 더 선명하게 만듭니다. 만약 털은 훌륭하지만 동물이 사람처럼 보인다면, 판다의 형태를 다시 강제하기 위해 텍스트 임베딩을 미세하게 조정합니다.

두 가지 서로 다른 종류의 도로

논문은 가장 좋은 운전 방식은 당신이 어떤 종류의 도로 위에 있느냐에 따라 달라진다는 흥미로운 발견을 했습니다.

  1. 확산 모델 (울퉁불퉁하고 안개 낀 도로): 오래된 모델(예: SD 1.5 또는 SDXL)에서는 도로에 노이즈가 많습니다. PG-MAP은 안개가 자욱한 초기 단계에서 텍스트와 이미지 디테일을 모두 조정함으로써 여기서 가장 잘 작동합니다.
  2. 플로우 매칭 모델 (매끄럽고 곧은 고속도로): 최신 모델(예: SD3.5)은 도로가 훨씬 더 매끄럽습니다. 여기서 PG-MAP은 텍스트를 수정하는 것이 불필요하다(도로가 너무 안정적이다)는 것을 깨닫습니다. 대신, 여행의 맨 마지막 단계에서 이미지 디테일을 미세하게 조정하는 데 전적으로 집중합니다.

이러한 적응성은 독특합니다. 대부분의 다른 도구들은 두 종류의 도로에 대해 동일한 전략을 사용하려고 하기 때문입니다.

결과: 더 나은 그림, 더 적은 추측

저자들은 수천 개의 프롬프트로 테스트를 진행했습니다.

  • 시각적 품질: 이미지는 더 선명해졌고, 조명이 좋아졌으며, 세부 사항(예: 검의 손잡이나 깃털의 질감)이 더 정확해졌습니다.
  • 프롬프트 정확도: 이미지가 텍스트 설명과 더 잘 일치했습니다 (예: "레서판다"가 사람이 아닌 실제 판다처럼 보임).
  • 인간 선호도: 실제 사람들이 기존 방식과 PG-MAP 사이에서 선택하도록 했을 때, PG-MAP을 선택한 비율이 약 **60%에서 67%**에 달했습니다.

"오라클(Oracle)"의 비밀

논문은 또한 "만약 우리가 모든 특정 프롬프트에 대한 완벽한 수정 방법을 마법처럼 알 수 있다면, 얼마나 더 좋아질 수 있을까?"라는 "만약에" 실험을 수행했습니다.
그들은 서로 다른 유형의 프롬프트가 서로 다른 수정이 필요하다는 것을 발견했습니다.

  • 짧고 구체적인 프롬프트(예: "빨간 정육면체")는 텍스트에 더 많은 도움이 필요합니다.
  • 분위기 중심의 프롬프트(예: "바다 위의 일몰")는 시각적 질감에 더 많은 도움이 필요합니다.

PG-MAP은 두 가지를 모두 처리하는 단일 도구이지만, 논문은 미래에 스마트한 "교통 관제사"가 각 특정 요청에 대해 최적의 설정을 자동으로 선택함으로써 이미지를 훨씬 더 좋게 만들 수 있다고 제안합니다.

요약

PG-MAP은 이미지가 생성되는 동안 프 {의미}와 이미지의 {외형}을 동시에, 단계별로 조정할 수 있게 함으로써 AI 이미지 생성기를 더 똑똑하게 만드는 학습이 필요 없는(training-free) 도구입니다. 이는 사용하는 AI 모델의 유형에 따라 전략을 적응시키며, 그 결과 텍스트에 더 정확하고 보기에도 더 아름다운 이미지를 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →