← 최신 논문
🤖 machine learning

Explicit Critic Guidance for Aligning Diffusion Models

본 논문은 확산 모델이 자체 시간 단계 조건부 가치 함수로 기능할 수 있도록 하는 상태 정렬 잠재 액터-크리틱 프레임워크를 제안함으로써, 기존 정렬 방법들을 능가하는 안정적인 궤적 수준 PPO 학습, 다중 보상 최적화, 그리고 효과적인 추론 시간 조정을 가능하게 한다.

원저자: Zhengyang Liang, Qihang Zhang, Ceyuan Yang

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhengyang Liang, Qihang Zhang, Ceyuan Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

재능 있는 화가 (확산 모델) 가 "화성에서 모자를 쓴 고양이"와 같은 특정 설명에 기반하여 그림을 그리도록 가르친다고 상상해 보세요.

이 화가는 그림 전체를 한 번에 그리지 않습니다. 대신, 정적 노이즈로 가득 찬 캔버스에서 시작해 천천히, 단계별로 다듬어 가다가 마침내 고양이가 나타나도록 합니다. 이것이 바로 "노이즈 제거 궤적"입니다.

이 논문이 다루는 문제는 다음과 같습니다: 어떻게 하면 이 화가에게 더 잘 그리도록 가르칠 수 있을까요?

일반적으로 최종 그림을 보고 그것이 좋은지 확인합니다. 고양이가 잘못 보이면 화가에게 "잘못했다"고 말합니다. 하지만 화가는 어떤 단계에서 잘못되었는지 알지 못합니다. 10 단계였을까요? 30 단계였을까요? 모자나 배경을 망친 걸까요? 이를 신용 할당 문제라고 합니다.

다음은 저자들의 새로운 방법인 상태 정렬 잠재 액터-크리틱이 간단한 비유를 사용하여 이 문제를 해결하는 방식입니다:

1. "내부 코치" (잠재 크리틱)

과거 방법에서는 "코치" (크리틱) 가 화가가 그림을 완성할 때까지 기다렸다가, 최종 이미지를 보고 나서야 이전에 무슨 일이 잘못되었는지 추측하려 했습니다. 이는 코치가 경기 종료 휘슬이 울린 후에만 축구 경기를 지켜보다가, 선수에게 전반전에 무엇을 다르게 해야 하는지 말해 주려는 것과 같습니다. 이는 부정확하고 느립니다.

이 논문의 해결책:
그들은 화가를 자신의 코치로 만듭니다. 화가에게 그림이 아직 만들어지는 동안 (아직 노이즈가 있고 흐릿할 때) 볼 수 있는 특별한 "내부 눈"을 부여합니다.

  • 마법 같은 점: 최종 이미지를 기다리는 대신, 이 내부 코치는 매 단계마다 지저분하고 노이즈가 섞인 캔버스를 보며 "이대로 계속 가면 좋은 점수를 받을 것이다" 또는 "멈춰라, 그 길은 나쁜 결과로 이어진다"고 말합니다.
  • 더 나은 이유: 코치가 화가가 취하는 실제 지저분한 단계들 (정리된 버전이 아닌) 을 보기 때문에 조언이 훨씬 정확합니다. 이는 어제 지도를 바탕으로 현재 위치를 추측하는 것이 아니라, 현재 위치를 기반으로 매초마다 경로를 업데이트하는 GPS 를 가진 것과 같습니다.

2. "리허설" (가치 사전 학습)

새로운 코치에게 조언을 하는 법을 가르치는 것은 어렵습니다. 화가와 코치를 처음부터 정확히 동시에 훈련시키면, 둘이 혼란을 겪으며 서로 논쟁을 벌여 훈련이 불안정해질 수 있습니다.

이 논문의 해결책:
그들은 코치에게 먼저 짧은 "리허설"을 시킵니다. 실제 훈련이 시작되기 전에 코치가 화가의 행동을 실제로 바꾸지 않은 채, 단지 화가를 지켜보며 최종 점수를 추측하는 연습을 하도록 합니다.

  • 결과: 실제 훈련이 시작될 때쯤이면 코치는 이미 결과물을 예측하는 데 꽤 능숙해집니다. 이로 인해 화가와 코치 사이의 "논쟁"을 방지하면서 전체 학습 과정이 훨씬 매끄럽고 빨라집니다.

3. "멀티 태스크" 도전 (다중 보상 최적화)

때로는 그림이 여러 가지 측면에서 동시에 훌륭해야 합니다. 프롬프트처럼 보여야 하고, 인간에게 아름답게 보이며, 올바른 수의 객체가 포함되어야 합니다.

  • 문제: 한 가지 측면에만 집중하면 (예: "정확히 4 개의 의자가 있는지 확인"), 화가는 게을러져서 4 개의 의자는 그리지만 배경은 끔찍하게 보이거나 색상이 이상하게 만들 수 있습니다. 이를 "보상 해킹"이라고 합니다. 게임을 제대로 하지 않고 이기기 위한 지름길을 찾는 것입니다.
  • 이 논문의 해결책: 그들은 화가에게 각기 다른 기술을 전문으로 하는 코치 팀을 부여합니다 (하나는 미적 감각, 하나는 객체 수, 하나는 텍스트 담당). 이 코치들은 동일한 "두뇌" (기저 모델) 를 공유하지만 각자 고유한 점수판을 가집니다.
  • 결과: 화가는 모든 것을 균형 있게 배우게 됩니다. "의자 개수" 보상을 해킹할 수 없습니다. 왜냐하면 "미적 감각" 코치가 추한 그림을 그렸다는 이유로 벌점을 주기 때문입니다. 이는 더 균형 잡힌 수행을 강제합니다.

4. "조향 장치" (추론 시간 조향)

화가의 훈련이 끝난 후, 그들이 그리는 것을 무조건 받아들이지 않아도 됩니다. 훈련이 끝난 후에도 그림이 만들어지는 동안 코치의 "내부 눈"을 사용하여 그림을 조종할 수 있습니다.

  • 작동 원리: 화가가 길을 그리고 있다고 상상해 보세요. 코치는 유망해 보이는 영역으로 붓을 부드럽게 밀어낼 수 있습니다.
  • 장점: 전체 모델을 재훈련하지 않고도 더 나은 결과를 얻을 수 있습니다. 이는 새로운 지도를 배울 필요 없이 운전 에 더 나은 경로를 제안하는 GPS 를 가진 것과 같습니다.

결과 요약

저자들은 두 가지 다른 유형의 "화가" (기존 기술인 UNet 기반과 최신 기술인 DiT 기반) 에 대해 이 방법을 테스트했습니다.

  • 더 나은 점수: 그들의 방법은 특히 객체 수 세기나 이미지 내 텍스트 읽기 같은 까다로운 작업에서 이전 방법들보다 일관되게 더 좋은 이미지를 생성했습니다.
  • 더 안정적: 훈련이 다른 방법들처럼 쉽게 충돌하거나 혼란에 빠지지 않았습니다.
  • 효율적: 코치가 조언을 주기 위해 최종 이미지를 기다릴 필요가 없었기 때문에 훈련이 더 빠르고 컴퓨팅 파워가 적게 필요했습니다.

간단히 말해, 이 논문은 AI 화가들이 자신의 최고의 비평가가 되어 창의적인 과정에서 즉각적인 피드백을 받고, 큰 경기 전에 리허설을 하며, 지름길을 가지 않도록 보장하는 코치 팀을 활용하도록 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →