← 최신 논문
🤖 machine learning

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

본 논문은 사전 학습 목표를 비용이 많이 드는 SDE 롤아웃, 역방향 어드join트 스윕 또는 보상 기울기 없이 수정하는 간단한 일관성 손실 도출을 통해 보상에 대한 우수한 정렬을 달성하는 확산 및 흐름 매칭 모델을 위한 확장 가능한 RL 사후 학습 방법인 강화 어드join트 매칭 (RAM) 을 소개합니다.

원저자: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마스터 화가가 수천 장의 사진을 복사하며 그림을 그리는 법을 수년 동안 배웠다고 상상해 보세요. 이 화가는 자신이 보는 것을 재현하는 데 매우 능숙하지만, "파란색 트럭 옆에 빨간색 얼룩말을 그리라"거나 "방패 위에 'HELLO'라는 단어를 선명하게 쓰라"는 것처럼 구체적이고 까다로운 지시를 따르는 법은 반드시 알지 못합니다.

이 화가에게 이러한 새로운 기술을 가르치기 위해 우리는 일반적으로 **강화 학습 (Reinforcement Learning, RL)**이라는 방법을 사용합니다. 이는 그림을 보고 점수를 매겨주며 화가에게 "다음엔 더 잘해라"라고 말하는 엄격한 미술 비평가라고 생각하면 됩니다.

구식 방법: 비싸고 느린 비평가

이전에는 비평가와 함께 이러한 AI 화가들을 훈련시키는 것이, 누군가에게 수영을 가르치기 위해 바다에 던져 넣고 발버둥 치는 모습을 지켜보는 것과 같았습니다.

  • 과정: AI 는 전체 이미지 (즉, '수영') 를 생성하고, 비평가에게 점수를 받은 뒤, 시스템은 정확히 어떤 붓질이 좋은 점수나 나쁜 점수를 유발했는지 파악하려고 노력했습니다.
  • 문제: 이를 위해 AI 는 한 번의 피드백을 받기 위해 시작부터 끝까지 전체 그림 그리기 과정을 반복해서 시뮬레이션해야 했습니다. 이는 느리고, 계산 비용이 많이 들며, 종종 불안정했습니다 (배가 가라앉는 동안 바람 속도를 계산하려는 것과 같습니다).

새로운 방법: RAM (Reinforce Adjoint Matching)

안드레아스 베르그마이스터 (Andreas Bergmeister) 와 그의 팀이 이 논문의 저자들은 이를 훨씬 더 지혜롭게 할 수 있는 방법을 깨달았습니다. 그들은 훈련을 빠르고 단순하게 유지하는, 원래의 사전 훈련 단계와 같은 '단축키'를 발견했습니다.

다음은 간단한 비유를 사용하여 RAM이 어떻게 작동하는지 설명한 것입니다:

1. '클린 엔드포인트 (Clean Endpoint)' 트릭
그림 그리기 과정을 거꾸로 재생되는 영화라고 상상해 보세요. 이 영화는 빈 캔버스 (노이즈) 로 시작하여 완성된 그림으로 끝납니다.

  • 구식 방법: AI 는 전체 영화를 보고, 결말에 점수를 매긴 뒤, 어디에서 잘못되었는지 보기 위해 영화를 프레임 단위로 되감아야 했습니다.
  • RAM 방법: 저자들은 최종 그림 (즉, '클린 엔드포인트') 을 알면 전체 과정을 이해하기 위해 영화를 통째로 볼 필요가 없다는 것을 깨달았습니다. 완성된 그림을 가져와서 수학적으로 즉시 '노이즈'를 추가하여 원래 훈련 때와 마찬가지로 지저분한 버전을 만들면 됩니다.

2. '한 번에 끝내는' 피드백
피드백을 받기 위해 전체 그림 그리기 과정을 시뮬레이션하는 대신, RAM 은 다음과 같이 작동합니다:

  1. 생성: AI 가 완성된 이미지 (엔드포인트) 를 그립니다.
  2. 점수 매기기: 비평가가 점수를 줍니다 (예: "텍스트 작업 훌륭합니다!").
  3. 즉시 되감기: 되감기를 시뮬레이션하는 대신, 수학이 즉시 해당 이미지의 '노이즈가 있는' 버전을 생성합니다.
  4. 학습: AI 는 그 특정 노이즈가 있는 버전을 다시 고득점 이미지로 변환하는 법을 배웁니다.

마법 같은 통찰:
이 논문은 이미지를 개선하려 할 때조차 이미지에 '노이즈'를 추가하는 규칙은 변하지 않는다는 것을 증명합니다. 변하는 것은 AI 가 처음에 어떤 이미지를 그리기로 결정하느냐 뿐입니다. '노이즈 규칙'이 동일하게 유지되기 때문에, AI 는 새로운 목표만 있을 뿐 원래 훈련 때 사용했던 동일한 간단한 수학을 사용할 수 있습니다.

이것이 중요한 이유

  • 속도: 이 논문은 RAM 이 이전 방법보다 34 배에서 50 배까지 빠르다고 주장합니다. 같은 수준의 기술을 훨씬 짧은 시간에 달성합니다.
  • 단순성: 복잡한 불안정 계산 (예: 'SDE 롤아웃'이나 '역방향 어드저인트 스윕') 이 필요하지 않습니다. 원래 훈련과 유사한 단순한 회귀 작업일 뿐입니다.
  • 품질: Stable Diffusion 3.5M에서 테스트했을 때, AI 는 다음과 같은 부분에서 훨씬 더 나아졌습니다:
    • 구성 능력: 사물을 올바른 위치에 배치하는 것 (예: 냉장고 왼쪽에 트럭).
    • 텍스트 렌더링: 이미지 안에 단어를 선명하게 쓰는 것.
    • 인간 선호도: 사람들이 실제로 보기 좋아하는 이미지를 만드는 것.

결론

RAM을 화가에게 주는 '마법 지우개'와 '마법 점수판'이라고 생각하세요. 무언가 잘못되었는지 보기 위해 화가에게 전체 캔버스를 다시 그리게 하는 대신, 마법 지우개는 그들의 최고의 작품에서 지저분한 버전을 즉시 보여주며, 점수판은 그 특정 지저분함을 어떻게 고쳐야 하는지 정확히 알려줍니다. 이를 통해 AI 는 이전 방법의 무거운 계산 비용 없이도 복잡한 새로운 기술을 배울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →