← 최신 논문
🤖 machine learning

Follow the Mean: Reference-Guided Flow Matching

본 논문은 사전 훈련된 모델을 예시 기반의 엔드포인트 평균 이동으로 적응시켜 제어 가능한 이미지 생성을 가능하게 하는 참조 유도 흐름 매칭 프레임워크인 "Follow the Mean"을 소개하며, 미세 조정이나 테스트 시간 탐색 없이 출력을 유도하기 위한 학습이 불필요한 방법과 준모수적 방법을 모두 제공합니다.

원저자: Pedro M. P. Curvo, Maksim Zhdanov, Floor Eijkelboom, Jan-Willem van de Meent

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pedro M. P. Curvo, Maksim Zhdanov, Floor Eijkelboom, Jan-Willem van de Meent

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 재능 있는 화가가 방대한 사진 라이브러리를 통해 수년 동안 그림을 배우고 있다고 상상해 보세요. 이 화가는 "정글 속의 코끼리"와 같이 당신이 묘사하는 어떤 것이든 그릴 수 있을 정도로 뛰어납니다. 하지만 일단 화가가 훈련을 마치면 그들은 "동결"됩니다. 새로운 기술을 가르치려면 기존 기술을 잊게 하거나 수개월 동안 재훈련을 시켜야 하므로 쉽게 새로운 기술을 가르칠 수 없습니다.

보통 이 화가에게 회색 코끼리가 아닌 분홍색 코끼리를 그리게 하려면 다음 중 하나를 해야 합니다:

  1. 재훈련: 수천 장의 분홍색 코끼리 사진을 보여주고 그들이 배우기를 기다립니다 (비싸고 느립니다).
  2. 감독자 추가: 화가가 회색 코끼리를 그릴 때마다 비판가가 화가에게 소리를 지르게 하여 다시 그리게 합니다 (느리고 계산량이 많습니다).
  3. 초안 검색: 100 가지 버전을 그려 가장 좋은 것을 선택합니다 (낭비적입니다).

이 논문은 훨씬 더 간단한 방법을 소개합니다: 참고 유도 흐름 매칭 (Reference-Guided Flow Matching).

핵심 아이디어: "군중을 따르라"

저자들은 교묘한 단축경을 발견했습니다. 화가의 뇌 (모델 가중치) 를 변경하는 대신, 그림을 그리는 동안 화가가 누구를 보고 있는지만 바꾸면 됩니다.

그림을 그리는 과정을 강 (흐름) 을 항해하는 배로 생각해 보세요. 배는 특정 목적지 (최종 이미지) 에 도달하고자 합니다.

  • 일반적인 그림 그리기: 배는 화가의 훈련에 기반한 지도를 따릅니다. 코끼리를 요청하면 지도는 회색 코끼리로 이어집니다.
  • 새로운 트릭: 저자들은 배가 시작하기 직전에 참고 세트 (예: 분홍색 코끼리 사진 20 장) 를 보여주면 배의 목적지가 이동한다는 사실을 깨달았습니다. 강의 "흐름"이 분홍색 코끼리를 향해 방향을 바꾸어 조정합니다.

화가에게 새로운 것을 가르칠 필요가 없습니다. 단순히 새로운 참고 사진 뭉치를 건네면, 강의 수학이 최종 이미지를 그 사진들의 스타일, 색상 또는 모양 쪽으로 자연스럽게 끌어당깁니다.

두 가지 실행 방법

이 논문은 이 "참고 가이드"의 두 가지 버전을 제안합니다:

1. "즉시 가이드" (Reference-Mean Guidance)

이는 "훈련이 필요 없는" 버전입니다.

  • 작동 방식: 논문에서 언급된 FLUX.2 모델과 같이 동결된 사전 훈련 모델을 사용합니다. 이미지를 생성할 때 프롬프트와 함께 작은 참고 이미지 뱅크 (예: 분홍색 코끼리 20 장) 를 모델에 입력합니다.
  • 마법: 모델은 텍스트만 보는 것이 아니라, 참고 사진들이 가리키는 방향의 "평균 (mean)"을 계산합니다. 그런 다음 그림 그리기 과정을 그 평균 쪽으로 부드럽게 밀어냅니다.
  • 결과: 모델의 코드 한 줄도 변경하거나 재훈련하지 않고도 분홍색 코끼리, 반 고흐 스타일의 집, 또는 특정 손짓을 얻을 수 있습니다. 마치 화가가 그림을 그리기 시작하기 직전에 새로운 무드 보드를 건네주는 것과 같습니다.

2. "스마트 어시스턴트" (Semi-Parametric Guidance)

이 버전은 처음부터 참고 자료에서 학습하도록 설계된 모델을 위한 것입니다.

  • 작동 방식: 화가 옆에 "스마트 어시스턴트"가 서 있다고 상상해 보세요. 이 어시스턴트는 참고 사진을 보고 "이 사진들의 평균은 꼬리가 푹신한 고양이입니다"라고 말합니다.
  • 정교화: 화가는 그 평균을 바탕으로 그림을 그리되, 이상한 세부 사항을 수정하기 위해 자신의 "잔차 (residual)" 즉, 자신의 창의적인 flair 를 추가합니다.
  • 결과: 이를 통해 모델이 참고 자료를 효율적으로 사용하는 법을 학습할 수 있습니다. 전체 시스템을 재훈련할 필요 없이 참고 뱅크만 바꾸면 고양이와 개 사이를 전환하며 생성할 수 있습니다. 원래 모델의 높은 품질을 유지하면서도 즉시 적응할 수 있는 능력을 추가합니다.

왜 이것이 중요한가 (논문에 따르면)

이 논문은 이 접근 방식이 다음과 같은 이유로 우수하다고 주장합니다:

  • 빠릅니다: 수시간의 재훈련이나 복잡한 검색을 기다릴 필요가 없습니다. 참고 이미지만 바꾸면 됩니다.
  • 유연합니다: 색상, 스타일, 객체 정체성, 심지어 손이나 열쇠구멍의 모양과 같은 복잡한 구조까지 모델을 예시로 보여주기만 하면 제어할 수 있습니다.
  • 간단합니다: 수학적 원리에 의존합니다. 흐름의 "목적지" (종단 평균) 를 이동시키면 전체 여정이 바뀝니다.

실제 세계의 비유

엄격한 GPS (AI 모델) 가 장착된 차를 운전한다고 상상해 보세요.

  • 구 방식: 목적지를 변경하려면 자동차의 전체 항법 시스템을 재프로그래밍해야 합니다 (파인튜닝) 또는 승객이 "좌회전!"이라고 끊임없이 소리치게 해야 합니다 (가이드/분류기).
  • 이 논문의 방식: 단순히 원하는 목적지의 사진 뭉치를 대시보드에 올려놓습니다. 자동차의 항법 시스템은 그 사진들을 보고 "아, 그들은 저기로 가고 싶어 하는구나"라고 깨닫고 자동으로 경로를 재설정합니다. 자동차를 변경한 것이 아니라 참고점을 바꾼 것뿐입니다.

논문이 증명한 것

저자들은 이를 다음과 같이 테스트했습니다:

  • 색상: 회색 코끼리를 분홍색으로 변경.
  • 스타일: 사진을 스케치나 반 고흐 그림으로 변환.
  • 구조: 손이나 열쇠구멍의 모양 수정.
  • 구도: 두 객체가 서로에 대해 올바른 위치에 나타나도록 보장.

모든 경우에서 단순히 "참고 세트" (사진 뭉치) 를 교체함으로써 동결된 AI 모델을 원하는 대로 유도할 수 있음을 입증했습니다. 이는 데이터 (참고 사진) 가 모델 자체를 변경하는 것보다 모델을 더 잘 제어할 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →