← 최신 논문
🤖 machine learning

Drifting Preference Optimization for One-Step Generative Models

이 논문은 보상 모델의 역전파 없이 순위가 매겨진 샘플로부터 특징 공간의 업데이트 방향을 합성함으로써, 미분 불가능한 보상을 사용하는 결정론적 텍스트-이미지 생성기의 효율적인 단일 단계 정렬을 가능하게 하는 온라인 미세 조정 방법인 Drifting Preference Optimization(DrPO)을 제안한다.

원저자: Zhou Jiang, Yandong Wen, Zhen Liu

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhou Jiang, Yandong Wen, Zhen Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 단 한 문장만으로 눈 깜짝할 사이에 그림을 그려내는 초고속 화가가 있다고 상상해 보세요. 이것이 바로 "원스텝(one-step)" 이미지 생성기가 하는 일입니다. 이들은 믿을 수 없을 정도로 빠르지만, 종종 인간이 보고 싶어 하는 것을 정확하게 그려내는 데 어려움을 겪습니다. 보통, 이 화가들을 더 잘하도록 가르치는 과정은 수천 개의 예시를 보여주고, 미세한 수학적 오차를 계산하며, 그들의 "두뇌"를 조금씩 조정하는 느리고 복잡한 과정을 포함합니다.

이 논문은 **DrPO (Drifting Preference Optimization)**라고 불리는 새로운 방법을 소개합니다. 이것은 복잡한 수학적 계산 때문에 속도가 느려지는 기존 방식 대신, 이 초고속 화가를 더 똑똑하고 빠르게 가르치는 방법입니다.

DrPO가 어떻게 작동하는지, 쉬운 비유를 통해 설명하겠습니다.

1. 문제점: "블랙박스" 선생님

보통 AI를 가르치려면, 그림을 보고 그것이 왜 틀렸는지 정확히 계산하여 화가에게 수정 신호를 보낼 수 있는 선생님이 필요합니다.

  • 문제점: 때때로 선생님은 "블랙박스"(그들이 어떻게 생각하는지 알 수 없는 존재)이거나, 너무 크고 복소하여 신호를 역으로 보낼 수 없습니다. 또는, 선생님이 상세한 수업 계획 대신 단순히 "잘했어" 또는 "못했어"라는 점수만 줄 수도 있습니다.
  • 기존 방식: 이러한 선생님들로부터 화가가 배우도록 강제하는 것은 화가의 속도를 늦추거나, "원스텝"의 속도를 깨뜨리는 값비싼 컴퓨터 계산을 요구합니다.

2. 해결책: "표류하는 장(Drifting Field)"

DrPO는 게임의 판도를 바꿉니다. 선생님에게 상세한 수학적 신호를 보내달라고 요청하는 대신, DrPO는 자기장 비유를 사용합니다.

  • 설정: 당신은 화가에게 동일한 프롬프트(예: "소파 위의 고양이")를 바탕으로 24장의 그림을 그리라고 요청합니다.
  • 순위 매기기: 당신은 이 24장의 그림을 선생님(보상 모델)에게 보여줍니다. 선생님은 왜 이것이 좋고 나쁜지 설명할 필요가 없습니다. 그저 순위를 매기기만 하면 됩니다. "이것이 최고다", "이것이 최악이다"와 같이 말이죠.
  • 자석 만들기:
    • 가장 좋은 그림들은 화가의 미래 그림들을 그쪽으로 끌어당기는 자석 역할을 합니다.
    • 가장 나쁜 그림들은 화가의 미래 그림들을 밀어내는 척력(repellers) 역할을 합니다.
  • 표류(Drift): 화가는 순위에 대한 수학적 원리를 알 필요가 없습니다. 그들은 단지 이미지의 특징 공간(이미지가 어떻게 생겼는지 나타내는 숨겨 된 지도) 내에서, 좋은 자석 쪽으로 끌어당기고 나쁜 자석으로부터 멀어지게 만드는 부드러운 "표류"나 바람을 느낄 뿐입니다.

3. 안전장치: "얼어붙은 참조(Frozen Reference)"

만약 화가를 단순히 자석을 향해 표류하게 내버려 둔다면, 화가는 길을 잃거나 기괴하고 왜곡된 이미지를 그리기 시작할 수 있습니다.

  • 해결책: DrPO는 원래의 화가(기본 모델)의 "얼어붙은" 복사본을 근처에 둡니다.
  • 비유: 화가가 외줄 타기를 하고 있다고 상상해 보세요. "자석"들은 목표를 향해 그들을 끌어당기지만, "얼어붙은 참조"는 그들이 너무 멀리 벗어나려 할 때 원래의 스타일로 부드럽게 되돌려 놓는 안전 로프 역할을 합니다. 이를 통해 이미지가 자연스럽고 안정적으로 유지됩니다.

4. 이것이 왜 대단한가

  • 속도: DrPO는 선생님이 그림에 대한 복잡한 수학 계산을 할 필요 없이 오직 순위만 매기면 되기 때문에, 거대하고 비밀스럽거나 단순한 점수만 주는 어떤 종류의 선생님과도 함께 작업할 수 있습니다.
  • 효율성: 이 논문은 복잡한 선생님(예: HPSv3)을 사용할 때, 무거운 "역전파(backpropagation, 수학적 신호 전달)" 단계를 건너뛰기 때문에 이 방법이 3.5배 더 빠르다고 주장합니다.
  • 원스텝 추론: 가장 중요한 점은, 화가는 여전히 단 한 단계만에 그림을 그린다는 것입니다. 훈련은 더 똑똑해졌지만, 실제 그림을 그리는 과정은 여전히 번개처럼 빠릅니다.

요약

DrPO를 "명예의 전당"(최고의 이미지들)과 "수치스러운 전당"(최악의 이미지들)을 보여줌으로써 속도 화가를 가르치는 것이라고 생각하십시오. 화가는 명예의 전당을 향해 움직이고 수치스러운 전당으로부터 멀어지는 법을 배우며, 이 과정에서 경로를 이탈하지 않도록 잡아주는 안전 로프의 안내를 받습니다. 이는 당신이 쉽게 대화할 수 없는 거대하고 복잡한 컴퓨터가 순위를 매기는 경우에도 작동하며, 화가가 매우 빠르게 그림을 그릴 수 있도록 유지해 줍니다.

핵-심 결론: 저자들은 이 방법이 복잡한 수학적 피드백이나 생성 과정을 늦추는 과정 없이도, 원스텝 이미지 생성기가 더 나은, 즉 인간이 선호하는 이미지를 생성하도록 돕는다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →