← 최신 논문
🤖 machine learning

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

본 논문은 새로운 그래디언트 클리핑 메커니즘과 시간 단계 인식 중요도 재가중을 통해 확산 모델의 훈련 불안정성과 오프 정책 편향을 해결하는 안정화되고 개선된 선호도 최적화 프레임워크인 SIPO 를 소개하며, 이는 이미지 및 비디오 생성 작업 전반에서 우수한 성능을 입증합니다.

원저자: Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

talented 한 예술가 ( Diffusion Model ) 를 인간이 실제로 좋아하는 그림을 그리도록 가르친다고 상상해 보세요. 이 예술가는 처음부터 이미지를 만드는 데 이미 매우 능숙하지만, 당신이 정확히 무엇을 원하는지 항상 완벽하게 이해하는 것은 아닙니다. 당신은 그들에게 "저 그림이 그 그림보다 더 마음에 듭니다"라는 피드백을 주고 싶습니다.

이 논문은 이러한 예술가들을 가르칠 때 기존 방법들이 겪었던 두 가지 주요 문제를 해결하는 새로운 교수법인 SIPO(Stabilized and Improved Preference Optimization, 안정화 및 개선된 선호도 최적화) 를 소개합니다.

간단한 비유를 통해 내용을 정리해 보겠습니다:

문제: "소란스러운 교실"

저자들은 기존 방법들 ( Diffusion-DPO 등) 이 무작위 시간에 교사가 지시를 외쳐 학생을 혼란스럽게 만드는 소란스러운 교실과 같았음을 발견했습니다.

  1. "타이밍 불량" 문제:

    • 비유: 예술가가 그림을 그리고 있다고 상상해 보세요. 그들은 빈 캔버스 (매우 노이즈가 많은 상태) 로 시작해 그림이 선명해질 때까지 세부 사항을 천천히 추가합니다.
    • 문제점: 기존 방법은 그림을 그리는 과정의 매초마다 피드백을 주려고 했습니다. 하지만 시작 단계 (초기 시간 단계) 에 캔버스는 그저 노이즈의 흐릿한 얼룩일 뿐입니다. 이때 피드백을 주는 것은 캔버스에 회색 얼룩만 있을 때 "코를 그려!"라고 외치는 것과 같습니다. 이는 혼란을 야기하고 예술가를 좌절하게 만들어 (학습 불안정성) 이어집니다.
    • 해결책: SIPO 는 캔버스가 흐릿한 얼룩일 때인 처음 60 초는 무시하고, 형태가 나타나기 시작할 때만 피드백을 주라고 말하는 똑똑한 교사처럼 행동합니다. 이는 예술가가 노이즈에 혼란을 느끼는 것을 막아줍니다.
  2. "잘못된 학생" 문제:

    • 비유: 다른 학생이 쓴 교과서로 학생을 훈련시킨다고 상상해 보세요. 교과서에는 정답이 있지만, 그 스타일은 당신의 학생이 생각하는 방식과 약간 다릅니다.
    • 문제점: 기존 방법은 현재 예술가가 할 수 있는 능력과 정확히 일치하지 않는 "오프라인" 데이터 (미리 만들어진 예시) 를 사용했습니다. 이는 예술가가 배우는 내용과 실제로 수행하는 내용 사이에 간극을 만들어, 나중에 자신감을 잃거나 이상한 실수를 하게 만듭니다 (오프폴리시 편향).
    • 해결책: SIPO 는 "번역기" ( 중요도 재가중 이라고 함) 를 사용합니다. 이는 모든 예시를 살펴보고 "이 예시는 우리 예술가가 할 수 있는 것과 매우 유사하므로 자세히 듣겠습니다. 저 다른 예시는 매우 다르므로 그 볼륨을 낮추겠습니다"라고 말합니다. 이를 통해 예술가는 불일치하는 예시에 압도되지 않고 가장 관련성 높은 예시들로부터 학습할 수 있습니다.

해결책: SIPO

이 논문은 SIPO 를 두 단계의 개선으로 제안합니다:

  1. DPO-C&M (클리핑 및 마스킹): 이것이 "똑똑한 교사"입니다. 피드백이 유용하지 않은 그림 과정의 초기 노이즈가 많은 부분을 마스킹(무시) 합니다. 또한 피드백이 너무 극단적이 되어 예술가를 놀라게 하지 않도록 클리핑(제한) 합니다.
  2. 시간 단계 인식 재가중: 이것이 "번역기"입니다. 예시가 예술가의 현재 실력 수준과 얼마나 잘 일치하는지에 따라 피드백의 볼륨을 조절합니다. 예시가 완벽한 일치라면 목소리를 높이고, 이상한 아웃라이어라면 속삭입니다.

결과: 더 차분하고 뛰어난 예술가

저자들은 이 방법을 이미지 생성기(Stable Diffusion 등) 와 비디오 생성기(CogVideoX 등) 모두에서 테스트했습니다.

  • 안정성: 기존 방법들은 롤러코스터와 같았습니다. 예술가의 성능이 극적으로 오르내리다가, 며칠간의 학습 후 완전히 붕괴하기도 했습니다. SIPO 는 매끄러운 엘리베이터와 같습니다. 예술가는 꾸준히 향상되며 붕괴하지 않습니다.
  • 민감도: 기존 방법들은 "온도" 설정 ( β\beta 라는 노브) 에 매우 민감했습니다. 노브를 약간만 잘못 돌리면 예술가가 실패했습니다. SIPO 는 강건합니다. 노브를 완벽하게 조정하지 않아도 잘 작동합니다.
  • 품질: 직접 비교 테스트에서 SIPO 는 기존 방법들보다 인간이 더 선호하는 이미지와 비디오를 생성했습니다. 단순히 "괜찮은" 그림을 만드는 것을 넘어, 더 일관성 있고 다채로우며 인간의 취향에 부합하는 그림을 만들었습니다.

요약

간단히 말해, SIPO 는 AI 예술가들을 훈련시키는 더 지능적인 방법입니다. 예술가들이 아직 노이즈에 혼란스러워할 때 지시를 외치는 대신, 말하기 좋은 순간을 기다리고 예술가의 현재 수준에 맞춰 목소리를 조절합니다. 그 결과, 붕괴할 가능성이 적고 더 우수하며 인간과 유사한 예술을 만들어내는 훈련 과정이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →