← 최신 논문
💻 computer science

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

본 논문은 인과 추론 기술을 통합하여 합성 AI 피드백의 체계적 편향을 교정함으로써, 디퓨전 모델이 데이터 비용을 크게 절감하면서도 완전한 인간 라벨링 학습에 필적하거나 이를 상회하는 정렬 성능을 달성할 수 있게 하는 준지도 학습 프레임워크인 Debiased Direct Preference Optimization (DeDPO)를 제안한다.

원저자: Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

게시일 2026-02-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 재능 있는 화가(하나의 확산 모델(Diffusion Model))에게 당신의 설명에 따라 그림을 그리도록 가르치고 있다고 상상해 보세요. 이 화가는 이미 예쁜 그림을 만드는 데 매우 능숙하지만, 조명을 제대로 맞추거나 고양이를 개가 아닌 고양이처럼 보이게 하는 것과 같이 당신이 중요하게 생각하는 세세한 디테일을 놓칠 때가 있습니다.

이를 해결하기 위해, 보통 당신은 두 점의 그림을 보고 "이게 더 좋아"라고 말해줄 인간 비평가 팀을 고용해야 합니다. 이것을 **직접 선호도 최적화(Direct Preference Optimization, DPO)**라고 부릅니다. 이 방식은 매우 효과적이지만, 수백만 점의 그림을 판단하기 위해 수천 명의 인간을 고용하는 것은 엄청나게 비용이 많이 들고 느린 일입니다. 마치 금도금된 울타리가 필요하지 않은데도 금도금된 울타리를 사려고 하는 것과 같습니다.

문제점: "저렴한" 비평가

비용을 아끼기 위해, 연구자들은 인간 대신 (다른 컴퓨터 프로그램인) AI 비평가를 사용하여 판단하도록 시도했습니다. 그들은 "사람에게 돈을 주는 대신 컴퓨터를 쓰면 공짜 아닌가?"라고 생각했습니다.

하지만 함정이 있습니다. 이 AI 비평가들은 완벽하지 않습니다. 그들은 실수를 저지르고, 이상한 편향을 가지며, 때로는 그냥 추측하기도 합니다. 만약 당신이 이 결함 있는 AI의 의견만을 가지고 화가를 훈련시킨다면, 화가는 혼란에 빠져 이상한 실수를 하기 시작할 것입니다. 이는 마치 내비게이션이 가끔 호수로 운전하라고 지시할 때, 그 내비게이션의 말을 듣고 운전을 배우는 것과 같습니다.

해결책: DeDPO (The "Smart Teacher")

이 논문의 저자들인 DeDPO는 이러한 결함 있고 불완전한 AI 비평가를 사용하면서도 그들의 실수 때문에 혼란스러워지지 않는 영리한 방법을 고안해 냈습니다. 그들은 두 가지 아이디어를 결합했습니다:

  1. 소규모의 인간 팀: 여전히 "골드 스탠다드(표준)" 답변을 제공할 소수의 실제 인간이 존재합니다.
  2. 거대한 AI 비평가 군단: 엄청난 양의 그림을 판단하기 위해 저렴한 AI를 사용합니다.

마법의 기술: "편향이 제거된(Debiased)" 교정
보통 인간의 의견과 AI의 의견을 섞으면 AI의 실수가 전체 시스템을 망가뜨립니다. DeDPO는 이 오류를 수정하기 위해 수학적인 "교정 필터"(인과 추론이라는 분야에서 빌려온 것)를 사용합니다.

이렇게 생각해 보세요:

  • AI 비평가는 노이즈가 섞인 라디오 방송국입니다. 음악을 틀어주긴 하지만, 정전기(노이즈)가 아주 많습니다.
  • 인간 비평가는 완벽하고 깨끗한 녹음본입니다.
  • DeDPO는 똑똑한 음향 엔지니어입니다. 그는 콘서트 내내 노이즈가 섞인 라디오(AI)를 듣지만, 몇몇 핵심 곡들에 대해서는 완벽한 녹음본(인간)도 함께 가지고 있습니다.

음향 엔지니어는 완벽한 녹음본을 사용하여 라디오가 음악을 어떻게 왜곡시키는지 정확히 파악합니다. 일단 왜곡 패턴을 파악하고 나면, 나머지 노이즈 섞인 라디오 방송에서 그 정전기를 "빼버릴" 수 있습니다. 갑자기, 저렴한 AI 피드백이 값비싼 인간 피드백만큼이나 좋아집니다.

실제 적용 방식

논문은 이 방법을 두 개의 유명한 이미지 생성기(SD1.5 및 SDXL)에 대해 테스트했습니다. 그들은 모델에 다음을 제공했습니다:

  • 실제 인간의 레이블이 붙은 데이터 25% ("완벽한 녹음본")
  • AI가 생성한 레이블이 붙은 데이터 75% ("노이즈 섞인 라디오")

결과:

  • 표준 방식 (DPO): 특별한 교정 없이 인간과 AI의 레이블을 그냥 섞었을 때, 모델은 오히려 더 나빠졌습니다. AI의 노이즈가 인간의 가이드를 압도해 버렸기 때문입니다.
  • DeDPO: 모델은 완벽하게 학습되었습니다. 실제로, DeDPO는 100% 인간의 레이블로 훈련된 모델과 동등하거나, 때로는 심지어 더 나은 성능을 보여주었습니다.

이것이 중요한 이유

저자들은 AI 예술을 인간의 가치에 맞추기 위해 반드시 인간 군단을 고용할 필요는 없다는 것을 증명했습니다. 약간의 인간의 도움을 통해 방대한 양의 저렴한 AI 피드백을 "교정(calibrate)"할 수 있습니다.

  • 비유: 이는 거대한 솥의 국물 맛을 보고 소금이 필요한지 알려주는 한 명의 전문 요리사와 같습니다. 요리사가 단 한 번의 교정을 해주면, 나머지 솥의 간은 자동 조미 기계에 맡길 수 있습니다.
  • 결과: 이는 막대한 비용을 들이거나 수년을 기다리지 않고도 AI 정렬(AI가 도움이 되고 안전하도록 가르치는 것)을 확장할 수 있게 해줍니다.

요약하자면, DeDPO는 적은 양의 "비싼" 인간의 지혜를 사용하여 노이즈를 제거함으로써, "저렴한" 피드백으로부터 AI가 학습할 수 있게 해주는 방법이며, 결과적으로 높은 품질의 정렬된 AI 예술을 높은 비용 없이 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →