← 최신 논문
💻 computer science

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

본 논문은 픽셀 공간 디코딩을 요구하지 않으면서 최적화를 위한 신뢰할 수 있는 조밀한 피드백을 제공하기 위해 샘플 적응형 불확실성 추정치를 갖춘 보상 분포를 학습함으로써 확산 모델의 사후 학습을 강화하는 통합 잠재 공간 프레임워크인 \textsc{SURE}를 제안한다.

원저자: Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 화가에게 그림 그리는 법을 가르치고 있다고 상상해 보세요. 로봇이 작품 하나를 다 완성할 때까지 기다렸다가 "아니, 그 개는 감자처럼 생겼잖아"라고 말하고 싶지는 않을 것입니다. 당신은 로봇이 캔버스에 색을 섞고 있는 동안에도 힌트를 속삭여주고 싶을 것입니다. 이것이 바로 정적인 노이즈(static noise)를 단계별로 선명한 그림으로 천천히 바꾸어 이미지와 비디오를 생성하는 AI의 한 종류인 **확산 모델(diffusion models)**의 세계입니다. 이 로봇들이 실제로 인간이 좋아하는 그림을 그리게 하려면, 좋은 예술에는 점수를 주고 나쁜 예술에는 감점을 주는 "보상 시스템"—즉, 선생님이 필요합니다.

전통적으로 이 선생님은 로봇이 그림을 다 그릴 때까지 기다렸다가, 최종 결과물을 보고 점수를 매깁니다. 하지만 이는 느리고 비용이 많이 드는데, 왜냐하면 힌트를 얻기 위해 로봇이 전체 이미지를 완성할 때까지 기다려야 하기 때문입니다. 최신 방법들은 선생님이 지저-분한 미완성 스케치(이를 "잠재 변수(latents)"라고 부릅니다)를 미리 엿보고 더 일찍 피드백을 줄 수 있게 해줍니다. 하지만 여기에는 함정이 있습니다. 이 선생님들은 대개 "10점 만점에 8점"과 같이 단 하나의 숫자만 외칠 뿐, 자신이 얼마나 확신하고 있는지는 말해주지 않습니다. 만약 선생님이 근거 없이 마구잡이로 추측하면서도 높은 점수를 외친다면, 로봇은 혼란에 빠져 그 가짜 점수를 쫓아가기 위해 이상한 것을 그리기 시작할 수도 있습니다. 이 논문은 로봇에게 자신의 선생님을 어떻게 신뢰하고, 언제 무시해야 하는지를 가르치는 문제를 다룹니다.


문제점: 과도하게 자신만만한 선생님

엄격한 미술 선생님이 당신의 스케치를 채점하고 있다고 상상해 보세요. 과거의 이 선생님은 당신의 반쯤 완성된 그림을 보고는 그저 "잘했어!" 또는 "못했어!"라며 단 하나의 숫자로 말하곤 했습니다. 문제는 이 선생님이 가끔 자신이 무엇을 말하고 있는지 모를 때가 있다는 점입니다. 스케치가 너무 흐릿해서 선생님이 그저 추측하고 있는 것일 수도 있는데, 여전히 높은 점수를 외칠 수도 있습니다. 만약 학생인 당신이 그 높은 점수를 맹목적으로 따른다면, 당신은 실제로 잘못된 길로 가고 있음에도 불구하고 잘하고 있다고 착각하며 똑같은 실수를 반복하게 될 것입니다. AI의 세계에서는 이를 "보상 해킹(reward hacking)"이라고 부르는데, 이는 AI가 실제로 더 나은 예술을 만드는 대신 높은 점수를 받기 위한 편법을 찾아내는 현상을 말합니다.

이 논문의 저자들이 만든 SURE(Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training)라는 시스템은 기존의 선생님들에게 결정적인 정보 하나가 빠져 있다는 것을 깨달았습니다. 그것은 바로 **확신(confidence)**입니다. 그들은 선생님이 "이 그림은 90% 확신하며 좋은 그림입니다" 또는 "저는 20%만 확신하니 제 말을 너무 깊게 듣지 마세요"라고 말할 수 있는 방법이 필요했습니다.

해결책: 자신의 불확실성을 인정하는 선생님

저자들은 이 문제를 해결하기 위해 두 부분으로 구성된 시스템을 구축했습니다.

파트 1: 불확실성을 인지하는 선생님 (SURE-LRM)
먼저, 그들은 새로운 종류의 보상 모델을 만들었습니다. 이 모델은 단순히 점수만 주는 것이 아니라, 점수와 함께 그 점수가 얼마나 흔들리는지를 나타내는 척도를 함께 제공합니다. 이것은 마치 일기 예보와 같습니다. 일반적인 선생님은 "비가 올 것입니다"라고 말합니다. 하지만 새로운 SURE-LRM 선생님은 "비가 올 것입니다. 그리고 저는 95% 확신합니다" 또는 "비가 올 수도 있지만, 구름 모양이 이상해서 저는 40%만 확신합니다"라고 말합니다.

그들은 이 선생님을 특별한 방식으로 훈련시켰는데, 이 방식은 이미지 쌍(하나의 좋은 이미지와 하나의 나쁜 이미지)을 관찰하며 단순히 어떤 것이 더 나은지를 배우는 것을 넘어, '좋음'의 정도가 얼마나 변동하는지를 학습합니다. 만약 선생님이 지저분하고 혼란스러운 스케치를 본다면, 높은 "불확실성" 점수를 주도록 학습합니다. 만약 명확하고 확실한 걸작을 본다면, 낮은 불확실성 점수를 줍니다. 결정적으로, 이 논문은 이 선생님이 인간이 명시적으로 확신도를 라벨링하지 않아도, 표준적인 "좋음 vs 나쁨"의 예시들을 보는 것만으로도 이 확신 수준을 학습할 수 있다는 것을 보여줍니다.

파트 2: 똑똑한 학생 (SURE-REFL)
다음으로, 그들은 이 새로운 선생님을 사용하는 SURE-REFL이라는 훈련 방법을 만들었습니다. AI 예술가가 학습할 때, 선생님에게 그림 과정의 여러 단계에서 피드백을 요청합니다. 보통의 AI라면 모든 피드백을 받아들이고 그것을 맹목적으로 따르려 할 것입니다. 하지만 SURE-REFL을 갖춘 AI는 먼저 선생님의 "확신도 측정기"를 살펴봅니다.

만약 선생님이 "점수: 10점 만점에 8점, 확신도: 낮음"이라고 말한다면, AI는 "알겠어, 듣기는 하겠지만 이 피드백 때문에 내 그림 전체를 바꾸지는 않을 거야"라고 생각합니다. 만약 선생님이 "점수: 10점 만점에 8점, 확신도: 높음"이라고 말한다면, AI는 "알겠습니다! 반드시 이렇게 더 그려야겠군요"라고 생각합니다. 이 시스템은 본질적으로 피드백의 무게를 조절합니다. 높은 확신도는 무거운 무게를, 낮은 확신도는 가벼운 무게를 부여합니다. 이를 통해 AI가 선생님의 추측 때문에 혼란에 빠지는 것을 방지합니다.

연구 결과

연구진은 이미지 생성기(고양이 사진 만들기 등)와 비디오 생성기(짧은 영화 클립 만들기 등) 모두에서 이 시스템을 테스트했습니다.

  • 더 나은 선생님: 새로운 SURE-LRM 선생님은 기존 방식보다 인간의 선호도를 더 잘 예측했습니다. 2,000개의 이미지 쌍을 대상으로 한 테스트에서, 선생님이 가장 확신하는 부분(불확실성이 낮은 하위 50%)의 예측만을 유지했을 때, 정확도가 약 **79.4%**에서 **90.1%**로 급증했습니다. 이는 선생님의 "확신도 측정기"가 어떤 예측이 신뢰할 수 있는지에 대해 진실을 말하고 있었다는 것을 입증합니다.
  • 안정적인 학습: SURE-REFL을 사용하여 AI를 훈련시켰을 때, 학습 과정이 훨씬 안정적이었습니다. 기존 방식에서는 AI의 점수는 올라가는데 실제 예술의 품질은 떨어지는 현상(보상 해킹의 징후)이 나타났습니다. 하지만 SURE-REFL을 사용하면 점수와 실제 품질이 훨씬 더 오랫동안 일치하며 함께 움직였습니다.
  • 최고의 성능: 최종 결과에서 SURE-REFL 방식은 이미지와 비디오의 표준 벤치마크 모두에서 가장 높은 점수를 기록했습니다. 비디오 생성의 경우, 총 품질 점수 0.8357을 달성하여 차순위 방법보다 0.0109 앞섰습니다.

이것이 중요한 이유

이 논문은 AI에게 더 나은 예술을 창조하도록 가르치는 핵심은 단순히 더 똑똑한 선생님을 갖는 것이 아니라, 자신이 무엇을 모르는지 아는 선생님을 갖는 것임을 시사합니다. AI가 선생님의 불안정한 추측은 무시하고 확신이 있는 정보에 집중하게 함으로써, 시스템은 높은 점수를 쫓기 위해 기괴하고 망가진 예술을 만드는 함정에 빠지지 않게 됩니다. 이는 AI 예술가가 단순히 창의적일 뿐만 아니라, 노이즈에 혼란을 겪지 않고 피드백으로부터 학습할 수 있는 신뢰할 수 있는 존재가 되는 것을 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →