← 최신 논문
🤖 AI

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

본 논문은 비전-언어 모델 기반 보상들의 도메인 불일치와 높은 비용을 극복하기 위해 노이즈가 있는 확산 상태에 직접 선호도 학습을 공식화하여, 훨씬 낮은 자원 요구 사항으로 우수한 정렬 성능을 달성하는 계산적으로 효율적인 확산 기반 잠재 보상 모델인 DiNa-LRM 을 소개합니다.

원저자: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 화가에게 당신의 설명에 기반하여 그림을 그리도록 가르친다고 상상해 보세요. 이 로봇은 **확산 모델 (Diffusion Model)**이라고 불리는 복잡한 내부 시스템을 사용하는데, 흐릿하고 잡음이 섞인 정적 (static) 상태에서 시작해 점차 정화하여 선명한 이미지가 나타나도록 합니다.

이 로봇이 실제로 당신이 좋아하는 것을 그리도록 가르치기 위해서는 로봇의 초안들을 살펴보고 "잘했어!" 또는 "다시 시도해 봐"라고 말하는 "교사 (Reward Model)"가 필요합니다.

문제: 기존 교사는 너무 무겁고 맞지 않았습니다

현재 가장 우수한 "교사"들은 거대한 **시각 - 언어 모델 (Vision-Language Models, VLMs)**입니다. 이를 전 세계의 모든 책을 읽고 모든 그림을 본 초지능적인 거대한 도서관으로 생각할 수 있습니다.

  • 문제점: 이러한 거대한 도서관은 무겁습니다. 실행하는 데 많은 컴퓨터 성능이 필요하며 속도가 느립니다.
  • 불일치: 로봇 화가는 "압축된 추상적 세계 (잠재 공간, Latent Space)"에서 작동하지만, 거대한 도서관 교사는 최종 고해상도 사진 (픽셀 공간, Pixel Space) 을 봅니다. 이는 요리사가 재료를 조리한 후의 상태가 아니라, 재료가 조리되는 동안의 상태를 맛보라고 요구하는 것과 같습니다. 이 불일치는 가르치는 과정을 비효율적이고 혼란스럽게 만듭니다.

해결책: DiNa-LRM (내재적 교사)

이 논문의 저자들은 DiNa-LRM이라는 새로운 유형의 교사를 개발했습니다. 거대한 외부 도서관을 고용하는 대신, 로봇 화가 자신의 내부 두뇌를 교사로 활용했습니다.

다음은 간단한 비유를 통해 그 작동 원리를 설명한 것입니다:

1. "잡음 보정" 눈

로봇 화가는 잡음 (정적) 에서 시작해 시간이 지남에 따라 이를 정화하며 이미지를 생성합니다.

  • 기존 방식: 교사는 최종적으로 정제된 이미지만 봅니다.
  • DiNa-LRM 방식: 이 새로운 교사는 이미지가 여전히 잡음이 섞이고 흐릿한 상태일 때를 봐도 편안합니다.
  • 비유: 음악 프로듀서가 밴드를 가르치는 상황을 상상해 보세요. 전통적인 교사는 곡이 완전히 믹싱되고 마스터링된 후에만 비평합니다. 반면, DiNa-LRM 은 녹음 도중 스튜디오에 앉아 원본의 잡음이 섞인 트랙을 듣는 프로듀서와 같습니다. 교사가 "잡음"을 자연스럽게 이해하기 때문에 각 단계에서 기대할 수 있는 불확실성의 정도를 정확히 파악합니다. 이미지가 매우 흐릿하면 교사는 "아직 100% 확신이 없으니 채점할 때 조금 더 신중하게 하겠다"고 말합니다. 이미지가 선명하면 교사는 높은 확신으로 채점합니다.

2. "시간 여행" 앙상블

교사가 완성된 이미지에 최종 점수를 매겨야 할 때, 단순히 한 번만 보지 않습니다.

  • 비유: 영화의 줄거리를 추측한다고 가정해 보세요. 마지막 장면만 보면 오해할 수 있습니다. 대신 영화의 10%, 50%, 90% 지점을 각각 보고 그 관점들을 결합하면 더 잘 이해할 수 있습니다.
  • DiNa-LRM 의 방식: 이 모델은 이미지가 여러 단계의 "정제 정도 (다른 잡음 수준)"에 있을 때를 모두 살펴보고, 그 모든 의견을 하나의 최종적이고 매우 정확한 점수로 결합합니다. 이를 **잡음 앙상블 (Noise Ensembling)**이라고 합니다. 이는 더 큰 두뇌가 필요하지 않으면서도 교사를 훨씬 더 견고하고 신뢰할 수 있게 만듭니다.

3. 결과: 더 빠르고, 저렴하며, 더 똑똑함

이 논문은 이 새로운 교사를 기존 거대한 도서관들과 다른 시도들과 비교하여 테스트했습니다.

  • 성능: DiNa-LRM 은 인간이 선호하는 그림을 판단하는 데 있어 최고의 거대한 도서관과 거의同等한 수준입니다.
  • 효율성: 압축된 세계 내부에 존재하기 때문에, 판단을 위해 이미지를 완전한 사진으로 디코딩할 필요가 없습니다.
    • 메모리 사용량이 51% 감소합니다 (컴퓨터의 RAM 을 절반만 필요로 하는 것과 같습니다).
    • 실제 판단을 위한 컴퓨팅 성능 사용량이 71% 감소합니다.
  • 학습: 로봇 화가를 훈련시키는 데 사용될 때, 로봇은 더 빠르게 학습하며 교사의 관점과 화가의 관점 사이의 불일치로 인한 혼란을 겪지 않습니다.

요약

이 논문은 가르치는 이미지 생성기와 동일한 "언어"를 사용하는 보상 모델인 DiNa-LRM을 소개합니다. 거대한 외부 전문가가 자신의 생각을 생성기의 언어로 번역하도록 강요하는 대신, DiNa-LRM 은 생성기 자신의 내부 구조를 활용하여 작업을 채점합니다. 이는 불확실성 (잡음) 을 처리하는 데 더 똑똑하며, 진행 중인 작업을 살펴보고 더 나은 최종 판단을 내릴 수 있으며, 이 모든 것을 훨씬 적은 컴퓨터 성능을 사용하면서 수행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →