← 최신 논문
💬 NLP

Entropy Aware Reward Guidance for Diffusion Language Model Alignment

본 논문은 예측 엔트로피에 기반하여 연속 토큰 완화와 하드 토큰 사이를 동적으로 보간하는 새로운 방법인 EntRGi 를 소개하여 이산 확산 언어 모델을 위한 효과적인 보상 안내를 가능하게 하고, 테스트 시간 적응과 보상 안내 강화 학습 (RGRL) 을 통한 사후 학습 모두에서 최첨단 방법보다 일관된 개선을 보여줍니다.

원저자: Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 재능이 있지만 약간 혼란스러운 Diffusion이라는 이름의 예술가가 있다고 상상해 보세요. 이 예술가는 정적 잡음으로 완전히 덮인 캔버스 (신호가 없는 TV 화면과 같은) 에서 시작해 잡음을 서서히 제거하며 이미지 (또는 이야기) 를 드러내는 방식으로 그림을 그리거나 (또는 이야기를 씁니다).

일반적으로 이 예술가는 어떤 색조든 섞을 수 있는 페인트를 섞는 것처럼 "연속적인" 세계에서 작업합니다. 하지만 이 논문에서 이 예술가는 **이산 토큰 (discrete tokens)**으로 작업합니다. 이를 구별되고 분리된 레고 블록으로 생각하세요. "빨간색" 블록과 "파란색" 블록을 섞어 "보라색"을 만들 수 없습니다. 하나를 선택하거나 다른 하나를 선택해야 합니다.

저자들이 해결하려는 문제는 **리워드 모델 (Reward Model, 최종 그림을 평가하는 비평가)**을 이용해 이 예술가에게 "아니, 그 빨간색 블록이 아니야! 더 좋은 빨간색 블록으로 만들어줘"라고 말하는 방법입니다.

핵심 문제: "번역기"의 붕괴

기존 방식 (연속 모델) 에서는 예술가와 비평가가 같은 언어를 사용합니다. 비평가가 "붓을 약간 왼쪽으로 움직여라"라고 말하면 예술가는 어떻게 조정해야 할지 정확히 이해합니다.

하지만 이 레고 블록 모델에서는 비평가가 완성된 단단한 블록만 평가하는 방법을 알고 있습니다.

  • "기대 (Expectation)" 방법: 일부는 예술가가 부드러운 지시를 받을 수 있도록 비평가에게 블록의 "흐릿한" 버전 (빨간색과 파란색의 혼합) 을 제시하려 했습니다. 하지만 비평가는 날카롭고 실제적인 블록만으로 훈련되었습니다. 이는 마치 음식 비평가에게 당근과 셀러리를 갈아 만든 스무디를 평가하라고 하는 것과 같습니다. 비평가는 그런 것을 처음 접해본 적이 없기 때문에 무엇을 말해야 할지 모릅니다. 피드백은 신뢰할 수 없습니다.
  • "APS" 방법 (이전 최선): 다른 이들은 좋은 점수를 얻기 위해 비평가에게 실제 날카로운 블록을 보여주었지만, 예술가에게는 그 블록이 여전히 흐릿한 것처럼 가장하라고 하여 부드러운 지시를 받도록 했습니다. 이는 판사에게 완벽한 스테이크를 보여주면서, 요리사에게 "이 스테이크가 액체 수프라고 상상해라"라고 말하며 지시를 내리는 것과 같습니다. 지시가 현실과 맞지 않아 혼란을 초래합니다.

해결책: EntRGi ("신뢰도 게이지")

저자들은 **EntRGi (엔트로피 인식 리워드 가이던스, Entropy-Aware Reward Guidance)**를 소개합니다. 이를 예술가를 위한 스마트한 신뢰도 게이지로 생각하세요.

예술가가 작업하는 동안, 때로는 어떤 블록을 선택할지 매우 확신합니다 (낮은 엔트로피/높은 신뢰도), 때로는 완전히 추측합니다 (높은 엔트로피/낮은 신뢰도).

  • 예술가가 확신할 때: 신뢰도 게이지는 "네가 무엇을 하고 있는지 알고 있어! 비평가에게 실제 단단한 블록을 보여줘"라고 말합니다. 이는 비평가가 이해하는 것을 평가하므로 신뢰할 수 있고 정확한 점수를 보장합니다.
  • 예술가가 추측할 때: 신뢰도 게이지는 "네가 불확실해! 비평가에게 가능성의 흐릿한 혼합을 보여주자"라고 말합니다. 이는 예술가가 창의적 과정의 흐름을 깨뜨리지 않고 개선 방법을 위한 부드럽고 연속적인 지시를 받을 수 있게 합니다.

마법 같은 점: EntRGi 는 예술가가 얼마나 확신하는지에 따라 블록 하나하나마다 이 두 가지 모드 사이를 자동으로 전환합니다. 비평가로부터의 신뢰할 수 있는 피드백과 예술가를 위한 부드럽고 정확한 지시라는 두 가지 세계의 장점을 모두 얻습니다.

결과: 더 나은 예술과 새로운 훈련

이 논문은 이 방법이 두 가지 수준에서 이전 시도들보다 더 잘 작동한다고 보여줍니다.

  1. 테스트 시간 적응 (The "Live Edit"): 예술가가 그림을 그리는 동안 EntRGi 는 예술가를 처음부터 다시 훈련시키지 않고도 더 나은 최종 이미지를 만들기 위해 과정을 조종하도록 돕습니다. 이는 배우가 즉흥 연기를 할 때 언제 부드럽게 자극을 주고 언제 내버려 둬야 할지 정확히 아는 현장 감독과 같습니다.
  2. RGRL (리워드 유도 강화 학습, Reward Guided Reinforcement Learning): 저자들은 또한 RGRL이라는 새로운 훈련 레시피를 만들었습니다. 완성된 그림을 보여주고 "잘했다" 또는 "나쁘다"라고 말하는 것 (이는 모호함) 대신, EntRGi 의 부드러운 피드백을 사용하여 예술가에게 어떻게 더 나아질 수 있는지 가르칩니다. 이는 단순히 점수를 매기는 대신 선수의 현재 상태를 기반으로 구체적이고 상세한 훈련을 제공하는 코치와 같습니다.

결론

이 논문은 이 "신뢰도 게이지 (EntRGi)"를 사용하여 이산 레고 블록 모델을 이전보다 더 높은 품질의 결과를 생성하도록 유도할 수 있다고 주장합니다. 그들은 70 억 개의 파라미터를 가진 대규모 모델에서 이를 테스트하여 생성 중 모델을 단순히 안내할 때뿐만 아니라 모델을 더 똑똑하게 훈련시킬 때에도 이전 최선 방법들을 일관되게 능가한다는 사실을 발견했습니다.

또한 이 방법은 예술가와 비평가가 약간 다른 "어휘"(서로 다른 레고 블록 세트) 를 사용할 때도 작동한다고 지적했는데, 이는 일반적인 현실 세계의 문제입니다.

간단히 말해: 그들은 비평가를 행복하게 하고 예술가가 학습하도록 유지하는 방식으로 혼란스러운 레고 예술가와 대화하는 방법을 찾아냈으며, 그 결과 더 나은 이야기와 이미지를 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →