← 최신 논문
💬 NLP

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

본 논문은 트리 구조 롤아웃, 검증 가능한 단계별 보상, 시간 계획 자기 증류를 통해 보상 희소성과 확률 추정 격차를 해결하여 여러 추론 벤치마크에서 상당한 성능 향상을 달성하는 확산 언어 모델을 위한 신뢰할 수 있는 강화 학습 프레임워크인 d-TreeRPO 를 소개합니다.

원저자: Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 퍼즐, 예를 들어 스도쿠나 수학 문제를 해결하는 로봇을 가르친다고 상상해 보세요. 이 로봇은 확산 대규모 언어 모델 (Diffusion Large Language Model, dLLM) 이라는 특별한 두뇌를 사용합니다. 한 단어씩 답을 작성하는 (문장을 타이핑하는 것처럼) 일반적인 로봇과 달리, 이 로봇은 빈 페이지가 뒤섞인 상태에서 시작해 점차적으로 '노이즈를 제거'하며 혼란스럽고 비선형적인 순서로 올바른 단어를 드러내어 최종 해답이 나타나도록 합니다.

이 논문은 이 로봇을 훨씬 더 똑똑하고 신뢰할 수 있게 만들기 위해 d-TreeRPO라는 새로운 학습 방법을 소개합니다. 이것이 어떻게 작동하는지 간단한 개념으로 나누어 설명하면 다음과 같습니다:

1. 문제: "눈가리개"를 한 로봇

저자들은 이러한 로봇을 훈련시키는 기존 방법에는 두 가지 주요 결함이 있다고 말합니다:

  • "전부 아니면 전무 (All-or-Nothing)" 보상: 현재 로봇이 퍼즐을 해결하면 높은 점수를 받고, 실패하면 0 점만 받습니다. 로봇은 어떤 특정 단계가 좋았는지 나빴는지 알 수 없습니다. 마치 비디오 게임을 할 때 마지막에 실패의 원인이 된 수에 대한 힌트 없이 단순히 "게임 오버" 화면만 나오는 것과 같습니다. 이로 인해 학습이 느리고 부정확해집니다.
  • "혼란스러운" 확률: 로봇은 어떤 순서로든 단어를 드러낼 수 있기 때문에 특정 단어에 대해 얼마나 확신하는지 정확히 계산하기 어렵습니다. 기존 방법들은 이 확신을 추측하지만, 그 추측이 종종 틀려 로봇이 나쁜 결정을 내리게 합니다.

2. 해결책: "나무 탐험가" (d-TreeRPO)

이를 해결하기 위해 저자들은 d-TreeRPO라는 프레임워크를 구축했습니다. 로봇에게 지도와 확대경을 주는 것과 같습니다.

A. 나무 구조 (지도)

로봇이 단순히 하나의 답을 추측하는 대신, d-TreeRPO 는 로봇이 한 번에 여러 경로를 탐색하도록 합니다. 마치 나무의 가지처럼요.

  • 줄기: 시작 질문.
  • 가지: 로봇이 퍼즐을 채우는 다양한 방법을 시도합니다.
  • 잎: 최종 답안.

만약 가지가 막다른 길 (틀린 답) 로 이어진다면, 로봇은 그 가지의 어디에서 잘못되었는지 정확히 알 수 있습니다. 그런 다음 나무를 타고 "올라가" "좋아, 그 특정 단계가 나빴구나"라고 말할 수 있습니다. 이는 로봇에게 최종 결과뿐만 아니라 매 단계에 대한 세밀한 피드백을 제공합니다.

B. 자기 증류 손실 (The "Confidence Coach")

이것은 두 번째 주요 혁신입니다. 저자들은 미묘한 트레이드오프를 발견했습니다:

  • 로봇이 너무 호기심 많으면 (확신이 낮으면) 많은 아이디어를 탐색하지만 성급한 추측을 합니다.
  • 로봇이 너무 고집 세면 (확신이 높으면) 정확하게 추측하지만 새로운 시도를 멈춥니다.

d-TreeRPO 는 이를 관리하기 위해 시간 계획 자기 증류 손실 (Time-Scheduled Self-Distillation Loss) 을 사용합니다. 훈련 캠프의 날짜에 따라 로봇에게 다르게 말하는 코치라고 상상해 보세요:

  • 초기: 코치는 "호기심을 가져라! 모든 것을 시도해 봐라! 완벽할 필요는 없어"라고 말합니다. 이는 로봇이 탐색하도록 장려합니다.
  • 나중: 코치는 "이제 옵션들을 보았으니, 결단력을 가져라! 최선의 수에 집중하고 직감을 믿어라"라고 말합니다. 이는 로봇이 더 확신 있고 정밀해지도록 강요합니다.

로봇을 "호기심 많은 탐험가"에서 "확신 있는 전문가"로 서서히 전환함으로써, 이 방법은 로봇의 내부 수학 (확률 추정) 이 시간이 지남에 따라 훨씬 더 정확해지도록 보장합니다.

3. 결과: 더 똑똑한 해결

저자들은 이 새로운 방법을 네 가지 다른 유형의 퍼즐에 대해 테스트했습니다:

  1. 스도쿠 (논리 격자)
  2. 카운트다운 (수학으로 숫자 만들기)
  3. GSM8K (초등학교 수학 단어 문제)
  4. Math500 (더 어려운 수학 문제)

결과:
d-TreeRPO 로 훈련된 로봇은 이전 버전보다 엄청난 개선을 보였습니다.

  • 스도쿠에서 86% 향상되어 성공률이 거의 두 배가 되었습니다.
  • 카운트다운에서 51% 향상되었습니다.
  • 수학 벤치마크에서도 견고한 향상을 보였습니다.

결론

이 논문은 로봇의 학습 과정을 나무로 조직화하여 (각 단계에 대한 더 나은 피드백 확보) 그리고 시간 기반 코칭 시스템을 사용하여 (호기심과 확신 사이의 균형 유지) 확산 언어 모델에게 추론을 가르치는 훨씬 더 신뢰할 수 있는 방법을 만들었다고 주장합니다. 그 결과, 로봇은 이전보다 논리 및 수학 퍼즐을 훨씬 더 잘 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →