← 최신 논문
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

본 논문은 잠재 확산 모델을 활용하여 구조화된 추론 궤적을 생성하고, 계층적 잠재-텍스트 롤아웃을 적용해 잠재 계획의 품질을 텍스트 디코딩 오류와 분리함으로써 엔트로피 붕괴를 방지하며 코드 및 수학 추론 작업에서 기존 토큰 단위 강화학습을 크게 능가하는 강화학습 프레임워크인 LaDi-RL 을 제안합니다.

원저자: Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 고집이 센 학생 (대형 언어 모델) 이 복잡한 퍼즐, 예를 들어 컴퓨터 코드 작성이나 고급 수학 문제 해결을 어떻게 풀 수 있는지 가르친다고 상상해 보세요.

오랫동안 이 학생을 가르치는 가장 좋은 방법은 **강화 학습 (Reinforcement Learning, RL)**이었습니다. 이는 학생이 문제를 풀고 정답을 맞추면 금색 별을, 틀리면 "다시 시도해 보라"는 말을 듣는 게임과 같습니다.

하지만 기존의 가르침 방식에는 큰 결함이 있습니다. 이 방식은 학생에게 한 번에 한 단어씩 생각하도록 강요합니다. 마치 마스터 셰프에게 다음에 다질 재료 하나만 결정하게 하여 전체 연회 계획을 세우라고 하는 것과 같습니다.

  • 문제점: 학생은 "따라서" 대신 "그래서"를 사용하는 것과 같은 사소한 세부 사항에 매몰되어 전체적인 그림을 잊어버립니다. 그들은 문제를 해결하는 다른 영리한 방법들을 무시한 채 몇 가지 전략만 반복적으로 사용합니다. 논문에서는 이를 **"엔트로피 붕괴 (Entropy Collapse)"**라고 부릅니다. 이는 뺄셈이나 곱셈이 더 빠를 때도 덧셈만으로 수학 문제를 해결하는 법만 배운 학생과 같습니다. 결국 그들은 새로운 시도를 멈추고 창의성이 사라집니다.

새로운 아이디어: LaDi-RL (꿈꾸는 학생)

이 논문의 저자인 LaDi-RL 은 학생을 가르치는 다른 방식을 제안합니다. 단어를 하나씩 결정하게 하는 대신, 학생이 숨겨진 추상 공간에서 먼저 해결책 전체를 "꿈꾸게" 한 다음 그것을 적어내도록 합니다.

간단한 비유를 들어 작동 방식을 설명해 보겠습니다.

1. "청사진" 대 "집"

  • 기존 방식 (토큰 수준): 학생은 벽돌 하나하나를 쌓아 집을 짓는데, 진행하면서 각 벽돌의 색상을 결정합니다. 초반에 실수를 하면 집 전체가 비뚤어질 수 있습니다.
  • 새로운 방식 (잠재 확산): 학생은 먼저 머릿속에 청사진 ("잠재 궤적") 을 그립니다. 이 청사진은 구체적인 단어가 아닌 해결책의 논리전략을 나타냅니다.
    • 이 청사진을 "생각 구름"으로 생각하세요. 그것은 아이디어의 연속적이고 유동적인 표현입니다.
    • 학생은 **확산 모델 (Diffusion Model)**이라는 특별한 도구를 사용합니다. 이 도구를 점토 덩어리 (무작위 노이즈) 에서 시작해 완벽한 조각상 (해결책 전략) 이 드러날 때까지 불필요한 부분을 서서히 깎아내는 조각가로 상상해 보세요. 이를 통해 학생은 구체적인 단어를 결정하기 전에 다양한 전략 유형 (예: "기하학을 시도해 보자" 대 "대수학을 시도해 보자") 을 탐색할 수 있습니다.

2. "번역가" 문제

하지만 함정이 하나 있습니다. 학생의 "꿈" (청사진) 은 그들이 이해하는 비밀 언어로 되어 있지만, 최종 답안은 평범한 영어 (또는 코드) 로 작성되어야 합니다.

  • 위험성: 때로는 학생이 훌륭한 청사진을 가지고 있지만, "번역가" (청사진을 텍스트로 변환하는 부분) 가 번역을 망칠 수 있습니다. 학생이 나쁜 점수를 받았을 때, 그 아이디어가 나쁜 것인지, 아니면 단순히 번역이 나쁜 것인지 어떻게 알 수 있을까요?
  • 해결책 (계층적 롤아웃): 논문은 한 번의 번역만으로 청사진을 평가하는 대신, 학생이 동일한 청사진에 대해 여러 번의 번역을 생성하는 교묘한 해결책을 제시합니다.
    • 비유: 한 셰프가 훌륭한 레시피 (청사진) 를 가지고 있다고 상상해 보세요. 요리를 한 번 해보고 요리를 평가하는 대신, 다섯 번 요리를 해봅니다. 다섯 가지 요리 중 네 가지가 맛있다면, 한 가지 요리는 실수로 타버렸더라도 그 레시피는 훌륭하다는 것을 알 수 있습니다. 이는 교사가 학생의 전략이 실제로 영리한지 여부를 훨씬 더 명확하게 파악할 수 있게 해줍니다.

3. 파티의 다양성 유지

학생이 게을러져서 하나의 청사진에만 매몰되지 않도록 하기 위해, 저자들은 **"반발력 (Repulsion Force)"**을 추가합니다.

  • 비유: 보물을 찾으려는 탐험가 무리를 상상해 보세요. 모두 같은 길을 따르면 숨겨진 동굴을 놓칠 수 있습니다. "반발력"은 "이봐, 너는 친구와 너무 가까워! 다른 방향으로 탐험해 봐!"라고 부드럽게 충고하는 것과 같습니다.
  • 이는 학생이 서로 구조적으로 다른 청사진들을 생성하도록 강요하여 다양한 해결책을 탐색하도록 합니다.

그들은 무엇을 발견했을까요?

이 논문은 이 새로운 방법을 코드 작성수학 문제 해결이라는 두 가지 어려운 과제에서 테스트했습니다.

  • 더 높은 정확도: "꿈꾸는 학생" (LaDi-RL) 은 기존의 "벽돌 하나씩 쌓는 학생"에 비해 첫 시도에서 훨씬 더 많은 문제를 정확하게 풀었습니다.
    • 코딩 분야에서는 정확도가 9.4% 향상되었습니다.
    • 수학 분야에서는 5.7% 향상되었습니다.
  • 더 큰 창의성: 기존 학생은 결국 새로운 시도를 멈췄습니다 (엔트로피 붕괴). 하지만 새로운 학생은 다양하고 창의적인 해결책을 계속 찾아냈습니다. 100 개의 서로 다른 답을 생성하라고 요청했을 때, 새로운 학생의 답들은 모두 고유하고 정확했지만, 기존 학생의 답들은 서로 비슷해지고 점점 나빠졌습니다.
  • 효율성: 새로운 학생은 답을 얻기 위해 수천 단어의 "소리 내어 생각하기"를 작성할 필요가 없었습니다. 그들은 생각을 짧고 효율적인 "청사진"으로 압축하여 시간과 컴퓨팅 자원을 절약했습니다.

결론

LaDi-RL 은 AI 가 추론을 배우는 방식을 바꿉니다. AI 를 단어 단위의 작고 경직된 단계로 생각하게 강요하는 대신, AI 가 아이디어의 지형을 먼저 탐색하도록 (확산 과정을 사용하여) 한 다음 그 아이디어를 단어로 번역하게 합니다. 이는 AI 가 고착되는 것을 방지하고, 해결책을 다양하게 유지하며, 더 어려운 문제를 더 정확하게 해결하도록 도와줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →