← 최신 논문
💬 NLP

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

이 논문은 확산 언어 모델 (dLLMs) 의 로그 가능도 계산 불가로 인한 강화학습 정렬의 어려움을 해결하기 위해, 로그 가능도의 상한과 하한을 모두 활용하는 '샌드위치 정책 경사 (SPG)' 방법을 제안하여 기존 ELBO 기반 방법보다 GSM8K, MATH500 등 다양한 벤치마크에서 성능을 크게 향상시켰음을 보여줍니다.

원저자: Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

게시일 2026-04-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 배경: 새로운 방식의 언어 모델 (확산 모델)

기존의 언어 모델 (예: 챗봇) 은 '한 글자씩 순서대로' 글을 씁니다. ( autoregressive ) 마치 줄지어 서서 한 명씩 말을 하는 것처럼요.
하지만 이 논문에서 다루는 **'확산 모델 (Diffusion Model)'**은 다릅니다. 처음엔 글자가 다 가려진 (마스크된) 상태였다가, 여러 글자를 한 번에 동시에 찾아내며 글을 완성합니다.

  • 장점: 여러 글자를 한 번에 찾아내므로 매우 빠릅니다.
  • 단점: "내가 이 글을 쓸 확률이 정확히 얼마일까?"를 계산하는 것이 수학적으로 매우 어렵습니다 (계산 불가능).

2. 문제점: 잘못된 나침반 (기존 RL 의 한계)

모델을 더 똑똑하게 만들기 위해 '강화 학습 (RL)'을 시키려 합니다. 이는 모델이 좋은 답을 내면 칭찬하고, 나쁜 답을 내면 혼내는 과정입니다.

  • 기존 방법: 모델이 "이 답을 낼 확률이 얼마나 될까?"를 계산할 때, 정확한 값 대신 **'하한선 (ELBO)'**이라는 대략적인 추정치를 사용했습니다.
  • 비유: 등산가 (모델) 가 정상에 오르는 길 (보상) 을 찾는데, 지도 (확률 계산) 가 반쪽짜리였습니다.
    • 좋은 길 (칭찬) 에는 "이 길이 더 좋아!"라고 알려주지만, 나쁜 길 (혼자) 에는 "이 길이 더 나빠!"라고 알려주려 해도 지도가 불완전해서 오히려 나쁜 길을 더 좋아하게 만들거나, 혼을 내는 효과가 반감되는 문제가 생겼습니다.

3. 해결책: SPG (샌드위치 정책 경사)

저자들은 이 문제를 해결하기 위해 **'샌드위치 (Sandwich)'**라는 아이디어를 제안했습니다.

  • 아이디어: 정확한 확률 값을 알 수 없다면, 그 값을 **'위쪽 (Upper Bound)'**과 '아래쪽 (Lower Bound)' 두 개의 빵 사이에 끼워 잡으세요.
    • 좋은 답 (칭찬) 이 나올 때: 모델이 그 답을 낼 확률을 높이려고 노력합니다. 이때는 **'아래쪽 빵 (하한선)'**을 이용합니다. (이건 충분히 정확합니다.)
    • 나쁜 답 (혼자) 이 나올 때: 모델이 그 답을 낼 확률을 낮추려고 노력합니다. 이때는 **'위쪽 빵 (상한선)'**을 이용합니다. (기존 방법으로는 나쁜 답을 줄이는 게 어려웠는데, 이걸로 해결합니다.)

결과: 모델이 "좋은 건 더 잘하고, 나쁜 건 더 못하게" 만드는 것이 훨씬 정확해졌습니다. 마치 샌드위치 사이에 고기 (정확한 학습) 를 꽉 끼운 것처럼요.

4. 추가 기술: 블록 단위의 가리기 (Block-wise Masking)

모델을 가르칠 때, 어떻게 질문을 변형해서 연습시킬지 고민했습니다.

  • 기존: 글자 하나하나를 무작위로 가리는 방식. (너무 무작위적이라 모델이 헷갈림)
  • SPG 의 방법: 글을 조각 (블록) 으로 나누어 가립니다.
    • 비유: 퍼즐을 풀 때, 한 조각씩 무작위로 지우는 게 아니라, 앞쪽은 다 보이고 뒤쪽은 다 가린 채, 중간 한 조각만 가리는 방식입니다.
    • 이렇게 하면 모델이 실제 답을 찾는 과정 (생성 과정) 과 훈련 과정이 더 비슷해져서, 학습이 훨씬 안정적이고 빠릅니다.

5. 성과: 얼마나 잘했을까요?

이 새로운 방법 (SPG) 으로 훈련한 모델은 수학 문제, 논리 퍼즐, 코딩 등 다양한 시험에서 기존 최고 성능을 가진 모델들을 크게 앞섰습니다.

  • 수학 문제 (GSM8K): 정확도가 3.6% 향상.
  • 수학 난이도 높은 문제 (MATH500): 2.6% 향상.
  • 숫자 퍼즐 (Countdown): 18.4% 향상 (엄청난 차이!).
  • 스도쿠 (Sudoku): 27.0% 향상 (거의 3 배 가까이 좋아짐!).

요약

이 논문은 **"확산 언어 모델"**이라는 빠르지만 학습이 어려운 모델을 가르칠 때, **"칭찬할 땐 아래쪽 기준, 혼낼 땐 위쪽 기준"**으로 샌드위치처럼 양쪽을 모두 활용하는 지능적인 학습법 (SPG) 을 개발했습니다. 그 결과, 모델이 훨씬 더 똑똑해지고 복잡한 문제도 잘 풀 수 있게 되었습니다.

한 줄 평: "나쁜 답을 혼낼 때, 기존 지도는 무용지물이었는데, 이제 '샌드위치'처럼 양쪽에서 꽉 잡아서 가르치니 모델이 훨씬 똑똑해졌습니다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →