← 최신 논문
💬 NLP

Mask-Aware Policy Gradients for Diffusion Language Models

이 논문은 마스크드 확산 언어 모델(Masked Diffusion Language Model) 생성을 토큰 선택과 위치 마스킹을 공동으로 최적화하는 2단계 의사결정 과정으로 정형화하여, 로그 가능도(log-likelihood)의 난해함을 극복하고 수학적 추론 및 코딩 벤치마크에서 최첨단 성능을 달성하는 강화 학습 프레임워크인 마스크 인식 정책 경사(Mask-Aware Policy Gradients)를 소개한다.

원저자: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

게시일 2026-07-17
📖 2 분 읽기☕ 가벼운 읽기

원저자: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 쓰거나 수학 문제를 푸는 법을 가르치려 한다고 상상해 보십시오. 오랫동안 이 작업을 수행하는 가장 좋은 방법은 로보트가 사람이 키보드로 타이핑하는 것처럼 한 번에 한 단어씩 쓰게 만드는 것이었습니다. 이것을 "자기회귀적(autoregressive)" 생성이라고 부릅니다. 이는 신뢰할 수 있지만, 고속도로를 가로지르는 달팽이처럼 느립니다. 최근 과학자들은 "확산(Diffusion)"이라 불리는 더 빠른 방법을 발견했습니다. 처음부터 새로 쓰는 대신, 확산 방식의 로봇은 빈 마스크(예: [MASK])로 가득 찬 페이지에서 시작하여 하나씩 빈칸을 채워나가며 문장이 완성될 때까지 점진적으로 내용을 드러냅니다. 이것은 마치 가려진 그림에서 덮개를 하나씩 들어 올려 이미지를 보여주는 퍼즐과 같습니다.

하지만 이 빠른 "확산" 로봇에게 보상을 통해 더 똑똑해지는 법을 가르치는 것(강화 학습이라는 기술)은 악몽과 같았습니다. 기존의 "단어 하나씩" 방식에서는 로봇이 특정 선택을 할 확률이 정확히 얼마였는지 계산하기 쉽습니다. 하지만 "확산" 방식에서 로봇은 매 단계마다 두 가지 선택을 합니다. 즉, 빈 공간에 어떤 단어를 넣을지 결정해야 하고, 동시에 어떤 빈 공간을 다음에 드러낼지도 결정해야 합니다. 이전의 방법들은 로봇에게 가르침을 줄 때 오직 첫 번째 선택(단어)만을 보고 두 번째 선택(드러내는 순서)은 무시하려고 했습니다. 이는 마치 요리사에게 완벽한 식사를 만드는 법을 가르치면서, 재료를 고른 것만 비평하고 재료를 어떤 순서로 썰고 저었는지는 완전히 무시하는 것과 같습니다.

COLM 2026 컨퍼런스에서 발표된 이 논문은 우리가 퍼즐의 거대한 부분을 놓치고 있었다고 제안합니다. 저자인 하란 라제쉬(Haran Raajesh), 쿨린 샤(Kulin Shah) 및 텍사스 대학교 오스틴 캠퍼스의 연구팀은 확산 모델을 진정으로 숙달하려면 로봇이 올바른 단어를 고르는 것뿐만 아니라, 올바른 순서로 내용을 드러내는 것에 대해서도 보상을 주어야 한다고 주장합니다. 그들은 "마스크 인식 정책 경사(Mask-Aware Policy Gradients)"라는 새로운 방법을 개발했습니다. 이 시스템은 단순히 다음 단어를 추측하는 대신, "다음에 어떤 마스크를 들어 올릴 것인가"라는 결정을 로봇 전략의 핵심적인 부분으로 취급합니다. 학습 과정을 이 두 가지 뚜렷한 부분으로 수학적으로 분해함으로써, 그들은 로봇이 훨씬 더 빠르게 학습하고 실수를 덜 한다는 것을 발견했습니다.

결과는 매우 인상적입니다. 그들이 이 새로운 방법을 어려운 수학 문제와 코딩 과제에 테스트했을 때, 로봇은 문제를 해결하는 능력이 눈에 띄게 향상되었습니다. 유명한 수학 테스트인 GSM8K에서 이들의 방법은 87.1%의 정확도에 도달했으며, 코딩 테스트인 MBPP에서는 53.4%를 기록했습니다. 이 수치들은 보상을 사용하여 확산 모델을 가르치려 했던 이전의 그 어떤 방법보다 높습니다. 이 논문은 로봇이 생각을 드러내는 순서, 즉 "마스킹" 결정에 주의를 기울임으로써, 우리가 이러한 빠르고 유연한 AI 모델의 새로운 지능 수준을 끌어올릴 수 있음을 보여줍니다. 이를 통해 모델을 단순히 더 빠르게 만들 뿐만 아니라 더 똑똑하게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →