← 최신 논문
💬 NLP

Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models

이 논문은 마스크된 확산 언어 모델(masked diffusion language models)에서 직접적인 토큰 수정을 가능하게 하는 파라미터 프리 샘플러인 D3IM과, 그로 인해 발생하는 보존 편향(preservation bias)을 완화하기 위한 사후 학습 방법인 SCOPE를 소개하며, 이들은 종합적으로 추론 및 코딩 벤치마크에서 상당한 성능 향상을 달성한다.

원저자: Longxuan Yu, Shaorong Zhang, Yu Fu, Hui Liu, Yue Dong, Greg Ver Steeg

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Longxuan Yu, Shaorong Zhang, Yu Fu, Hui Liu, Yue Dong, Greg Ver Steeg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "얼어붙은 실수 (The Frozen Mistake)"

당신이 매우 똑똑하지만 약간은 긴장한 로봇 조수와 함께 이야기를 쓰고 있다고 상상해 보세요. 로봇이 단어를 추측할 때마다, 로봇은 그 단어를 종이에 적습니다.

이 로봇들이 작동하는 표준 방식(마스크 확산 언어 모델, Masked Diffusion Language Models라고 불림)에서는, 로봇이 단어를 적고 나서 충분히 "확신"을 느끼면, 그 단어를 그 자리에 얼려버립니다(freeze). 로봇은 그 단어 위에 테이프를 붙여 버립니다. 설령 로봇이 나중에 "잠깐, 이 단어는 이 문장에서 말이 안 되는데?"라고 깨닫더라도, 테이프가 붙어 있기 때문에 그 단어를 바꿀 수 없습니다. 로봇은 아직 적히지 않은 빈칸들을 채울 수만 있을 뿐입니다.

이는 수학이나 코딩 같은 까м 까다로운 작업에서 큰 문제가 됩니다. 만약 로봇이 초반에 잘못된 숫자(예를 들어, '2' 대신 '5'라고 쓰는 경우)를 적어버리면, 로봇은 그 상태로 갇혀버립니다. 로봇은 그 잘못된 숫자를 바탕으로 나머지 답을 만들어내려 노력하게 되고, 결국 완전히 틀린 결과를 낳게 됩니다.

해결책: 두 단계의 처방

저자인 Longxuan Yu와 동료들은 로봇이 실제로 마음을 바꿀 수 있는 능력이 있지만, 게임의 규칙이 그것을 방해하고 있다는 사실을 깨달았습니다. 그들은 이를 해결하기 위해 두 부분으로 구성된 솔루션을 도입했습니다: 새로운 게임 방식(D3IM)과 로봇을 위한 특별한 훈련 연습(SCOPE)입니다.

파트 1: 새로운 게임 규칙 (D3IM)

비유: 모두가 문장의 다음 단어를 추측하는 "뜨거운 감자(Hot Potato)" 게임을 상상해 보세요.

  • 기존 규칙: 일단 단어를 외치면, 끝날 때까지 그 단어를 계속 붙들고 있어야 합니다. 만약 잘못된 단어를 외쳤다면, 당신은 그것에 묶여 있게 됩니다.
  • D3IM 규칙 ("백지 상태"): 게임의 매 단계마다, 로봇은 이미 외쳤던 단어를 포함하여 문장의 모든 단어를 다시 살펴봅니다. 그리고 스스로에게 묻습니다. "나는 여전히 이것이 최선의 단어라고 생각하는가?"
    • 만약 로봇이 여전히 확신한다면, 그 단어는 유지됩니다.
    • 만약 로봇이 "사실, 이건 틀렸어"라고 생각한다면, 즉시 그 단어를 지우거나(다시 빈칸으로 돌리거나) 더 나은 단어로 교체합니다.
    • 로봇은 허락을 구하거나 특별한 도구를 사용할 필요가 없습니다. 그저 현재의 확신도를 바탕으로 모든 것을 재평가할 뿐입니다.

함정: 로봇은 이 게임을 아주 잘 수행할 수 있습니다. 단, 자신이 언제 틀렸는지 알 수 있다면 말이죠. 하지만 원래의 훈련 과정에서 로봇은 자신의 실수를 인정하는 법을 배운 적이 없습니다. 로봇은 자신의 첫 번째 추측이 설령 나쁘더라도 그것을 믿도록 훈련되었습니다. 그래서 새로운 "백지 상태" 게임을 하게 되면, 로봇은 자신의 추측이 옳다고 생각하기 때문에 계속해서 잘못된 단어들을 얼려버립니다.

파트 2: 특별 훈련 (SCOPE)

비유: 이것은 "실수를 포함한 리허설"과 같습니다.
로봇의 잘못된 습관(자신의 오류를 맹신하는 것)을 고치기 위해, 저자들은 SCOPE(Self-Conditioned On Prediction Errors)라고 불리는 훈련 방법을 만들었습니다.

  • 작동 방식: 훈련 중에 로봇은 문장을 쓰라는 요청을 받지만, 그 후 자신의 작업물을 보고 마치 실수를 한 것처럼 가정해야 합니다.
  • 로봇은 문장을 작성합니다. 그다음 훈련사는 말합니다. "좋아, 내가 네 단어 중 일부를 숨길게. 이제 그것들을 다시 맞춰봐."
  • 반전: 훈련사는 로봇이 틀렸으면서도 매우 높은 확신을 가졌던 단어들을 특별히 골라냅니다. 로봇은 자신의 틀린 답을 보고, 그것이 틀렸음을 깨닫고, 올바른 답으로 교체해야 합니다.
  • 이는 로봇에게 중요한 교훈을 줍니다: "내가 높은 확신을 가지고 말했다고 해서 그것이 반드시 맞는 것은 아니다. 나는 마음을 바꿀 준비가 되어 있어야 한다."

결과: 협력하는 팀

새로운 게임 규칙(D3IM)과 특별 훈련(SCOPE)을 결 함께하면, 로봇은 스스로 교정하는 천재가 됩니다.

  • 훈련 없이: 특별한 훈련 없이 새로운 규칙만 준다면, 로봇은 오히려 더 나빠집니다. 단어를 바꾸려고 시도하지만, 자신의 오류를 찾아내는 능력을 믿지 못하기 때문에 계속 같은 실수를 반복합니다.
  • 훈련과 함께: 로봇은 자신의 "얼어붙은 실수"를 찾아내는 법을 배웁니다. 이제 로봇은 수학 문제에서 틀린 숫자를 보고 "아니, 이건 틀렸어"라고 말하며, 문장이 만들어지는 동안 그것을 올바른 것으로 바꿀 수 있습니다.

실제 결과

이 논문은 LLaDA-8B(스마트 언어 모델)를 사용하여 어려운 작업들에 대해 테스트했습니다:

  • 수학 (GSM8K & MATH): 점수가 크게 상승했습니다. 예를 들어, 어려운 수학 테스트에서 정확도가 **55.3%**에서 **68.3%**로 뛰었습니다.
  • 코딩 (HumanEval & MBPP): 작동하는 코드를 작성하는 능력이 극적으로 향상되었습니다. 한 테스트에서는 **14.0%**에서 **29.3%**로 올라갔습니다.

핵심 요점

주요 발견은 마음을 바꿀 능력을 갖추는 것만으로는 충분하지 않으며, 언제 마음을 바꿔야 하는지 알도록 훈련받아야 한다는 것입니다.

저자들은 모델이 자신의 확신에 찬 오류를 인식하도록 가르치고(SCOPE), 그 오류를 더 나은 것으로 즉시 교체할 수 있는 메커니즘(D3IM)을 제공함으로써, 모델이 이전보다 훨씬 더 복잡한 추론 문제를 해결할 수 있음을 보여주었습니다. 이것은 로봇을 더 똑똑하게 만드는 것이 아니라, 초기 실수에 대해 덜 고집스럽게 만드는 법을 가르치는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →