← 최신 논문
💬 NLP

Residual Context Diffusion Language Models

이 논문은 버려지는 토큰 표현을 문맥적 잔차(contextual residuals)로 재활용하여 추가적인 계산과 학습 데이터의 최소화와 동시에 디퓨전 거대 언어 모델(dLLMs)의 정확도와 효율성을 크게 향상시키는 새로운 모듈인 잔차 문맥 디퓨전(Residual Context Diffusion, RCD)을 소개한다.

원저자: Yuezhou Hu, Harman Singh, Monishwaran Maheswaran, Haocheng Xi, Coleman Hooper, Jintao Zhang, Aditya Tomar, Michael W. Mahoney, Sewon Min, Mehrdad Farajtabar, Kurt Keutzer, Amir Gholami, Chenfeng Xu

게시일 2026-06-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuezhou Hu, Harman Singh, Monishwaran Maheswaran, Haocheng Xi, Coleman Hooper, Jintao Zhang, Aditya Tomar, Michael W. Mahoney, Sewon Min, Mehrdad Farajtabar, Kurt Keutzer, Amir Gholami, Chenfeng Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 퍼즐, 예를 들어 수학 문제나 수수께끼를 풀려고 노력하고 있다고 상상해 보세요. 당신을 도와주는 똑똑한 비서(AI)가 있습니다.

기존 방식: "쓰레기통" 전략

현재 세대의 이러한 AI 비서들(확산 대규모 언어 모델, Diffusion Large Language Models)은 정답 전체를 한 번에 추측하려고 시도하지만, 이를 여러 단계에 걸쳐 수행합니다.

  1. AI는 퍼즐을 살펴보고 모든 단어에 대한 추측을 합니다.
  2. AI는 자신의 확신도를 확인합니다: "내가 이 단어에 대해 100% 확신하는가?"
  3. 문제점: 만약 100% 확신하지 못한다면, 그 추측을 "쓰레기통"에 던져버리고(리마스킹, remasking) 빈칸으로 대체합니다. 오직 자신이 확실히 알고 있는 단어들만 남깁니다.
  4. 퍼즐이 완료될 때까지 이 과정을 반복하며 더 많은 빈칸을 채워 나갑니다.

낭비 요소: 논문은 여기서 엄청난 비효율성을 지적합니다. AI가 저 "확신하지 못하는" 추측들을 쓰레기통에 버렸음에도 불구하고, 그 추측들은 사실 유용한 단서들을 담고 있었습니다! 그것들은 문맥과 문장의 흐름에 대한 힌트를 가지고 있었습니다. 그것들을 버림으로써, AI는 방금 계산하는 데 쏟아부은 모든 두뇌 에너지를 낭비하게 됩니다. 이는 마치 형사가 용의자의 알리바이가 100% 사실이라고 확신할 수 없다는 이유로 그 알리바이를 버렸다가, 나중에 그 알리비가 결정적인 단서를 포함하고 있었다는 것을 깨닫는 것과 같습니다.

새로운 방식: "잔차 문맥" 전략

저자들은 **잔차 문맥 확산(Residual Context Diffusion, RCD)**이라고 불리는 새로운 방법을 제안합니다. 불확실한 추측들을 버리는 대신, 그것들을 저장하여 다음 단계의 "힌트"로 사용합니다.

작동 방식은 다음과 같은 간단한 비유를 통해 이해할 수 있습니다.

"속삭이는 비서" 비유:
당신이 이야기를 쓰려고 노력 중이고, 당신의 비서가 제안을 속삭여 주고 있다고 상상해 보세요.

  • 기존 방식: 비서가 "다음 단어는 '고양이'인 것 같지만, 확실하지는 않아요"라고 속삭이면, 당신은 그 말을 완전히 무시하고 다음 라운드까지 기다립니다.
  • RCD 방식: 비서는 " '고양이'라고 100% 확신할 수는 없지만, 60% 정도는 확신해요. 이 '고양이'라는 생각을 우리의 '잔차(residual, 남겨진 생각)'로서 마음 한구석에 간직해 두죠"라고 말합니다.

다음 라운드에서 비서는 처음부터 다시 시작하지 않습니다. 비서는 이전 라운드의 "남겨진 생각들"을 살펴봅니다. 비서는 "좋아요, 지난번에는 '고양이' 쪽으로 기울었었죠. 그러니 그 생각을 바탕으로 추측을 정교하게 다듬어 볼게요"라고 말합니다.

핵심 비결: "확신도 측정기"

논문은 이 방법이 작동하게 만드는 영리한 트릭을 소개합니다. 모든 "남겨진 생각"이 다 똑같은 가치를 지니는 것은 아닙니다.

  • 만약 비서가 매우 혼란스러워한다면(엔트로피가 높다면), 그 혼란 자체가 자신이 무엇을 모르는지에 대한 많은 정보를 담고 있습니다. 이것은 매우 가치 있는 정보입니다!
  • 반대로 비서가 매우 확신하고 있다면, 얻을 수 있는 새로운 정보는 적습니다.

RCD 방식은 이 남겨진 생각들에 얼마만큼의 무게를 둘지 결정하기 위해 확신도 측정기(수학적으로는 엔트로피)를 사용합니다. 비서가 매우 불확실하다면, 이 방식은 "이 남겨진 생각을 주의 깊게 들어보세요. 중요합니다!"라고 말합니다. 만약 비서가 확신하고 있다면, "이 남겨진 생각은 지금은 무시해도 좋습니다"라고 말합니다.

AI를 가르치는 법 (2단계 학습)

이렇게 하는 AI를 가르치는 것은 까다로운 일입니다. 만약 한꺼번에 가르치려 한다면, AI는 힌트를 생성하는 법과 그 힌트를 사용하는 법을 동시에 배우려 하기 때문에 혼란에 빠질 것입니다. 이는 학생에게 시험을 치는 법과 시험을 채점하는 법을 동시에 가르치려는 것과 같습니다.

저자들은 이를 2단계 학습(Two-Stage Training) 방법으로 해결했습니다.

  1. 선생님: 먼저 작고 단순한 "선생님" AI를 훈련시킵니다. 이 선생님의 유일한 임무는 퍼즐을 보고 "확실하지 않은 것들을 포함하여 나의 최선의 추측은 이것이다"라고 말하는 것입니다.
  2. 학생: 그다음 메인 "학생" AI를 훈련시킵니다. 학생은 퍼즐을 보고, 선생님은 힌트(잔차 문맥)를 속삭여 줍니다. 학생은 이 힌트들을 사용하여 퍼즐을 더 잘 풀도록 학습합니다.

이런 방식을 통해 학생은 힌트를 생성하는 수학적 과정 때문에 혼란을 겪지 않고도, 힌트를 사용하는 법을 배울 수 있습니다.

결과: 더 빠르고 더 똑똑하게

논문은 이 새로운 방법을 어려운 수학 문제(AIME 경시대회 등)와 일반적인 추론 과제에 테스트했습니다.

  • 정확도 향상: AI가 훨씬 더 많은 문제를 맞혔습니다. 가장 어려운 수학 테스트에서 정확도가 기존 방식에 비해 거의 두 배 가까이 높아졌습니다.
  • 더 적은 단계: AI가 "남겨진 생각"을 사용하여 더 빠르게 똑똑해지기 때문에, 문제를 해결하는 데 필요한 추측 라운드가 줄어듭니다. 이는 막다른 길에 부딪혔을 때 그 길을 잊어버리고 다시 부딪히는 것이 아니라, 방금 부딪혔던 막다른 길을 기억하며 미로를 탈출하는 것과 같습니다.
  • 효율성: 이 방식은 동일한 양의 컴퓨팅 파워를 사용하면서도 더 똑똑한 방식으로 결과를 만들어내며, 슈퍼컴퓨터를 필요로 하지 않습니다.

요약

이 논문은 현재의 AI 모델들이 너무 낭비적이라고 주장합니다. 그들은 많은 정보를 계산하고 나서 그것을 버려버립니다. **잔차 문맥 확산(RCD)**은 이러한 버려지는 생각들을 저장하고, AI가 얼마나 혼란스러운지에 따라 무게를 달리하며, 이를 다음 단계를 위한 가이드로 사용하는 새로운 시스템입니다. 그 결과, AI는 더 똑똑하고, 더 빠르며, 수학이나 논리 퍼즐과 같은 복잡한 문제를 해결하는 데 훨씬 더 뛰어난 능력을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →