← 최신 논문
🤖 machine learning

Rethinking Reasoning with MDLMs: Early Exits, Post-hoc Reasoning, and Beyond

이 논문은 마스크드 확산 언어 모델(MDLM)을 위한 "인필링으로서의 추론(reasoning-as-infilling)"을 소개하는데, 이는 정답 영역을 명시적으로 지정함으로써 조기 종료 및 사후 추론과 같은 독특한 능력을 활성화하는 기술이며, 궁극적으로 MDLMs가 인간이 작성한 추적 과정에 필적하는 추론 성능을 달 수 있고 자기회귀 모델보다 더 정확한 중간 단계 점수를 제공할 수 있음을 입증한다.

원저자: Zachary Horvitz, Raghav Singhal, Hao Zou, Carles Domingo-Enrich, Zhou Yu, Rajesh Ranganath, Kathleen McKeown

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zachary Horvitz, Raghav Singhal, Hao Zou, Carles Domingo-Enrich, Zhou Yu, Rajesh Ranganath, Kathleen McKeown

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 까다로운 수수께끼를 푸는 법을 가르치려 한다고 상상해 보세요. 오랫동안 가장 좋은 방법은 로봇이 지금까지 읽은 모든 내용을 바탕으로 바로 다음 단어를 예측하며 이야기를 한 단어씩 읽도록 가르치는 것이었습니다. 이것은 마치 앞을 내다보거나 이미 쓴 내용을 수정하는 것이 허용되지 않은 채, 한 줄씩 답을 써 내려가야 하는 시험을 치르는 학생과 같습니다. 이 방식은 많은 일에 효과적이지만 한 가지 결함이 있습니다. 일단 로봇이 틀린 단어를 쓰면 그 실수에 갇히게 되며, 최종 답안에 도달하기 위한 단계를 밟는 동안 최종 답안을 미리 "보는" 것이 어렵다는 점입니다.

최근 과학자들은 "마스크 확산 언어 모델(Masked Diffusion Language Model, MDLM)"이라는 새로운 종류의 로봇 두뇌를 실험하고 있습니다. 단어별로 읽는 대신, 이 로봇은 어떤 단어들이 포스트잇으로 가려져 있는 페이지를 받는다고 상상해 보세요. 로봇의 임무는 그 포스트잇 아래에 무엇이 있는지 추측하는 것입니다. 하지만 여기서 마법 같은 일이 일어납니다. 로봇은 페이지 전체를 한꺼번에 볼 수 있으며, 누락된 모든 단어를 동시에 또는 원하는 순서대로 추측할 수 있습니다. 이는 마치 모서리나 중간, 혹은 가장자리를 동시에 채워 넣을 수 있는 퍼즐과 같습니다. 이 논문은 이러한 "빈칸 채우기" 방식의 사고가 전통적인 "한 번에 한 단어씩" 방식보다 수학 문제나 논리적 수수께끼를 푸는 데 실제로 더 나은지를 탐구합니다. 연구진은 이 새로운 스타일의 사고 방식을 사용하여 로봇을 더 똑똑하고, 빠르고, 자신이 정답을 알고 있을 때 얼마나 정직하게 표현할 수 있게 만들 수 있는지 확인하고자 했습니다.

Zachary Horvitz와 Raghav Singhal이 이끄는 연구진은 "추론으로서의 인필링(reasoning-as-infilling)"이라는 영리한 새로운 기술을 제안합니다. 로봇에게 단순히 "생각하고 답하라"고 요청하는 대신, 특정 상자들이 있는 템플릿을 제공합니다. 하나는 사고 과정을 위한 큰 상자이고, 다른 하나는 끝에 명확하게 표시된 작은 답안 상자입니다. 그런 다음 로봇이 생각을 시작하기 전에 답안 상자를 먼저 채워 넣습니다. 이는 역설적으로 들리지만, 초능력을 깨웁니다.

첫째, 로봇은 정확히 어디에 답안 상자가 있는지 알기 때문에, 사고 과정을 쓰는 동안 자신의 확신도를 엿볼 수 있습니다. 만약 로봇이 답안 상자 안의 정답에 대해 매우 확신하게 된다면, 즉시 생각을 멈추고 결과를 내뱉을 수 있습니다. 논문에 따르면, 이 "조기 종료(early exit)" 전략을 사용하면 정확도의 손실 거의 없이 GSM8k라는 수학 테스트에서 로봇이 1.3배 더 빠르게 작업을 마칠 수 있습니다. 다른 속도 향상 기술들과 결합하면 무려 4배나 더 빨라질 수 있습니다. 이는 긴 에세이를 쓰던 중 결론을 이미 알고 있다는 것을 깨닫고, 그냥 마지막 문장을 쓰고 시험지를 제출하는 학생과 같습니다.

둘째, 이 방법은 "사후 추론(post-hoc reasoning)"을 가능하게 합니다. 보통 로봇이 수학 문제를 틀리면, 아직 정답을 모르기 때문에 올바르게 생각하는 법을 가르치기가 어렵습니다. 하지만 이 새로운 방식에서는, 만약 당신이 정답을 먼저 알려준다면, 로봇은 그 정답에 도달하는 완벽한 단계별 설명을 만들기 위해 거꾸로 거슬러 올라갈 수 있습니다. 연구진은 이러한 "역방향으로 생성된" 설명을 통해 학습시키는 것이 로봇의 수학 점수를 14.9% 향상시킨다는 것을 발견했습니다. 이는 인간이 로봇이 공부할 수 있도록 완벽한 설명을 직접 작성해 주는 것과 맞먹는 엄청난 도약입니다. 이는 로봇이 자신의 "미래 지식"을 사용하여 스스로를 가르칠 수 있음을 시사합니다.

마지막으로, 이 논문은 이 방법이 로봇이 진행 과정에서 자신의 작업물을 판단하는 데 도움을 준다는 것을 보여줍니다. 로봇이 사고 과정을 쓰는 동안 다음과 같이 끊임없이 확인할 수 있습니다: "만약 내가 이런 방식으로 생각을 마친다면, 내가 목표로 하는 정답을 얻을 확률이 얼마나 될까?" 연구진은 이 자가 점검 점수가 기존 방식의 로봇들이 생성하는 점수보다 최종 정답이 맞을지 여부를 훨씬 더 잘 예측한다는 것을 발견했습니다. 기존 방식의 로봇들은 종종 끝에 가서야 자신이 틀렸다는 것을 알게 되지만, 이 새로운 로봇은 실수를 조기에 포착할 수 있습니다.

또한 이 논문은 어떤 방식이 효과적이지 않은지도 지적합니다. 연구진은 로봇이 퍼즐 조각을 완전히 무작위적인 순서로 채우도록(예를 들어 왼쪽 상단에서 오른쪽 하단으로 패턴 없이 건너뛰는 방식) 테스트했습니다. 그 결과, 수학 문제의 경우 이러한 혼란스러운 접근 방식이 오히려 로봇의 성능을 저하시키며, 종-종 잘못된 답을 먼저 추측한 뒤 이를 정당화하기 위해 가짜 이야기를 만들어내는 현상이 발생한다는 것을 발견했습니다. 로봇이 궤도를 유지하기 위해서는 "사고 상자"와 "답안 상자" 템플릿과 같은 약간의 구조가 필요합니다.

요약하자면, 이 논문은 우리가 AI에게 생각하는 방식을 바꾸는 것—즉, 빈 페이지에 글을 쓰게 하는 대신 템플릿을 채우게 하는 것—으로써, 우리가 어떻게 로봇을 더 빠르고, 더 잘 배우며, 자신의 작업을 더 잘 점검할 수 있게 만들 수 있는지를 제안합니다. 이것이 모든 것을 해결하는 마법의 탄환은 아니지만, 더 똑똑하고 효율적인 추론 기계를 구축하는 대한 유망한 새로운 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →