← 최신 논문
💬 NLP

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

이 논문은 대규모 추론 모델의 추론 능력을 학생 모델의 파라미터 내로 내재화하기 위해, 교사 모델의 사고 사슬(Chain-of-Thought)에 조건화된 피드백을 받으면서 오직 솔루션 토큰만을 예측하도록 학습시키는 '마스크 증류(masked distillation)' 프레임워크를 소개하며, 이를 통해 정확도를 희생하지 않으면서도 직접적인 정답 생성과 추론 지연 시간 단축을 가능하게 한다.

원저자: Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 AI 비서가 아주 똑똑하지만 수다스러운 학생과 같은 세상을 상상해 보세요. 당신이 까다로운 질문을 던지면, 그 AI는 단순히 답을 내뱉는 것이 아니라, 모든 사고 단계를 설명하기 위해 페이지 가득 노트를 적고, 도표를 그리고, 자신의 생각을 하나하나 말로 풀어냅니다. 기술 세계에서 "사고의 사슬(Chain of Thought)"이라고 불리는 이 "생각을 밖으로 내뱉는" 과정은 AI 모델이 수학과 논리 퍼즐에 있어 믿기 힘들 정도로 똑똑하게 만들어 주었습니다. 하지만 여기에는 함정이 있습니다. 그 노트 페이지들을 만드는 데는 엄청난 시간과 에너지가 소모됩니다. 이는 마치 택시 기사에게 당신을 식료품점에 데려다 달라고 요청하면서, 동시에 어떤 통로로 가야 할지 "생각"하기 위해 도시 한 바퀴를 먼저 돌라고 하며 비용을 지불하는 것과 같습니다. 과학자들은 오랫동안 고민해 왔습니다. '우리가 AI에게 그 모든 생각을 머릿속에서 직접 할 수 있도록 가르칠 수는 없을까?' 만약 우리가 그렇게 할 수 있다면, AI는 긴 수다스러운 노트를 건너뛰고 즉시 정답을 줄 수 있을 것이며, 엄청난 양의 시간과 컴퓨터 자원을 아낄 수 있을 것입니다.

"마스크드 디스틸레이션(Masked Distillation, 마스킹된 증류)"이라는 제목의 이 논문은 바로 이 질문을 깊이 파고듭니다. 대규모 추론 모델(LRM)을 연구하는 연구진은, 생각을 밖으로 내뱉기를 좋아하는 똑똑한 "교사(teacher)" 모델을 가져와서, 더 작은 "학생(student)" 모델이 그 사고 과정을 내면화하도록 훈련할 수 있는지 물었습니다. 그들은 학생 모델이 노트 작성을 생략하고 정답만을 출력하면서도, 여과 없이 똑똑함을 유지할 수 있는지 확인하고 싶었습니다. 그들은 "마스크드 디스틸레이션"이라는 영리한 기법을 사용하여 이를 테스트했습니다. 교사가 퍼즐을 풀고 있는 동안 학생이 그것을 지켜보고 있다고 상상해 보세요. 교사는 전체 질문과 자신의 상세한 사고 과정을 보지만, 학생은 질문만을 보여받습니다. 목표는 학생이 교사의 비밀스러운 논리를 학습하여, 학습 과정에서 가이드 역할을 했던 노트 없이도 스스로 퍼즐을 풀 수 있는지 확인하는 것이었습니다.

연구팀은 두 가지 주요 실험을 설정했습니다. 첫 번째에서는 동일한 AI 모델을 교사와 학생으로 사용하되, 단지 다르게 생각하도록 요청했습니다. 두 번째에서는 더 크고 똑똑한 모델을 교사로, 더 작고 단순한 모델을 학생으로 사용했습니다. 또한 그들은 "스캐폴드(scaffold, 비계/발판)"라는 개념을 도입했습니다. 이것은 자전거의 보조 바퀴와 같습니다. 때때로 학생은 처음부터 모든 것을 시도하는 대신, 정답을 맞히기 위해 교사의 노트 중 아주 일부분을 볼 필요가 있을 수도 있습니다. 그들은 학생이 최선의 결과를 얻기 위해 교사의 사고 중 얼마나 많은 부분을 보아야 하는지 테스트했습니다.

결과는 "와우"와 "잠깐만요"가 섞여 있었습니다. 초등 수학 문제 데이터셋인 GSM8K에서 학생 모델들은 놀라웠습니다. 그들은 교사의 사고를 성공적으로 내면화했습니다. 완전히 "마스킹된(fully masked)" 학생(노트를 전혀 쓰지 않는 학생)은 정답의 76.0%를 맞혔는데, 이는 시작할 때의 능력보다 엄청난 도약이었으며, 교사의 2,398.1 토큰(텍스트 단위)과 비교했을 때 평균 369.6 토큰만을 사용했습니다. 이는 노력 측면에서 6.5배나 감소한 수치입니다!

하지만 더 까다로운 숫자 퍼즐인 카운트다운(Countdown)에서는 이야기가 달라졌습니다. 여기서 머릿속으로 모든 것을 처리하려고 했던 학생(완전 마스킹된 모델)은 오히려 성능이 떨어져 41.7%의 정확도를 기록했습니다. 이 특정 유형의 퍼즐에서는 학생이 정답을 맞히기 위해 교사의 노트 중 일부를 볼 필요가 있다는 것이 밝혀졌습니다. 하지만 흥미로운 점은, 연구진이 "스위트 스팟(최적의 지점)"을 찾아냈다는 것입니다. 학생에게 교사의 사고 중 아주 작은 부분(약 30%, 즉 알파 값이 0.3)을 보여주었더니, 학생의 정확도가 86.2%로 급증했습니다. 이는 교사(87.3%)와 거의 맞먹는 수준이었으며, 그러면서도 교사보다 약 1.3배 적은 토큰을 사용했습니다. 이는 마치 학생에게 완벽하게 균형을 잡을 수 있을 만큼의 보조 바퀴를 적절히 제공하여, 전체 자전거가 필요 없게 만든 것과 같았습니다.

이 논문은 또한 이 학생들이 본 적 없는 새로운 퍼즐(분포 외 작업)을 얼마나 잘 다루는지도 살펴보았습니다. 수학 측면에서 학생들은 잘 해냈지만, 카운트다운 퍼즐에 대해서는 결과가 다소 엇갈렸습니다. 흥ًا, 일부 사례에서는 약간의 스캐폴딩을 받은 학생이 퍼즐이 더 어려워지거나 변형되었을 때 교사 자체보다 더 나은 일반화 능력을 보이기도 했습니다.

한 가지 핵심적인 발견은 가르치는 방법이 중요하다는 것이었습니다. 연구진이 학생에게 단순히 교사의 노트를 보여주고 그것을 복사하도록 가르치려고 했을 때(지도 미세 조정, Supervised Fine-Tuning 방식), 그것은 그리 효과적이지 않았습니다. 학생의 추측과 교사의 실제 사고를 더 복잡한 방식으로 비교하는 "마스크드 디스틸레이션" 방식이 "사고" 기술을 전수하는 데 훨씬 더 효과적이었습니다.

결론적으로, 이 논문은 우리가 모든 문제에 대해 사고 단계를 마법처럼 삭제할 수는 없다는 점을 시사합니다. AI가 "조용히 생각할 수 있는지" 여부는 문제의 유형과 학생 모델이 해당 주제에 대해 이미 얼마나 알고 있는지에 크게 달려 있습니다. 기초적인 수학과 같은 익숙한 작업의 경우, AI는 조용히 생각하는 법을 배워 시간을 대폭 절약할 수 있습니다. 더 어렵고 생소한 퍼즐의 경우, 여전히 약간의 도움—즉, 작은 스캐폴드(노트의 일부)—이 필요할 수 있습니다. 연구진은 이 "스캐폴드"가 우리가 조절할 수 있는 강력한 도구이며, 이를 통해 AI가 얼마나 똑똑한지와 얼마나 빠르게 답을 줄 수 있는지 사이의 완벽한 균형을 찾을 수 있다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →