← 최신 논문
💬 NLP

Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models

이 논문은 사고 사슬(Chain-of-Thought) 추론을 압축하기 위한 엔트로피 기반 프루닝의 효용성에 이의를 제기하며, 이러한 휴리스틱이 무작위 선택보다 나은 이점을 제공하지 못할 뿐만 아니라, 작업에 결정적인 정보가 엔트로피 지표로 식별 가능한 특정 토큰에 집중되어 있기보다는 전체 추론 사슬 전반에 걸쳐 분포되어 있음을 입증한다.

원저자: Sara Candussio, Daniel Scalena, Luca Bortolussi, Elisabetta Fersini, Malvina Nissim, Gabriele Sarti

게시일 2026-08-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sara Candussio, Daniel Scalena, Luca Bortolussi, Elisabetta Fersini, Malvina Nissim, Gabriele Sarti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 수다스러운 로봇에게 까다로운 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 올바른 답을 얻기 위해 로봇은 단순히 해결책을 내뱉는 것이 아니라, 먼저 자신의 생각, 계산, 그리고 "아하!" 하는 순간들을 긴 목록으로 적어 내려갑니다. 이 내부 독백을 "사고의 사슬(Chain-of-Thought)"이라고 부릅니다. 이것은 마치 탐정이 범인을 잡기 전, 아주 당연해 보이는 단서들까지도 모두 기록하는 것과 같습니다. 이 방식은 로봇을 훨씬 더 똑똑하게 만들지만, 생각의 목록이 믿을 수 없을 정도로 길어질 수 있기 때문에 로봇을 매우 느리게 만들고 컴퓨터 메모리를 많이 잡아먹게 합니다. 과학자들은 이제 이 '생각의 목록'을 잃지 않으면서도 어떻게 하면 더 짧게 줄일 수 있을지 고민하고 있습니다. 그들은 질문합니다: 이야기의 지루한 부분은 삭제하고 흥미롭고 중요한 부분만 남길 수 있을까요?

한동안 많은 연구자들은 자신들이 마법 같은 필터를 찾아냈다고 믿었습니다. 그들은 로봇이 다음에 할 말에 대해 얼마나 "놀랐는지"(엔트로피라고 불리는 개념)를 살펴봄으로써, 어떤 생각이 핵심적이고 어떤 것이 단순한 채움용인지 구려낼 수 있다고 생각했습니다. 아이디어는 이랬습니다. 만약 로봇이 다음에 할 말에 대해 매우 확신한다면(낮은 놀라움), 그 부분은 아마도 지루한 반복일 것이므로 잘라낼 수 있다는 것입니다. 반대로 로봇이 확신하지 못한다면(높은 놀라움), 그것은 진짜 사고가 일어나는 순간이므로 반드시 남겨두어야 한다는 것이었습니다. 이것은 로봇의 일기를 몇 페이지로 줄이면서도 좋은 내용만 남길 수 있는 완벽한 방법처럼 들렸습니다. 하지만 이 마법의 필터가 정말 존재하는 것일까요, 아니면 그저 운 좋은 추측에 불과할까요?

이 논문은 그 아이디어에 대한 현실 점검입니다. 호기심 많은 과학자들로 구성된 저자들은 이 "엔트로피 필터"를 훨씬 더 단순하고 멍청한 방법, 즉 무작위로 생각을 삭제하는 방법과 비교해 테스트하기로 했습니다. 그들은 로봇의 긴 추론 과정을 어지러운 방처럼 취급했고, 두 가지 전략을 사용하여 정리하려고 시도했습니다. 첫 번째 전략은 엔트로피 필터를 사용하여 무엇을 남길지 결정하는 "스마트한" 방식이었습니다. 두 번째 "무작위" 방식은 내용과는 상관없이 문장이나 단어를 한 움큼 집어 들어 남기는 방식이었습니다. 그들은 다양한 로봇(서로 다른 AI 모델)을 대상으로 수학 문제, 논리 퍼즐, 과학 질문 등 다양한 종류의 숙제를 주었습니다.

결과는 반전이었습니다. 과학자들이 문장 단위로 살펴보았을 때, "스마트한" 엔트로피 필터는 무작위 추측보다 나을 것이 없었습니다. 사실, 무작위 방식이 로봇의 성능을 높게 유지하는 데 있어 종종 대등하거나 심지어 더 나은 성과를 보였습니다. 즉, 문장의 "놀라움 수준"은 중요한 정보가 어디에 숨어 있는지 알려주는 신뢰할 만한 지도가 아니라는 것입니다. 저자들은 이전 연구들이 엔트로피가 효과적이라고 생각했던 이유가 주로 수학 문제에서 테스트했기 때문일 것이라고 제안합니다. 수학 문제에서는 "중요한" 단어들이 주로 숫자이기 때문입니다.

과학자들이 시야를 좁혀 문장 대신 개별 단어(토큰)를 살펴보았을 때, 기묘한 패턴이 나타났습니다. 수학 테스트의 경우, 놀라움이 낮은 단어들을 남기는 것이 도움이 되는 것처럼 보였습니다. 하지만 저자들은 더 깊이 파고들어, 이것이 그 단어들이 "사고"하는 단어여서가 아니라는 사실을 깨달았습니다. 수학 문제에서 놀라움이 낮은 단어들은 거의 항상 숫자(예: "2", "7", "5")였습니다. 수학에서는 숫자가 예측 가능하기 때문에 엔트로피가 낮습니다. 필터는 "똑똑한" 부분을 찾아낸 것이 아니라, 단지 우연히 숫자를 골라낸 것이었습니다. 숫자를 섞어 넣었을 때, 낮은 엔트로피 필터는 작동을 멈추고 무작위 추측만큼 형편없어졌습니다.

이를 증명하기 위해, 그들은 "액티베이션 패칭(activation patching)"이라는 특별한 기술을 사용했습니다. 이것은 전체 버전의 긴 이야기에서 로봇의 뇌 활동을 가져와 압축된 짧은 버전에 붙여넣는 것을 상상해 보세요. 이를 통해 누락된 맥락이 실제로 문제였는지 확인할 수 있습니다. 그들은 이 뇌 강화 기술을 사용하더라도, 엔로피 필터가 수학 문제에서 숫자를 구체적으로 남기는 경우가 아니라면 무작위 방식을 이길 수 없다는 것을 발견했습니다. 논리 퍼즐과 같은 비수학적 과제에서 엔트로피 필터는 완전히 실패하여, 우연에 의한 결과보다 나을 것이 없었습니다.

그렇다면 결론은 무엇일까요? 이 논문은 "놀라움"(엔트로피)을 사용하여 로봇의 사고 과정 중 가장 중요한 부분을 자동으로 찾아내고 유지하겠다는 아이디어가 대부분 신화에 불과하다는 점을 시사합니다. 의미론적 내용, 즉 추론의 실제 의미와 논리는 단순한 규칙으로 찾을 수 있는 몇 개의 특별한 저-놀라움 단어에 집중되어 있지 않습니다. 대신, 중요한 정보는 사고의 사슬 전체에 흩어져 있습니다. 숫자를 유지하는 것이 수학에는 도움이 될 수 있지만, 로봇의 추론 과정을 지능을 잃지 않으면서 압축할 수 있는 보편적인 "마법의 필터"는 존재하지 않습니다. 목록을 줄이는 가장 좋은 방법은 아마도 더 많은 내용을 남기거나, 어떤 단어가 지루한지 추측하는 데 의존하지 않는 더 똑똑한 절단 방법을 찾는 것일지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →