← 최신 논문
💬 NLP

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

이 논문은 추론 과정에서 결정적인 토큰의 키-값(Key-Value) 캐시 상태만을 식별하여 유지하고 불필요한 항목을 제거함으로써 대규모 추론 모델의 효율성을 향상시키는 방법인 동적 사고 토큰 선택(Dynamic Thinking-Token Selection, DynTS)을 제안한다.

원저자: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: 가방이 꽉 찬 "생각이 너무 많은 학생"

매우 똑똑한 학생(대규모 추론 모델)을 상상해 보세요. 이 학생은 어렵고 복잡한 수학이나 과학 문제를 푸는 데 매우 능숙합니다. 일반적인 학생이 그냥 답을 찍는 것과 달리, 이 학생은 특별한 습관이 있습니다. 최종 답을 적기 전에 화이트보드에 아주 방대한 단계별 "사고 과정"을 적어 내려가는 것입니다. 모든 생각, 막다른 길, "잠깐, 다시 확인해 보자"와 같은 고민, 그리고 모든 계산 과정을 하나하나 다 적습니다.

이 "사고 흔적(thinking trace)"은 정답을 찾는 데 도움을 줍니다. 하지만 문제가 하나 있습니다. 바로 기억력입니다.

이 사고 과정을 계속 이어가기 위해, 학생은 자신이 쓴 모든 단어를 단기 기억(이를 KV 캐시라고 부릅니다)에 담아두어야 합니다. 문제가 어려워질수록 화이트보드는 점점 더 길어집니다. 결국, 학생의 배낭(컴퓨터 메모리)은 이 기록들로 너무 무거워져서 더 이상 빠르게 움직일 수 없게 됩니다. 학생은 느려지고, 이 학생을 실행하는 컴퓨터는 공간이 부족해집니다.

발견: 사고의 "80/20 법칙"

연구진은 단순한 질문을 던졌습니다. 학생이 최종 답을 얻기 위해 자신이 적은 모든 단어를 정말 다 기억해야 할까?

그들은 학생의 노트를 분석했고, 파레토 법칙(또는 80/20 법칙)이라고 불리는 놀라운 패턴을 발견했습니다.

  • 통찰: 100개의 생각 체인 중 약 20~30개만이 실제로 해결책으로 이어지는 "황금 같은(Golden)" 생각들입니다.
  • 나머지: 나머지 70여 개의 생각은 그저 "채우기용(Filler)"일 뿐입니다. 그것들은 "자, 시작해 보자"라거나 "음, 아마도", 혹은 숫자를 반복하는 것과 같습니다. 이러한 생각들은 대화의 흐름을 위해 필요하지만, 실제 정답을 바꾸지는 않습니다. 만약 이들을 지운다 해도, 학생은 여전히 문제를 똑같이 잘 풀 수 있습니다.

해결책: DYNTS (스마트한 사서)

연구진은 DYNTS(Dynamic Thinking-Token Selection)라는 새로운 시스템을 만들었습니다. DYNTS를 학생이 생각하는 동안 옆에 서 있는 매우 똑똑한 사서라고 생각해 보세요.

이 사서는 다음과 같이 작동합니다.

  1. "중요도 예측기" (사서의 레이더): 사서는 어떤 생각이 "황금(Golden)"이고 어떤 생각이 "채우기용(Filler)"인지 즉각적으로 구별할 수 있는 특수한 레이더를 가지고 있습니다. 이 레이더는 중요한 아이디어를 인식하도록 학습된, 학생의 뇌에 부착된 작고 가벼운 도구입니다.

  2. "이중 창(Dual-Window)" 전략 (배낭): 학생은 세 개의 특정 주머니가 있는 배낭을 가지고 있습니다.

    • 주머니 A (질문): 원래의 문제는 절대 제거되지 않습니다. 영원히 안전하게 보관됩니다.
    • 주머니 B (로컬 창): 문장의 문법과 흐름이 맞도록 학생이 방금 쓴 마지막 몇 개의 생각들이 여기에 유지됩니다.
    • 주머니 C (선택 창): 긴 사고의 역사가 들어가는 곳입니다.
  3. 행동 (정리): 학생이 글을 써 내려갈수록 배낭은 점점 차오릅니다. 한계치에 도달하면 사서가 개입합니다.

    • 사서는 주머니 C에 있는 긴 기록들을 살펴봅니다.
    • 레이더를 사용하여 "황금" 같은 생각들을 식별합니다.
    • 황금 같은 생각들은 유지합니다.
    • 중요하지 않은 "채우기용" 생각들은 버립니다(제거합니다).

결과: 더 빠르고 가볍게

이 작업을 통해 연구진은 다음을 발견했습니다.

  • 속도: 학생은 쓸모없는 노트로 가득 찬 무거운 배낭을 짊어질 필요가 없기 때문에 1.8배에서 2.6배 더 빠르게 생각할 수 있습니다.
  • 메모리: 배낭이 3배에서 5배 더 작아졌으며, 이는 더 작고 저렴한 컴퓨터에서도 이 똑똑한 학생을 실행할 수 있음을 의미합니다.
  • 정확도: 놀랍게도, 학생은 전혀 더 멍청해지지 않았습니다. 사서가 "채우기용"만 버리고 "황금" 같은 생각들만 남겨두었기 때문에, 학생은 이전과 똑같이 정답을 맞힐 수 있었습니다.

요약 비유

친구에게 들려줄 긴 이야기를 기억하려고 노력한다고 상상해 보세요.

  • 기존 방식: "음", "아", "잠깐만 생각 좀 하고"와 같은 말까지 포함하여 모든 단어를 다 외우려다 보니 머리가 아프고 정작 중요한 핵심 내용을 잊어버립니다.
  • DYNTS 방식: 주요 줄거리와 반전 포인트(핵적인 토큰들)를 기억하고, 흐름을 매끄럽게 하기 위해 마지막 몇 문장만 머릿속에 남겨둡니다. "음", "아" 같은 말들은 잊어버립니다. 당신은 여전히 이야기를 똑같이 잘 전달하면서도, 훨씬 적은 노력만 들였고 두통도 겪지 않습니다.

이 논문은 이러한 "사고하는" AI 모델의 경우, 모든 생각을 다 저장할 필요가 없다는 것을 증명합니다. 우리는 그저 중요한 생각들만 저장하면 되며, 스마트한 시스템이 실시간으로 어떤 것이 중요한지 찾아낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →