← 최신 논문
💬 NLP

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

이 논문은 남은 토큰 예산에 따라 탐색과 정교화 전략을 동적으로 정렬함으로써 수학 및 물리 추론 작업에서 예산을 고려하지 않는 베이스라인 모델들을 능가하는 트리 탐색 디코딩 알고리즘인 Budget-Guided MCTS(BG-MCTS)를 제안한다.

원저자: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 까다로운 수수께로를 풀기 위해 노력하는 탐정이라고 상상해 보십시오. 하지만 당신에게는 엄격한 규칙이 하나 있습니다. 바로 시간이 다 되기 전까지 정해진 횟수의 질문만 던질 수 있다는 것입니다. 이것이 바로 대규모 언어 모델(LLM)이 수학이나 물리학 같은 복잡한 문제를 해결할 때 직면하는 도전 과제와 정확히 일치합니다. 그들에게는 '토큰 예산(token budget)'이라는 것, 즉 생성할 수 있는 단어나 단계의 한계가 존재하기 때문입니다.

이 논문은 이 AI 탐정들이 엄격한 시간 제한 내에서 문제를 더 잘 해결할 수 있도록 돕는 BG-MCTS(Budget-Guided Monte Carlo Tree Search)라는 새로운 방법을 소개합니다.

이해가 쉽도록 간단한 비유를 들어 설명하겠습니다.

문제점: "천편일률적인" 탐정

현재 대부분의 AI 탐색 방식은 남은 시간에 상관없이 고정된 계획을 가진 탐정처럼 행동합니다.

  • 기존 방식: 탐정은 하루의 전반부에 100명의 사람에게 서로 다른 단서를 묻는 등 광범적으로 탐색(broad exploration)합니다. 그러다 마지막 10분이 남았을 때서야 비로소 가장 유망한 단서들을 실제로 추적해야 한다는 사실을 깨닫습니다. 그들은 교대 시간이 끝나기 직전에 새로운 질문을 시작하여 결국 사건을 해결하지 못한 채 끝날 수도 있습니다. 혹은 너무 일찍 멈춰버려 남은 10분의 근무 시간을 낭비할 수도 있습니다.
  • 문제점: 기존 방식들은 시간 제한(토큰 예산)을 단순히 "정지 신호"로만 취급합니다. 즉, 남은 시간에 따라 전략을 바꾸지 않습니다.

해결책: "스마트한 탐정" (BG-MCTS)

저자들은 남은 시간을 확인하며 그에 따라 전략을 바꾸는 탐정을 제안합니다. 이를 Budget-Guided MCTS라고 부릅니다.

탐색 과정을 뿌리에서 자라나는 나무라고 생각해 보십시오.

  1. 초기 단계 (시간이 넉넉할 때): 탐정이 전체 시간의 100%를 가지고 있을 때, 그는 넓은 그물을 던지는 어부처럼 행동합니다. 그는 깊게 파고들기보다는, 물고기가 어디에 있을지 확인하기 위해 많은 얕은 경로들을 넓게 탐색합니다. 아직 깊이 파고들지 않고, 그저 전체적인 바다의 모습을 파악하고자 합니다.
  2. 후기 단계 (시간이 부족할 때): 시계가 줄어듦에 따라(예: 예산의 25%가 남았을 때), 탐정은 넓은 그물을 던지는 것을 멈춥니다. 대신, 이전에 찾아낸 가장 유망한 지점 두세 곳을 골라 깊이 파고듭니다. 그는 새로운 질문을 시작하는 것을 멈추고, 오직 가장 좋은 단서들을 완결 짓는 데 집중합니다.

AI는 이를 어떻게 수행하는가

논문은 AI가 이 작업을 수행하기 위해 사용하는 두 가지 구체적인 기술을 설명합니다.

  • "시간 체크" 점수: AI가 다음에 따를 경로를 결정할 때, 남은 예산을 고려한 공식을 사용합니다.
    • 예산이 많으면, 공식은 새로운 경로를 시도하도록 권장합니다.
    • 예산이 적으면, 공식은 새로운 경로를 시작하는 것에 벌점을 주고, 이미 좋아 보이는 경로를 더 깊게 파고드는 것에 보상을 줍니다.
  • "새로운 가지" 스위치: AI는 나무에 새로운 가지를 키울 것인지, 아니면 기존의 가지를 더 깊게 내려갈 것인지를 결정하는 특별한 스위치를 가지고 있습니다.
    • 시간이 풍족할 때, 스위치는 "새로운 가지 키우기"로 설정됩니다.
    • 시간이 다 되어갈 때, 스위치는 "더 깊이 들어가기"로 전환되어, AI가 끝내지 못할 새로운 가지를 시작하느라 마지막 몇 초를 낭비하는 것을 방지합니다.

결과

연구진은 이 "스마트한 탐정"을 어려운 수학 및 물리학 문제에 대해 다른 방법들과 비교 테스트했습니다. 그 결과는 다음과 같습니다.

  • 더 나은 정확도: AI는 동일한 토큰 제한 내에서 더 많은 문제를 정확하게 해결했습니다.
  • 시간 낭비 없음: 너무 일찍 멈추거나 마지막에 너무 많은 새로운 경로를 시작할 수 있는 기존 방식들과 달리, BG-MCTS는 전체 예산을 효율적으로 사용했습니다. 초반에는 넓게 탐색하고 마지막에는 강력하게 마무리했습니다.
  • 일관된 성능: 이 방식은 다양한 유형의 AI 모델과 다양한 난이도의 문제에서 효과적이었습니다.

핵심 요약

이 논문은 AI의 탐색 전략을 남은 예산에 "인지"하게 만듦으로써, 더 많은 컴퓨팅 자원을 투입하지 않고도 훨씬 더 나은 답을 얻을 수 있다고 주장합니다. 이는 마치 러너에게 단순히 빨리 달리는 법뿐만 아니라, 최선의 기록으로 결승선을 통과하기 위해 언제 전력 질주하고 언제 에너지를 보존해야 하는지를 가르치는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →