← 최신 논문
🤖 AI

Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

이 논문은 그룹 상대 정책 최적화(Group Relative Policy Optimization)를 통해 "NoThink", "Short", "Long" 추론 모드 중 하나를 선택하는 법을 학습함으로써, 다양한 벤치마크에서 정확도를 유지하거나 향상시키면서도 상당한 토큰 감소를 달성하도록 추론 언어 모델이 테스트 시간 연산량을 적응적으로 할당하도록 훈련하는 방법을 소개한다.

원저자: Gijs Kassenaar, Zhao Yang, Vincent François-Lavet

게시일 2026-08-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gijs Kassenaar, Zhao Yang, Vincent François-Lavet

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 복잡한 문제를 해결하는 데 매우 능숙해졌으며, 종종 사람이 어려운 수학 문제를 종이에 풀어나가는 것처럼 일련의 긴 중간 단계로 질문을 세분화하여 해결합니다. '생각의 사슬(chain-of-thought)'이라고 알려진 이 단계별 접근 방식은 이러한 시스템이 수학 및 코딩 작업에서 높은 수준의 정확도에 도달할 수 있게 해줍니다. 그러나 이러한 능력에는 상당한 대가가 따릅니다. 모델은 종종 필요 이상의 훨씬 더 많은 텍스트를 생성하여 막대한 양의 컴퓨팅 전력과 시간을 소비합니다. 문제가 단순할 때조차도 모델은 길고 장황한 설명을 만들어내며, 즉시 해결될 수 있는 작업에 자원을 낭비하곤 합니다. 연구자들은 오랫동안 이러한 시스템이 특정 문제가 실제로 어느 정도의 노력을 요구하는지 판단하는 능력이 부족하다고 의심해 왔으며, 이로 인해 쉬운 질문에도 어려운 질문과 똑같이 과도한 처우가 이루어지는 상황이 발생하고 있습니다.

암스테르담 자유 대학교(Vrije Universiteit Amsterdam)의 연구팀은 모델이 스스로 이러한 판단을 내릴 수 있도록 가르치기 위해 나섰습니다. 그들은 수학 문제를 풀도록 훈련된 15억 개의 파라미터를 가진 비교적 작은 추론 모델을 대상으로 연구를 진행했습니다. 모델에게 항상 고정된 시간 동안 생각하도록 강요하는 대신, 응답 시작 시점에 아주 간단한 선택권을 주었습니다. 즉, 생각 없이 즉시 답변할지, 짧게 추론할지, 아니면 길고 깊게 추론할지를 결정할 수 있게 한 것입니다. 모델은 정답 여부와 얼마나 효율적으로 정답에 도달했는지에 따라 피드백을 받는 '강화 학습' 방식을 통해 훈련되었습니다. 목표는 모델이 문제의 난이도에 맞춰 자신의 노력을 조절하는 법을 배울 수 있는지, 즉 쉬운 작업에서는 시간을 절약하고 어려운 작업에는 충분한 자원을 투입할 수 있는지 확인하는 것이었습니다.

연구진은 모델이 작동 모드를 알리기 위해 첫 번째 토큰으로 단 하나의 단어를 출력하는 시스템을 설계했습니다. 만약 모델이 "NoThink(생각 안 함)"를 선택하면 즉시 답변을 시도합니다. 만약 "Short(짧게)"를 선택하면 짧은 설명을 생성할 수 있지만, 사용할 수 있는 단어 수에 엄격한 제한이 따릅니다. 만약 "Long(길게)"을 선택하면 제한 없이 길게 추론할 수 있습니다. 모델이 실제로 이러한 선택을 준수하도록 하기 위해, 연구진은 짧은 모드에 대해 응답 길이에 대한 엄격한 제한을 두었습니다. 만약 모델이 "Short" 모드를 사용하면서 제한을 넘어 계속 글을 쓴다면, 최종 답이 맞더라도 시스템은 해당 시도를 오답으로 처리했습니다. 이를 통해 모델은 처음에 선택한 라벨이 자신의 행동에 실질적인 결과를 초래한다는 것을 배우도록 강제되었습니다.

모델이 단순히 선택을 무시하고 매번 가장 길고 안전한 옵션을 기본값으로 선택하는 것을 방지하기 위해, 연구진은 모델이 받는 보상을 조정했습니다. 매우 짧은 답변에 대해서는 "NoThink"와 "Short" 모드에 더 많은 보상을 주는 반면, "Long" 모드는 길이에 상관없이 일정한 보상을 제공했습니다. 이를 통해 최선의 전략은 문제에 따라 달라지도록 만들었습니다. 사소한 질문의 경우 가장 빠른 답변이 가장 높은 점수를 얻는 반면, 어려운 문제는 성공을 위해 "Long" 모드의 확장된 노력이 필요하게 되었습니다. 또한 연구진은 모델이 모든 문제에 대해 단 하나의 전략만을 사용하는 현상이 나타나지 않도록, 세 가지 옵션을 모두 사용하도록 부드럽게 유도하는 균형 메커니즘을 추가했습니다.

결과에 따르면 모델은 문제의 난이도를 분류하는 법을 성공적으로 학습했습니다. 500개의 미학습 수학 문제 세트에서 모델은 쉬운 질문을 "NoThink" 또는 "Short" 모드로 보내고, 어려운 질문을 "Long" 모드로 보내기 시작했습니다. 훈련 과정 동안 모델의 정확도는 수정되지 않은 원래 버전과 거의 동일하게 유지되었지만, 응답의 평균 길이는 크게 줄어들었습니다. 연구진은 새로운 정책이 평균 생성 단어 수를 41% 감소시켜, 응답 길이를 약 4,800개 토큰에서 약 2,800개 토큰으로 줄였다는 것을 발견했습니다. 이는 모델이 동일한 수의 문제를 정확하게 풀면서도 절반 미만의 계산적 노력만을 사용했음을 의미합니다.

결정적으로, 이러한 효율성은 모델이 본 적 없는 문제에 대한 성능 저하를 초래하지 않았습니다. 다른 초등 수학 문장제 문제 세트로 테스트했을 때, 모델은 높은 정확도를 유지하면서도 텍스트 양을 76%나 줄이는 더 큰 성과를 보여주었습니다. 깊은 추론이 거의 항상 필요한 매우 어려운 경시대회 수학 문제 세트에서도 모델은 거의 모든 질문에 대해 "Long" 모드를 올바르게 선택하여, 지름길을 찾으려다 시간을 낭비하지 않고 기존 모델의 성능을 그대로 구현했습니다. 이 연구는 추론 모델이 노력이 필요한 때에만 더 많은 생각 시간을 할당하도록 스스로를 조절하도록 훈련될 수 있음을 입증합니다. 이는 인공지능을 단순히 장황한 시스템이 아니라, 더 똑똑하면서도 경제적인 시스템으로 만들기 위한 발전 방향을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →