Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution
이 논문은 테스트 시점의 실행을 피드백을 내재화하고 모델의 추론 전략을 진화시키기 위해 그룹 상대 정책 최적화(GRPO)를 통해 동적으로 업데이트되는 일시적 LoRA 어댑터를 활용하는 온라인 최적화 과정으로 취급함으로써 LLM의 추론 능력을 향상시키는 Policy of Thoughts (PoT) 프레임워크를 소개하며, 이를 통해 4B 모델이 복잡한 코딩 벤치마크에서 훨씬 더 큰 규모의 최첨단 모델들을 크게 능가할 수 있게 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 까다로운 퍼즐, 예를 들어 복잡한 코딩 챌린지나 긴 사고의 사슬이 필요한 수학 문제를 풀고 있다고 상상해 보세요. 당신에게는 많은 사실을 알고 있지만 때때로 루프에 빠져 똑같은 실수를 반복하는 슈퍼 스마트한 비서(대규모 언어 모델)가 있습니다. 인공지능의 세계에서 이 비서는 보통 '동결된(frozen)' 뇌를 가지고 작동합니다. 즉, 일단 생각을 시작하면 중간에 자신의 근본적인 전략을 바꿀 수 없습니다. 만약 잘못된 길로 접어든다면, 운 좋게 정답을 찾거나 동시에 여러 경로를 시도해 볼 때까지 그 잘못된 길을 계속 걸어갈 뿐입니다. 이것은 이미 부딪힌 벽으로부터 배우기보다는, 벽에 부딪힐 때까지 모든 복도를 눈 가리고 뛰어다니며 미로를 탈출하려는 것과 같습니다.
오랫동안 이러한 어려운 문제를 해결하는 가장 좋은 방법은 컴퓨터에게 수백만 개의 추측을 시도할 수 있도록 더 많은 시간과 컴퓨팅 파워를 주는 것이었습니다. 하지만 이 논문은 더 똑똑한 방법을 제시합니다. 단순히 더 열심히 노력하는 대신, 컴퓨터가 시도하는 동안 학습해야 한다는 것입니다. 이것은 비디오 게임 캐릭터가 죽었을 때 단순히 다시 태어나서 다시 시도하는 것이 아니라, 방금 자신을 죽게 만든 특정 함정으로부터 실제로 배우고 다음 시도를 위해 전략을 즉시 조정하는 것과 같습니다. 이 연구의 연구자들은 다음과 같이 질문합니다. 만약 우리 AI가 이전의 추측이 실패했는지 성공했는지에 따라 자신의 추론 규칙을 실시간으로 업데이트하며 '순발력 있게 생각할' 수 있다면 어떻게 될까요? 이것은 단순히 스크립트를 따르는 로봇과, 매번 직면하는 새로운 도전마다 자신의 뇌를 즉각적으로 적응시키고 진화시키는 로봇의 차이입니다.
"사고의 정책(Policy of Thoughts)": AI가 플레이하며 학습하도록 가르치기
PoT(Policy of Thoughts)를 만나보세요. 이는 문제를 푸는 것을 단 한 번의 추측이 아니라, AI와 문제 사이의 생생하고 진화하는 대화로 취급하는 새로운 프레임워크입니다. 저자들(절강 대학교 및 LMU 뮌헨 등의 연구진)은 AI의 전략이 정답을 찾는 동안 고정되어 있는 기존 방식이 우리의 발목을 잡고 있다고 주장합니다. 그들은 AI가 테스트 도중에 자신의 실패로부터 학습하여 얻는 '두 번째 기회'를 통해, 실시간으로 스스로를 훈련하는 시스템을 제안합니다.
포퍼의 퍼즐: 추측, 테스트, 그리고 진화
핵심 아이디어는 과학이 "추측과 반박"을 통해 발전한다고 믿었던 유명한 철학자 칼 포퍼(Karl-Popper)에게서 영감을 받았습니다. 쉬운 말로 설명하자면, 이는 당신이 추측을 하고, 그것을 현실에 대조하여 테스트하며, 만약 실패한다면 왜 실패했는지 정확히 배워서 다음번에 더 나은 추측을 할 수 있도록 하는 것을 의미합니다.
PoT는 이 철학을 AI에 구현합니다. 이 순환 과정은 다음과 같습니다:
- 추측 (The Conjecture): AI는 문제를 보고 몇 가지 다른 가능한 해결책을 생성합니다 (마치 지도 위에 세 가지 다른 경로를 스케치하는 것과 같습니다).
- 반박 (The Refutation): 시스템은 실제 환경(예: 코드 컴파일러)에서 이러한 해결책들을 실행합니다. 만약 코드가 충돌하거나 틀린 답을 내놓는다면, 그것이 바로 "반박"입니다.
- 진화 (The Evolution): 이것이 마법 같은 부분입니다. 실패한 추측을 그냥 버리는 대신, PoT는 그 실패를 사용하여 AI의 내부 "정책"(사고 전략)을 업데이트합니다. 이는 AI가 생각하는 방식에 대해 이 특정 문제에 대해서만 아주 미세하고 즉각적인 조정을 가하는 것입니다.
- 반복 (The Repeat): AI는 새로 업데이트된 뇌를 가지고 다시 시도하며, 이제 방금 저지른 특정 실수를 피할 수 있는 더 나은 능력을 갖추게 됩니다.
"임시 뇌"의 기술
당신은 아마 이렇게 물을지도 모릅니다. "AI가 모든 문제로부터 배운다면, 이전에 알던 것을 잊어버리거나 혼란스러워하지 않을까요?" 저자들은 영리한 해결책을 가지고 있습니다. 그들은 LoRA(Low-Rank Adaptation)라고 불리는 기술을 사용하는데, 이는 AI에게 탈부착이 가능한 가벼운 "사고용 모자"를 씌워주는 것과 같습니다.
AI에게 방대한 지식의 영구적인 도서관(기본 모델)이 있다고 가정해 봅시다. 어려운 문제에 직면했을 때, AI는 특별하고 가벼운 "사고용 모자"(LoRA 어댑터)를 씁니다. 이 모자는 AI가 이 특정 문제를 위해 전략을 빠르게 배우고 적응할 수 있게 해줍니다. 일단 퍼즐이 풀리거나 시간이 다 되면, 모자는 벗겨져서 버려집니다. 영구적인 도서관은 손상되지 않고 혼란스럽지도 않은 상태로 유지됩니다. 즉, AI는 일반적인 지식을 망가뜨리지 않으면서도 모든 새로운 문제에 대해 적응의 달사가 될 수 있습니다.
결과: 작은 뇌, 큰 승리
연구진은 정밀한 단계별 논리가 요구되어 매우 어려운 것으로 알려진 코딩 챌린지에서 이 아이디어를 테스트했습니다. 그들은 상대적으로 작은 AI 모델(매개변수 40억 개)을 사용하고 여기에 PoT 프레임워크를 적용했습니다.
결과는 놀라웠습니다. 이 작은 모델은 PoT를 사용하여 LiveCodeBench V6라는 까다로운 벤치마크의 문제 중 **49.71%**를 해결했습니다. 이를 비교해 보자면 다음과 같습니다:
- 이 모델은 동일한 특정 벤치마크에서 **29.71%**를 기록한 거대한 상용 모델인 GPT-4o를 이겼습니다.
- 이 모델은 다른 대규모 모델들의 베이스라인 성능을 크게 상회하며, 동적 학습이 훨씬 더 큰 시스템의 정적 추론을 능가할 수 있음을 입증했습니다.
- Gemini-2.5-Flash(전체 60.91%)나 Claude-Opus-4(전체 55.22%) 같은 모델들이 더 넓고 혼합된 벤치마크에서 더 높은 점수를 기록하긴 했지만, PoT가 강화된 4B 모델의 LiveCodeBench V6에서의 49.71%는 50배 이상 작은 모델이 거둔 엄청난 도약이며, 적응형 추론이 복잡하고 특정한 작업에서 거물들과 격차를 줄일 수 있음을 증명합니다.
가장 인상적인 점은, PoT가 강화된 모델이 경쟁하는 거대 모델들보다 50배 이상 작다는 것입니다. 이 모델은 더 큰 뇌를 가져서 이긴 것이 아니라, 자신이 가진 뇌를 사용하는 더 똑똑한 방법을 가졌기에 승리한 것입니다.
이것이 중요한 이유
이 논문은 AI 추론의 미래가 단순히 더 크고 더 큰 모델을 만드는 것에 있지 않다고 시사합니다. 그것은 모델에게 "순발력 있게 생각할" 수 있는 능력을 부여하는 것에 관한 것입니다. 테스트 과정을 훈련 세션으로 전환함으로써, AI는 실패한 경로에 에너지를 낭비하는 대신 그 에너지를 즉각적으로 전략을 개선하는 데 사용하기 시작합니다.
저자들은 명확한 피드백(예: 코드가 실행되거나 충돌하는 경우)이 있을 때 이 방법이 가장 잘 작동한다는 것을 발견했습니다. 피드백이 모호할 때는 이득이 적지만 여전히 긍정적입니다. 또한 이 접근 방식이 시작했던 모델뿐만 아니라 다양한 유형의 모델에서도 작동함을 보여주었습니다.
요약하자면, PoT는 어려운 문제를 해결하는 최선의 방법은 단순히 더 열심히 노력하는 것이 아니라, 더 빨리 배우는 것이라고 제안합니다. AI가 매번 직면하는 모든 도전에 대해 자신의 추론 전략을 스스로 진화시키도록 함으로써, 우리는 훨씬 더 작고 효율적인 컴퓨터로부터 초지능적인 결과를 얻을 수 있습니다. 이것은 "정답을 찾는 것"에서 "정답을 찾는 법을 배우는 것"으로의 전환입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.