Latent Reasoning in TRMs is Secretly a Policy Improvement Operator
이 논문은 소규모 모델에서의 잠재적 재귀적 추론이 정책 개선 연산자로서 기능하여, 강화 학습 및 확산 학습 체계를 적용함으로써 성능을 유지하면서도 비효율적인 계산 단계를 제거하고 순전파 횟수를 크게 줄일 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 왜 "생각하기"가 때로는 시간 낭비가 되는가
당신이 어려운 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 당신에게는 작고 똑똑한 조수(AI 모델)가 있고, 이 조수는 퍼즐을 풀기 위해 애쓰고 있습니다.
최근 몇 년 동안 연구자들은 이 조수에게 **"루프(loop)를 돌며 생각하라"**고 지시함으로써 조수를 더 똑똑하게 만들려고 시도했습니다. 조수가 단 하나의 정답을 내놓는 대신, 자신의 이전 추측을 살펴보고, 잠시 생각한 뒤, 조금 더 나은 새로운 추측을 내놓도록 만든 것입니다. 조수는 10번째나 20번째 추측쯤에는 완벽한 해결책을 찾을 것이라는 희망을 품고 이 과정을 반복해서 수행하게 됩니다.
이를 **잠재적 추론(Latent Reasoning)**이라고 부릅니다. 이론적 근거는 다음과 같았습니다: "모델이 스스로를 반복하게 만든다면, 실제로 뇌의 크기를 키우지 않고도 훨씬 더 깊은 사고를 할 수 있는 뇌를 부여하는 것과 같다."
문제점: 이 논문의 저자들은 이러한 논리에 결함이 있다는 것을 발견했습니다. 모델이 루프를 돌고는 있었지만, 그 루프 중 상당수는 아무런 유용한 일도 하지 못하고 있었습니다. 그것은 마치 학생이 수학 문제를 바라보며 틀린 답을 적었다가, 지우고, 다시 적는 과정을 반복하며 마법처럼 정답이 되기를 바라는 것과 같았습니다. 논문에서는 이를 **"데드 컴퓨트(dead compute)"**라고 부릅니다. 즉, 정답을 개선하는 데 실제로 도움이 되지 않는 단계에 에너지를 낭비하는 현상을 말합니다.
발견: 그것은 사실 비밀스러운 "정책 개선(Policy Improvement)" 기계이다
저자들은 한 가지 큰 질문을 던졌습니다: 이 루프가 진행되는 동안 모델의 뇌 내부에서는 실제로 어떤 일이 일어나고 있는가?
그들은 모델이 단순히 "더 깊게 생각하는 것"이 아님을 발견했습니다. 모델은 비밀리에 강화 학습 에이전트(시행착오를 통해 배우는 유형의 AI)처럼 행동하고 있었습니다.
여기 비유가 있습니다:
- 기존 방식: 모델이 추측하고, 그다음 다시 추측하며 두 번째 추측이 더 나아지기를 바랍니다. 이는 눈을 가리고 다트를 던진 뒤, 두 번째 투척이 과녁 중심에 더 가까워지기를 바라는 것과 같습니다.
- 새로운 통찰: 저자들은 모델이 실제로 **"정책 개선(Policy Improvement)"**을 수행하고 있다는 것을 깨달았습니다. 이것은 멋진 표현이지만, 의미는 다음과 같습니다: "현재의 추측을 가져와서, 당신의 추측과 진실 사이의 차이를 살펴보고, 그 차이를 이용해 다음 추측을 목표에 더 가깝게 밀어 넣어라."
논문은 모델이 루프를 돌 때마다 특정 "이점(advantage)"(새로운 추측이 이전 추측보다 얼마나 더 나은지를 나타내는 점수)을 계산해야 한다고 증명합니다. 만약 그렇지 않다면, 그것은 그냥 바퀴만 헛돌고 있는 것과 같습니다.
해결책: 심층 개선 감독 (Deep Improvement Supervision, DIS)
모델이 "데드 컴퓨트"에 빠져 길을 잃고 있었기 때문에, 저자들은 **심층 개선 감독(DIS)**이라는 새로운 훈련 방법을 발명했습니다.
비유: "빵부스러기" 경로
당신이 집에서 숨겨진 보물을 찾아 걸어가려고 한다고 상상해 보세요.
- 기존 방식 (TRM): 당신은 "보물을 찾을 때까지 원을 그리며 계속 걸으라"는 지시를 받습니다. 당신은 100번의 원을 돌 수도 있지만, 그중 5번만이 실제로 당신을 목표에 더 가깝게 이동시켰을 것입니다. 나머지는 낭비된 발걸음이었습니다.
- 새로운 방식 (DIS): 선생님이 빵부스러기가 그려진 지도를 줍니다.
- 1단계: 첫 번째 빵부스러기(조금 더 나은 추측)를 향해 걷습니다.
- 2단계: 두 번째 빵부스러기(훨씬 더 나은 추측)를 향해 걷습니다.
...그리고 보물에 도달할 때까지 계속합니다.
저자들은 정답을 가져와서 이를 서서히 "오염(corrupting)"시켜(약간 틀리게 만들어) 중간 목표들의 경로를 만듦으로써 이 "빵부스러기"를 생성합니다. 그런 다음 모델이 모든 빵부스러기를 완벽하게 통과하도록 훈련시킵니다.
이것이 작동하는 이유:
모델이 스스로 어떻게 개선해야 할지 알아내기를 막연히 기다리는 대신, 선생님은 모든 단계가 반드시 개선이어야 함을 모델에게 강제로 학습시킵니다. 이를 통해 "데드 컴퓨트"를 "능동적 개선"으로 전환합니다.
결과: 더 빠르고, 더 작고, 더 뛰어나다
저자들은 이 새로운 방법(DIS)을 매우 작은 AI 모델인 **Tiny Recursive Model (TRM)**에 테스트했습니다.
- 적은 노력, 동일한 결과: DIS를 사용하면 모델이 루프를 훨씬 적게 돌아도 된다는 것을 발견했습니다. 그들은 동일하거나 더 나은 결과를 얻으면서도 "생각하는 단계"를 18배 줄였습니다 (336단계에서 단 18단계로).
- 거인들을 이기다: 그들은 이 방법을 ARC-AGI(현대적인 AI용 IQ 테스트와 같은 매우 어려운 일반 지능 벤치마크)에서 테스트했습니다.
- 그들의 아주 작은 모델(매개변수 단 0.8백만 개)은 **24%**의 점수를 기록했습니다.
- 이는 엄청난 성과입니다. 왜냐하면 대부분의 다른 오픈 소스 모델들은 그 점수에 근접하기 위해 수십억 개의 매개변수가 필요하기 때문입니다.
- 그들은 원래의 TRM 모델보다 훨씬 뛰어난 성능을 보였으며, 이는 "비법"이 모델의 크기가 아니라 훈련 방법에 있었음을 증명했습니다.
한 문장 요로 요약
이 논문은 재귀적 AI 모델들이 비밀리에 강화 학습자처럼 추측을 개선하려 했으나, 어떻게 개선해야 하는지 배우지 못해 실패했다는 점을 밝혀냈습니다. 단계별 "빵부스러기" 훈련 경로를 제공함으로써, 저자들은 모델을 18배 더 효율적으로 만들고 훨씬 더 똑똑하게 만들었으며, 이 모든 것을 아주 적은 양의 컴퓨팅 자원으로 해냈습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.