Probabilistic Tiny Recursive Model
본 논문은 가우스 노이즈를 반복적 재귀 과정에 주입하여 확률적 탐색을 가능하게 함으로써 소형 모델의 추론 능력을 향상시키는 작업 무관형 프레임워크인 확률적 초소형 재귀 모델(PTRM)을 소개하며, 이는 재학습 없이도 훨씬 적은 매개변수로 프런티어 LLM 대비 복잡한 퍼즐에서 정확도를 거의 두 배까지 높이는 성과를 거둡니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 스도쿠나 논리 그리드 같은 복잡한 퍼즐을 해결하도록 설계된 매우 똑똑하고 작은 로봇이 있다고 가정해 봅시다. 이 로봇은 **Tiny Recursive Model(TRM)**이라고 불리며, 놀라울 정도로 효율적입니다. 이 로봇은 뉴스에서 들어본 거대 AI 모델들처럼 막대한 두뇌 능력을 필요로 하지 않습니다. 대신 컴퓨터 메모리의 극히 일부만 사용합니다.
하지만 이 작은 로봇에는 결함이 하나 있습니다. 첫 번째 추측에 대해 지나치게 자신감이 있다는 점입니다. 일단 퍼즐에 대해 생각하기 시작하면, 단일하고 직선적인 경로를 따릅니다. 실수로 "막다른 길"(나쁜 해결책) 에 들어서면, 뒤로 돌아서 다른 경로를 시도할 수 없거나 멈추게 될 때까지 그 막다른 길을 계속 따라갑니다. 이는 등산객이 길을 발견하자마자 그 길이 절벽으로 이어지더라도 다른 트레일을 시도해 볼 필요가 있는지 말해줄 수 있는 메커니즘이 없기 때문에, 그 길을 곧바로 따라가는 것과 같습니다.
새로운 아이디어: "확률적" 로봇
이 논문의 저자들은 **PTRM(Probabilistic Tiny Recursive Model)**이라는 업그레이드를 도입했습니다. 그들은 로봇에게 새로운 것을 가르치지 않았고, 재학습을 시키지도 않았습니다. 대신 테스트 중 로봇이 어떻게 생각하는지 변경했습니다.
다음은 비유입니다:
구 방식 (결정론적):
거대하고 어두운 미로에서 출구를 찾으려 한다고 상상해 보세요. 당신은 한 명의 탐험가를 보냅니다. 그들은 앞으로 걷고, 왼쪽으로 돌고, 오른쪽으로 돌며 계속 나아갑니다. 벽에 부딪히면 멈춥니다. 고리에 갇히면 그곳에 영원히 머뭅니다. 그들은 출구를 찾을 단 한 번의 기회만 가집니다.
새 방식 (PTRM):
이제 100 명의 탐험가를 동시에 보낸다고 상상해 보세요. 하지만 여기에는 트릭이 있습니다. 그들이 한 걸음을 뗄 때마다, 당신은 아주 작은 무작위 "밀기"(부드러운 바람의 밀어냄과 같은) 를 가해줍니다.
- 이러한 무작위 밀기 때문에 100 명의 탐험가는 모두 정확히 같은 경로를 걷지 않습니다.
- 대부분은 여전히 단일 탐험가와 같은 막다른 길에 갇히게 될 것입니다.
- 하지만, 몇몇은 적절한 밀림을 받아 숨겨진 문이나 출구로 이어지는 다른 길을 우연히 발견할지도 모릅니다.
100 명의 탐험가가 모두 작업을 마치면, 가장 일반적인 답변을 선택하는 것이 아닙니다. 대신 로봇은 Q head라고 불리는 내장된 "심판"을 가지고 있어 100 개의 모든 답변을 살펴보고 "이것이 가장 정확해 보인다"고 말합니다. 그리고 그 승자를 선택합니다.
이것이 중요한 이유
이 논문은 여러 명의 "밀린" 탐험가를 보내는 이 간단한 트릭이 놀라울 정도로 잘 작동한다는 것을 보여줍니다:
- 막다른 길 탈출: 무작위 밀기는 로봇이 원래 로봇이 영원히 갇히게 되는 "나쁜 분지"(막다른 길) 에서 뛰어넘을 수 있게 합니다.
- 저렴함: 로봇은 작습니다 (단 700 만 개의 파라미터). 세계에서 가장 크고 비싼 AI 모델들보다 거의 두 배 더 잘 퍼즐을 해결하지만, 실행 비용은 0.0001% 미만입니다.
- 어려운 퍼즐에서도 작동:
- Sudoku-Extreme에서 로봇은 퍼즐 해결률을 87.4% 에서 **98.75%**로 높였습니다.
- PPBench라는 논리 퍼즐 모음에서는 정확도가 62.6% 에서 **91.2%**로 급증했습니다. 이는 현재 이용 가능한 최고의 단일 AI 모델의 정확도보다 거의 두 배 높으며, 상위 7 개 AI 모델을 모두 합친 "팀"보다 더 좋은 성과를 거두었습니다.
결론
저자들은 로봇이 실제로 (내부 "심판" 덕분에) 올바른 길에 있을 때 이를 알고 있음을 발견했지만, 원래 방법은 잘못된 길로 시작했을 경우 올바른 길을 찾을 기회를 주지 않았다는 사실을 밝혀냈습니다. 약간의 무작위성을 추가하고 퍼즐을 병렬로 여러 번 실행함으로써, 그들은 로봇에게 새로운 것을 가르치지 않고도 로봇의 잠재력을 최대한 끌어냈습니다.
간단히 말해: 보물을 찾으러 한 사람만 보내지 마세요. 약간의 혼란을 가진 백 명을 보내고, 가장 똑똑한 한 사람이 승자를 선택하게 하세요.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.