← 최신 논문
💬 NLP

LoopMTP: A looped transformer guided by latent multi-token prediction

이 논문은 중간 은닉 상태를 잠재적 다중 토큰 예측을 통해 미래 토큰 임베딩과 정렬함으로써 과잉 사고(overthinking)를 완화하고 추론 정확도를 크게 향상시키는 방식으로 루프드 트랜스포머(looped transformers)를 개선하는 매개변수 효율적인 프레임워크인 LoopMTP를 제안한다.

원저자: Behzad Shomali, Markus Frey, David Berghaus, Joachim Koehler, Mehdi Ali

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Behzad Shomali, Markus Frey, David Berghaus, Joachim Koehler, Mehdi Ali

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 까다로운 퍼즐, 예를 들어 복잡한 수학 문제나 반전이 있는 이야기를 쓰는 일을 하고 있다고 상상해 보세요. 당신은 각자의 책상을 가진 전문가들로 구성된 거대한 팀을 고용할 수도 있을 것입니다. 이것이 오늘날 대부분의 강력한 AI 모델이 작동하는 방식입니다. 즉, 수천 개의 '전문가' 층이 서로 쌓여 있는 거대하고 거대한 구조를 가지고 있습니다. 하지만 만약 당신에게 단 한 명의 명석한 전문가와 작은 책상 하나뿐이라면 어떨까요? 그 전문가에게 문제를 계속해서 반복해서 생각하며 답변을 정교하게 다듬을 기회를 준다면, 여전히 그 퍼즐을 풀 수 있을까요? 이것이 바로 '루프 트랜스포머(looped transformers)'라고 불리는 분야에서 논의되고 있는 핵심적인 질문입니다.

오랫동안 과학자들은 AI가 더 똑똑해지기 위해서는 더 커져야 한다고 믿어 왔습니다. 하지만 여기에는 함정이 있습니다. 모델이 커질수록 비용이 많이 들고 일반 컴퓨터에서 실행하기 어렵다는 점입니다. 또한, AI는 때때로 자신의 생각 속에 갇혀 단순한 답을 너무 깊게 생각하다가 오히려 망쳐버리는 루프에 빠지기도 합니다. 또 다른 아이디어인 '멀티 토큰 예측(Multi-Token Prediction)'은 AI가 단순히 문장의 다음 단어를 추측하는 대신, 동시에 다음 몇 개의 단어를 예측해야 한다고 제안합니다. 이는 마치 체스 선수가 단 한 수 앞이 아니라 세 수 앞을 내다보는 것처럼, AI가 앞을 내다보며 계획을 세우도록 강제합니다. 과제는 '다시 생각하는' 접근 방식과 '앞을 내end다보는' 접근 방식을 어떻게 결합하여 AI가 혼란에 빠지거나 에너지를 낭비하지 않게 하느냐였습니다.

여기에 연구자 베자드 쇼말리(Behzad Shomali)와 그의 팀이 제안한 새로운 방법인 LOOPMTP가 등장했습니다. LOOPMTP를 이 단 한 명의 명석한 전문가를 위한 영리한 전략이라고 생각해 보세요. 전문가가 퍼즐을 뚫어지게 쳐다보며 노트를 다시 쓰는 대신(이는 종종 좋은 아이디어를 지워버리는 결과를 초래합니다), LOOPMMTP는 그들에게 특별한 가이드를 제공합니다. 전문가가 퍼즐을 새로 살펴보는 매 순간(즉, '루프'를 돌 때마다), 그들이 해결책의 특정 미래 조각에 시선을 고정하도록 부드럽게 유도하는 것입니다.

이것이 실제로 어떻게 작동하는지 살펴보겠습니다. AI가 이야기를 쓰고 있다고 가정해 봅시다. 표준적인 루프에서는 AI가 문장을 쓴 다음, 방금 쓴 내용을 즉시 잊어버리고 그것을 다시 쓰려고 시도하다가 종종 실수를 저지릅니다. LOOPMTP는 규칙을 바꿉니다. AI가 이야기의 두 번째 패스를 진행할 때, 내부적으로 "헤이, 지금부터 두 단계 뒤에 나올 단어를 준비해야 한다는 걸 기억해"라는 메시지를 받게 됩니다. 세 번째 패스에서는 세 단계 앞을 내다보라는 지침을 받습니다. 이것이 '멀티 토큰 예측'이 가이드 역할을 하는 부분입니다. 이는 AI에게 미래의 단어들을 소리 높여 외치라고 강요하는 것이 아니라, 그 미래 단어들의 '개념'에 AI의 내부적인 생각을 정렬시키는 것입니다. 이는 마치 등산객이 앞으로 달려 나가기 위해서가 아니라, 매 걸음이 올바른 방향으로 향하고 있는지 확인하기 위해 주머니에 지도를 넣어두는 것과 같습니다.

연구진은 또한 '문지기(gatekeeper)' 메커니즘을 추가했습니다. 과거에는 AI가 루프를 돌 때, 마치 요리사가 맛을 볼 때마다 소스를 버리는 것처럼 이전 루프의 작업물을 버리곤 했습니다. LOOPMTP는 모든 버전의 소스를 보관하면서, 스마트한 게이트를 사용하여 각 버전을 최종 요리에 얼마나 섞을지 결정합니다. 이를 통해 AI가 문제를 여러 번 생각하더라도 좋은 정보가 손실되지 않도록 보장합니다.

이러적인 접근 방식의 결과는 매우 유망합니다. 연구팀이 수학, 코딩, 일반 지식 질문을 포함한 다양한 과업에 대해 LOOPMTP를 테스트했을 때, 이 모델은 루핑 기술을 사용하지 않은 표준 모델보다 성능이 현저히 뛰어났습니다. 실제로, 이들은 루핑 기술을 사용하지 않은 표준 모델과 비교했을 때 평균적으로 최대 **8.1%**까지 정확도를 향상시켰습니다. 더욱 인상적인 점은, AI에게 문제를 15번 연속으로 "생각"하도록 요청했을 때도 안정성을 유지하며 계속해서 개선되는 모습을 보였다는 것입니다. 유사한 다른 모델들은 불과 몇 번의 루프만으로도 무너지거나 혼란에 빠졌습니다.

이 논문은 이 방법이 거대하고 비싼 모델을 구축할 필요 없이 더 작은 AI 모델을 더 똑똑하게 만드는 강력한 방법임을 시사합니다. AI의 내부적인 생각을 미래로 유도함으로써, 우리는 AI가 과하게 생각하는 것을 방지하고 제한된 컴퓨팅 자원을 훨씬 더 효율적으로 사용하도록 도울 수 있다는 것을 보여줍니다. 연구진은 이 방법이 특히 수학 및 추론 과업에 효과적이라고 언급하면서도, 한계가 있다는 점 또한 지적했습니다. 즉, 모델에게 너무 많이 생각하도록 요구하면 결국 다시 혼란을 겪을 수 있다는 것입니다. 하지만 현재로서 LOOPMTP는 AI가 더 큰 뇌를 갖지 않고도 더 열심히 "생각"할 수 있도록 돕는 신선하고 즐거운 방식을 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →