← 최신 논문
🤖 machine learning

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

이 논문은 사전 학습된 레이어를 동적으로 건너뛰거나 루프를 돌려 각 입력에 대한 맞춤형 실행 경로를 생성하는 훈련 불필요 프레임워크인 "Program-of-Layers" (PoLar)를 소개하며, 이러한 유연한 추론이 표준적인 고정 깊이 LLM 처리 방식보다 정확도와 효율성을 크게 향상시킨다는 점을 입증한다.

원저자: Ziyue Li, Yang Li, Tianyi Zhou

게시일 2026-06-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziyue Li, Yang Li, Tianyi Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게는 복잡한 문제를 해결하는 것으로 유명한, 매우 똑똑하고 사전 학습된 로봇 셰프(대규모 언어 모델, 즉 LLM)가 있습니다. 이 셰프는 어떤 요리를 만들든 상관없이 항상 따라야 하는 정해진 단계(레이어)의 엄격한 레시피 북을 가지고 있습니다.

만약 셰프에게 "계란을 삶으라"고 요청하면, 계란을 삶는 데는 그저 물이 담긴 냄비만 있으면 되는데도 불구하고, 채소를 다듬고 수프에 간을 맞추는 등의 100단계에 달하는 마스터 레시피를 모두 수행합니다. 만약 "설탕으로 성을 쌓으라"고 요청하면, 셰프는 동일한 100단계를 따르며, 만약 중간에 막혀서 접근 방식을 다시 생각해야 할 때도 마찬가지입니다.

문제점:
이 논문은 이러한 "일률적인" 레시피가 비효율적이라고 주장합니다. 때때로 셰프는 불필요한 단계를 수행하며 시간을 낭비하고, 때로는 어려운 문제를 깊이 생각할 시간이 부족하여 실패하기도 합니다.

발견 (아하! 모먼트):
연구진들은 질문했습니다: 만약 셰프가 즉석에서 자신의 레시피를 스스로 다시 쓸 수 있다면 어떻게 될까?

그들은 거의 모든 문제에 대해 셰프의 기술을 사용하는 단 하나의 "정답"인 방법만 존재하는 것이 아니라는 것을 발견했습니다. 즉, 작동할 수 있는 다양한 "프로그램"(단계의 순서)이 존재합니다.

  • 건너뛰기(Skipping): 쉬운 문제(계란 삶기 같은 경우)의 경우, 셰프는 처음 50단계를 건너뛰고 마지막 10단계만 수행할 수 있습니다.
  • 반복하기(Looping): 어려운 문제(설탕 성 쌓기 같은 경우)의 경우, 셰프는 특정 단계에서 막힐 수 있으며, 결과를 개선하기 위해 그 단계를 몇 번 반복한 후 다음으로 넘어갈 수 있습니다.

연구진은 이러한 숨겨진 더 나은 레시피를 찾기 위해 "검색 엔진"(몬테카를로 트리 탐색)을 사용했습니다. 그들은 다음을 발견했습니다:

  1. 짧을수록 종종 더 좋다: 많은 문제들이 표준 레시피보다 더 적은 단계로 정확하게 해결될 수 있습니다.
  2. 반복이 도움이 된다: 어려운 문제의 경우, 특정 구간을 반복하는 것(루핑)이 표준 레시피가 범하는 실수를 바로잡는 데 도움이 됩니다.
  3. 혼합이 핵심이다: 최상의 레시피는 일부 단계를 건너뛰고 다른 일부를 반복하는 방식의 혼합을 포함합니다.

해결책: POLAR
이러한 완벽한 레시피를 찾는 데는 문제가 있습니다. 레시피를 찾는 과정 자체가 너무 오래 걸리기 때문입니다. 모든 질문에 대해 셰프에게 "1,000가지 다른 레시피를 시도해 봐"라고 요청할 수는 없습니다. 그러면 시간이 너무 오래 걸릴 것입니다.

그래서 연구팀은 작고 가벼운 "레시피 예측기"(POLAR)를 만들었습니다.

  • 작동 방식: 질문을 받기 전, 이 예측기는 질문을 보고 즉시 최적의 맞춤형 레시피를 추측합니다. 예측기는 "110단계를 건너뛰고, 1120단계를 정상적으로 수행한 뒤, 21~25단계를 두 번 반복하고, 나머지는 건너뛰어라"라고 말합니다.
  • 마법 같은 점: 메인 셰프(거대 LLM)는 전혀 변하지 않습니다. 셰프는 여전히 고정되어 있고 사전 학습된 상태입니다. 예측기는 단지 그 특정 순간을 위해 셰프가 기존의 기술을 어떻게 사용할지 알려줄 뿐입니다.

결과:
수학 문제에 대해 테스트했을 때:

  • 정확도가 올라갔습니다: 셰프는 더 많은 문제를 정확하게 해결했으며, 표준 레시피가 저지른 실수까지 바로잡았습니다.
  • 속도가 올라갔습니다: 쉬운 문제의 경우, 셰프는 불필요한 단계를 건너뛰었기 때문에 더 빠르게 작업을 마쳤습니다.
  • 새로운 것에도 작동합니다: 심지어 본 적 없는 수학 문제를 셰프에게 테스트했을 때도, 예측기는 좋은 결과를 얻기 위해 레시피를 조정하는 법을 알고 있었습니다.

요약하자면:
스마트한 모델에게 모든 작업에 대해 고정되고 경직된 경로를 따르도록 강요하는 대신, 이 논문은 모델에게 "리모컨"을 주는 방법을 가르쳐 줍니다. 이 리모컨을 통해 우리는 지루한 부분은 건너뛰거나 까다로운 부분은 "반복" 버튼을 누를 수 있으며, 이를 통해 모델을 재학습시키거나 뇌를 바꿀 필요 없이 더 똑똑하고, 빠르고, 효율적으로 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →