← 최신 논문
💬 NLP

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES는 단계별 지시어 쌍의 모듈형 메모리를 동적으로 확장하고, 현실적인 테스트 시간 제약 조건 하에서 메모리 구성과 추론 정확도를 최적화하기 위해 학습 가능한 조대-세밀(coarse-to-fine) 선택 메커니즘을 채택한 자기 개선형 LLM 추론을 위한 새로운 프레임워크이다.

원저자: Ruilin Tong, Dong Gong

게시일 2026-07-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ruilin Tong, Dong Gong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 MILES 논문을 창의적인 비유를 사용하여 쉬운 개념으로 풀어낸 설명입니다.

핵심 요약: AI를 위한 "스마트 노트"

당신에게 아주 똑똑하지만 고집 센 친구(AI)가 있다고 상상해 보세요. 이 친구는 퍼즐을 푸는 데는 천재적이지만 기억력이 형편없습니다. 당신이 새로운 수학 문제를 물어볼 때마다, 마치 이 문제를 처음 보는 것처럼 행동합니다. 문제는 해결하지만, 나중에 비슷한 질문을 하면 처음부터 다시 시작해야 합니다.

보통 이 친구를 더 똑똑하게 만들려면, 수년 동안 학교에 보내 모든 것을 다시 배우게 해야 합니다(이를 "훈련" 또는 모델의 파라미터 업데이트라고 합니다). 하지만 만약 이 친구가 당신이 다시 학교에 보낼 수 없는, '닫힌 책'과 같은 존재라면 어떨까요? 그들의 뇌를 바꿀 수는 없습니다.

MILES는 이 친구의 뇌를 바꾸지 않으면서도, 일을 하는 동안 실시간으로 더 똑똑해질 수 있도록 돕는 새로운 방법입니다. MILES는 친구에게 실시간으로 쓰고 참고할 수 있는 동적이고 학습 가능한 노트를 제공합니다.

기존 "노트"들의 문제점

기존에 AI에게 "기억"을 부여하려 했던 시도들은 두 가지 주요 결함이 있었습니다:

  1. "전체 솔루션" 방식의 노트: 어떤 방법들은 과거 문제의 전체 정답을 저장했습니다. 만약 당신이 예전 문제와 90% 유사한 질문을 한다면 아주 잘 작동했습니다. 하지만 질문이 약간만 달라져도(새로운 문제인 경우), 예전의 정답은 쓸모가 없어졌습니다. 이는 마치 "애플 파이" 레시피를 가지고 "블루베리 머핀"을 구우려는 것과 같습니다.
  2. "휴리스틱(Heuristic)" 방식의 노트: 다른 방법들은 작은 단계들(예: "2로 나누기" 또는 "단위 확인하기")을 저장했습니다. 하지만 AI는 단순히 단어가 얼마나 유사한지만 보고 다음에 어떤 단계를 사용할지 추측해야 했습니다. 이는 마치 요리사가 필요한 향신료가 무엇인지 몰라, 라벨이 비슷해 보이는 향신료 통을 무작정 집어 드는 것과 같습니다.

MILES의 해결책: "모듈형"이자 "학습 가능한" 시스템

MILES는 추론을 하나의 거대한 콘크리트 덩어리가 아니라 레고 세트처럼 다룸으로써 판도를 바꿉니다.

1. 구성 요소: "하위 목표(Sub-goals)"와 "하위 지침(Sub-instructions)"

MILES는 문제를 통째로 저장하는 대신, 문제를 작고 재사용 가능한 레고 블록으로 분해합니다.

  • 하위 목표 (라벨): 다음에 무엇을 해야 하는지에 대한 짧은 설명 (예: "분수 단순화하기").
  • 하위 지침 (블록): 그것을 어떻게 수행하는지에 대한 구체적인 자연어 팁 (예: "분자와 분모를 최대공약수로 나눈다").

이것은 모든 도구에 명확한 라벨이 붙어 있는 공구함과 같습니다.

2. "스마트 선택기" (학습 가능한 헤드)

이 부분이 마법 같은 부분입니다. 과거에는 AI가 현재 문제와 가장 유사해 보이는 도구를 그냥 집어 들었습니다. 하지만 MILES는 AI에게 공구함에 있는 모든 도구에 대한 개인 비서(선택 헤드)를 붙여줍니다.

  • 학습 방식: AI가 문제를 자신 있게 해결하면(정답을 맞히면), MI별로 지나온 단계들을 되돌아봅니다. *"이봐, 우리가 '분수 단순화' 도구를 사용했을 때, 그것이 정답을 얻는 데 도움이 되었나?"*라고 묻습니다.
  • 훈련: 만약 답이 "예"라면, 비서는 유사한 상황에서 그 도구를 신뢰하도록 학습합니다. 만약 답이 "아니오"라면, 비서는 그 도구를 피하도록 학습합니다.
  • 학교가 필요 없음: AI의 뇌는 그대로 고정되어 있습니다. 오직 이 작은 "비서들"(매우 작은 컴퓨터 프로그램)만이 업데이트됩니다.

3. 2단계 탐색 과정

AI가 새로운 문제에 직면했을 때, MILES는 도서관에서 책을 찾는 것과 같은 "거친 탐색에서 정밀한 탐색(Coarse-to-Fine)" 과정을 사용합니다.

  • 1단계 (거친 탐색): AI는 하위 목표(라벨)를 빠르게 스캔하여 유망한 도구 몇 개를 찾아냅니다. 이는 마치 "수학" 코너를 걸어가며 관련이 있을 법한 책 몇 권을 집어 드는 것과 같습니다.
  • 2단계 (전문가 검토): "비서들"(선택 헤드)이 그 후보들을 가져가 과거의 경험을 바탕으로 점수를 매깁니다. "잠깐, 이 도구는 대수학에는 효과적이었지만 기하학에서는 실패했어. 다른 것을 고르자."

실시간 작동 방식 ("확신 vs 불확실" 흐름)

시스템은 AI가 얼마나 확신하느냐에 따라 두 가지 모드로 작동합니다.

  1. "확신" 모드 (학습 단계):
    AI가 문제를 쉽게 풀고 정답을 맞히면, 이를 "훈련 세션"으로 취급합니다. 성공한 단계들을 분해하여, 그것들을 새로운 레고 블록으로 저장하고, 어떤 도구가 가장 잘 작동했는지 비서들에게 가르칩니다. 노트는 성공할 때마다 더욱 풍성해집니다.

  2. "불확실" 모드 (도움 단계):
    AI가 막히거나 확신이 없으면, 추측을 멈춥니다. 대신 노트를 펼쳐 비서들에게 조언을 구하고, 최고의 도구들을 사용하여 사고 과정을 가이드합니다. 이는 학생이 막혔을 때 손을 들어 선생님에게 힌트를 요청하는 것과 같습니다.

이것이 왜 중요한가 (결과)

논문은 어려운 수학 및 과학 시험(AIME, MATH-500 등)에서 MILES를 테스트했습니다.

  • 더 높은 정확도: 메모리나 탐색을 사용하는 다른 방법들보다 일관되게 더 많은 문제를 정확히 해결했습니다.
  • 효율성: 무작위 추측을 하느라 컴퓨팅 자원을 낭비하지 않고, "학습된" 메모리를 사용하여 더 빠르게 올바른 경로를 선택했습니다.
  • 전이 가능성: 한 AI 모델이 만든 노트가 다른 AI 모델이 문제를 푸는 데 실제로 도움을 줄 수 있었습니다. 이는 마치 마스터 셰프가 쓴 요리책을 초보 셰프가 즉시 집어 들어 사용할 수 있는 것과 같습니다. 심지어 둘이 만난 적이 없더라도 말이죠.

요약 비유

당신이 비디오 게임을 하고 있다고 상상해 보세요.

  • 기존 방식: 매 레벨을 추측하며 깨려고 노력합니다. 죽으면 다시 시작합니다.
  • 기존 메모리 방식: 특정 레벨을 위한 "승리 전략" 목록을 가지고 있습니다. 레벨 5를 만나면 레벨 5 전략을 사용합니다. 하지만 레벨 5.1을 만나면 막막해집니다.
  • MILES 방식: 스스로 업데이트되는 전략 가이드를 가지고 있습니다. 레벨을 깰 때마다, 가이드는 특정 상황에서 어떤 동작이 가장 잘 작동했는지 자동으로 기록합니다. 다음에 까다로운 점프 구간을 마주하면, 가이드는 단순히 목록을 보여주는 것이 아니라 다음과 같이 필터를 적용합니다. "네가 이전에 승리했을 때를 바탕으로 볼 때, '이중 점프' 동작이 여기서 성공할 확률이 90%야."

MILES는 AI가 뇌를 다시 훈련하지 않고도, 자신의 성장하는 팁과 기술 라이브러리를 더 잘 사용하는 법을 배움으로써 시간이 지남에 따라 경험을 축적하고 더 똑똑해질 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →