← 최신 논문
💬 NLP

Context Recycling for Long-Horizon LLM Inference

이 논문은 구조화된 쿼리 생성, 외부 메모리 검색, 그리고 제어된 합성을 통해 작업 관련 정보를 재활용함으로써, 더 큰 컨텍스트 창이나 모델 재학습을 요구하지 않고도 토큰 소비를 줄이고 정확도를 유지하며 긴 호흡의 LLM 추론을 향상시키는 시스템인 ContextForge를 소개한다.

원저자: Derek Thomas

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Derek Thomas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 잘 까먹는 비서와 길고 복잡한 대화를 나누려고 한다고 상상해 보십시오. 이 비서는 한 번에 약 100페이지 분량의 메모만 머릿속에 담을 수 있다는 엄격한 규칙을 가지고 있습니다. 당신이 10분 동안 말하면 비서는 시작 부분을 기억할 것입니다. 하지만 한 시간 동안 말하면, 비서의 "정신적 메모장"이 가득 차버려 앞부분을 완전히 잊어버리게 됩니다.

이 논문은 이 문제를 해결하는 ContextForge라는 시스템을 소개합니다. 이 시스템은 비서의 제한된 메모를 단순히 채워지는 양동이가 아니라, 사무실의 깨끗한 책상처럼 재사용 가능한 작업 공간으로 취급합니다.

작동 원리는 다음과 같으며, 쉬운 개념들로 나누어 설명합니다.

1. "재활용 가능한 책상" (컨텍스트 재활용)

대부분의 AI 시스템에서는 새로운 질문을 할 때마다 시스템이 당신이 말했던 모든 것을 비서의 메모리에 쏟아부어 어떻게든 다 들어가기를 바랍니다. 결국, 책상은 오래된 메모들로 너무 어지러워져서 새로운 메모를 놓을 공간이 없게 됩니다.

ContextForge는 규칙을 바꿉니다:

  • 책상의 크기는 고정됨: 비서는 항상 동일한 양의 책상 공간(컨텍스트 윈도우)을 가집니다.
  • 청소 요원: 비서가 새로운 질문에 답하기 전에, 시스템은 이전 주제와 관련된 특정 메모들을 치웁니다.
  • 새로운 주제: 그런 다음 현재 질문에 꼭 필요한 정확한 새로운 메모들을 즉시 가져옵니다.
  • 결과: 비서는 대화가 아무리 길어져도 결코 공간이 부족해지지 않습니다. 이는 마치 도서관 사서와 같습니다. "역사"에 대해 물으면 사서는 "역사" 책들을 치우고 "생물학" 책들을 가져다 놓습니다. 책상의 크기는 변하지 않지만, 정보는 항상 신선합니다.

2. 5단계 도서관 (계층적 메모리)

이 책상 시스템이 제대로 작동하도록, 저자들은 정보가 서로 다른 속도와 비용으로 존재하는 5층짜리 도서관을 구축했습니다.

  • 레이어 -1 (뇌의 본능): 선택 사항. 만약 당신이 AI 모델을 소유하고 있다면, 모델의 뇌 가중치를 미세 조정하여 특정 전문 용어나 기술을 영구적으로 "가르칠" 수 있습니다. 이는 비서가 매번 책을 읽을 필요 없이 의학이나 코딩에 대한 타고난 재능을 갖게 되는 것과 같습니다. 이는 "책상 공간"을 전혀 차지하지 않습니다.
  • 레이어 0 (영구적인 표지판): 이것은 시스템의 정체성과 상위 수준의 규칙입니다. 이는 "환영합니다" 표지판처럼 책상 위에 영구적으로 머뭅로 있습니다. 다시 읽을 필요가 없습니다.
  • 레이어 1 (활성 책장): 이것이 "재활용 가능한" 부분입니다. 당신이 질문을 하면, 시스템은 필요한 지식의 특정 장(또는 "가지")을 집어 책상 위에 올려놓습니다. 일이 끝나면 책을 다시 책장에 꽂아둡니다.
  • 레이어 2 (초고속 인덱스): 이것은 번개처럼 빠른 카탈로그입니다. 시스템이 거대한 도서관에서 어떤 책을 가져올지 1초도 안 되는 시간에 알려줍니다. 책을 읽는 것이 아니라, 단지 올바른 책을 가리킵니다.
  • 레이어 3 (거대한 창고): 이것은 실제 저장소(하드 드라이브)로, 당신의 모든 데이터가 사는 곳입니다. 테라바이트 단위의 정보를 담을 수 있어 사실상 무한하지만, 접근하는 데 시간이 걸립니다. 시스템은 여기서 필요한 것만 뽑아옵니다.

3. "선제적인 집사"

이 시스템은 당신이 책을 요청할 때까지 기다렸다가 창고로 달려가는 대신, 당신의 요구를 예측하는 집사를 두고 있습니다.

  • 만약 당신이 매일 오전 9시에 "오전 회의" 메모를 확인한다면, 집사는 8시 55분까지 그 메모들을 책상 위에 준비해 둡니다.
  • 만약 당신이 "데이터베이스" 메모를 보고 있다면, 집사는 보통 함께 쓰이는 "스키마" 메모도 함께 가져올 수 있습니다.
  • 이 과정은 자동으로 일어나며, 이를 통해 AI가 더 빠르고 준비된 것처럼 느껴지게 합니다.

4. "학습이 필요 없는" 마술

이 논문은 값비싼 학습 없이 AI에게 특정 지식을 주는 영리한 트릭을 설명합니다.

  • 기존 방식: AI에게 의학을 가르치려면 보통 수천 권의 의학 서적을 입력하고 비싼 그래픽 카드로 며칠 동안 실행해야 합니다.
  • ContextForge 방식: 저자들은 AI가 일반 텍ex트와 의학 텍스트에 어떻게 반응하는지 살펴보는 수학적 지름길(SVD)을 사용합니다. 그런 다음, AI에게 의학적 사고의 패턴을 가르치는 아주 작은 "어댑터"(작은 추가 기능)를 만듭니다. 이는 일반 컴퓨터에서 약 3분 정도 걸리며 별도의 학습 데이터도 필요하지 않습니다.

5. 수치가 말해주는 것

저자들은 이 시스템을 방대한 의료 보험 기록(2억 7,600만 행)을 사용하여 표준적인 고성능 AI 에이전트(Azure AI Foundry)와 테스트했습니다.

  • 정확도: 두 시스템 모두 정답을 맞히는 빈도가 거의 비슷했습니다(약 85% 대 84%).
  • 속도: ContextForge 시스템은 12회 대화에서 4.7배 더 빨랐고, 15회 대화에서는 8배 더 빨랐습니다.
  • 비용 (토큰): 짧은 테스트에서는 "토큰"(AI가 텍스트를 측정하는 통화)을 4.2배 적게 사용했고, 긴 테스트에서는 13.4배 적게 사용했습니다.

왜 격차가 더 커졌을까요?
대화가 길어질수록 표준 AI는 매번 전체 대화 기록을 다시 보내야 했기 때문에 더 느려지고 비싸졌습니다. 반면 ContextForge 시스템은 "책상"을 깨끗하게 유지하며 새로운 관련 정보만 보냈기 때문에, 대화가 얼마나 길어지든 상관없이 빠르고 저렴하게 유지되었습니다.

요약

이 논문은 AI를 위해 점점 더 큰 메모리 양동이를 만드는 대신, 컴퓨터의 **작업 세트(working set)**처럼 취급해야 한다고 주장합니다. 즉, 필요한 것을 불러오고, 사용하고, 비워내는 방식입니다. 지식을 계층 구조로 조직하고 작업 공간을 재활용함으로써, 당신은 AI가 느려지거나, 비싸지거나, 혹은 기억을 잃지 않으면서도 길고 복잡한 대화를 나눌 수 있습니다.

이 시스템은 오픈 소스이며 기존 AI 모델과 함께 작동합니다. 즉, 이러한 이점을 얻기 위해 새로운 유형의 AI를 발명할 필요는 없으며, 단지 메모리를 더 잘 관리하기만 하면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →