← 최신 논문
💬 NLP

EndPrompt: Efficient Long-Context Extension via Terminal Anchoring

EndPrompt 은 목표 길이의 위치 인덱스가 포함된 종단 프롬프트를 추가함으로써 대규모 언어 모델의 컨텍스트 창을 64K 로 확장하는 효율적인 방법으로, 전체 길이의 미세 조정에 따른 높은 계산 비용을 피하면서도 RULER 와 LongBench 와 같은 벤치마크에서 우수한 성능을 달성합니다.

원저자: Han Tian, Luxuan Chen, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Jinman Zhao, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Haoyi Xiong, Dawei Yin

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Han Tian, Luxuan Chen, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Jinman Zhao, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Haoyi Xiong, Dawei Yin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 짧은 이야기를 읽는 데는 뛰어나지만, 백과사전 전체를 읽으라고 하면 혼란에 빠지는 천재 학생 (AI 모델) 이 있다고 가정해 봅시다. 보통 이 학생에게 백과사전 전체를 다룰 수 있도록 가르치려면, 그 책을 끝까지 반복해서 읽게 해야 합니다. 이는 비용이 많이 들고 느리며, 찾기 어려운 방대한 분량의 긴 책들이 필요합니다.

'EndPrompt'라는 논문은 이 문제를 해결하는 교묘한 지름길을 제안합니다. 학생에게 책 전체를 읽게 하는 대신, 짧은 이야기를 주고 그 끝부분에 아주 작고 구체적인 메모를 붙여 "이것은 매우 긴 책의 끝입니다"라고 알려주는 것입니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. 문제: "2 차 (Quadratic)" 비용

긴 문서를 읽는 것은 텍스트 내의 모든 단어를 서로 다른 모든 단어와 연결하려는 시도와 같습니다. 텍스트 길이를 두 배로 늘리면, 단어를 연결하는 데 필요한 작업량은 단순히 두 배가 아니라 네 배로 증가합니다. 이로 인해 긴 텍스트로 AI 를 훈련시키는 것은 엄청나게 비싸고 느려집니다.

2. 해결책: "책장 (Bookend)" 트릭

연구자들은 AI 가 64,000 단어 분량의 책 중간을 실제로 읽어 그 길이를 처리하는 방법을 이해할 필요가 없다는 사실을 깨달았습니다. AI 는 단지 시작과 끝 사이의 거리를 이해하기만 하면 됩니다.

그들은 EndPrompt라는 방법을 고안했습니다:

  • 첫 번째 세그먼트: 짧은 이야기와 같은 일반적인 짧은 텍스트 조각을 가져와 그대로 유지합니다. 이것이 책의 "시작"입니다.
  • 두 번째 세그먼트: 끝부분에 매우 짧은 "종단 프롬프트 (terminal prompt)" (몇 단어들) 를 붙입니다.
  • 마법 같은 트릭: 물리적으로 텍스트는 짧지만, AI 의 내부 시계에게 짧은 이야기가 위치 0 에 있고, 끝부분의 작은 메모가 위치 64,000 에 있다고 알려줍니다.

3. 비유: "신축성 있는 고무줄"

AI 의 어텐션 (attention) 메커니즘을 신축성 있는 고무줄이라고 상상해 보세요.

  • 옛 방식: 고무줄을 64,000 인치까지 늘리는 법을 가르치려면 훈련 중에 실제로 그 길이까지 물리적으로 늘려야 했으며, 이는 어렵고 많은 힘 (컴퓨팅 파워) 을 필요로 했습니다.
  • EndPrompt 방식: 고무줄은 물리적으로 짧게 유지하되, 끝부분에 표시를 하고 "이 표시는 64,000 인치 떨어져 있다"고 말합니다. AI 는 거리를 파도와 같은 패턴으로 이해하는 특정 수학 도구 (RoPE) 를 사용하기 때문에, 시작과 이 끝 표시 사이의 "거리 파동"이 거대하다는 것을 학습합니다.

이야기를 잘게 쪼개지 않고 온전한 상태로 유지함으로써, AI 는 긴 거리 관계의 수학을 학습함과 동시에 이야기의 의미도 학습하게 됩니다.

4. 작동 원리: "부드러움 (Smoothness)" 이론

논문은 AI 의 수학이 "부드럽다"고 설명합니다. 1 인치 거리와 64,000 인치 거리를 처리하는 법을 가르치면, 수학은 10,000 인치나 30,000 인치와 같은 그 사이의 거리들에 대해 명시적으로 모든 단계를 가르치지 않아도 자연스럽게 빈칸을 채웁니다. 작은 웅덩이와 거대한 협곡을 뛰어넘는 법을 가르치면, 그 사이의 중간 크기의 강을 어떻게 뛰어넘을지 직관적으로 알아내는 것과 같습니다.

5. 결과: 더 빠르고, 저렴하며, 더 우수함

연구자들은 인기 있는 AI 모델 (LLaMA 계열) 에 대해 이를 테스트하여, 8,000 단어가 아닌 64,000 단어를 처리하도록 만들었습니다.

  • 효율성: 짧은 훈련 시퀀스만 사용하여 막대한 시간과 비용을 절약했습니다.
  • 성능: 전체 길이의 비싼 시퀀스로 훈련을 강요받은 모델들보다 AI 가 더 좋은 성능을 발휘했습니다.
  • 다용도성: 질문 답변, 텍스트 요약, 코드 작성 등 다양한 작업에서 잘 작동하여, AI 가 단순히 트릭을 외운 것이 아니라 실제로 긴 컨텍스트를 처리하는 법을 학습했음을 입증했습니다.

요약

EndPrompt는 AI 에게 방대한 양의 텍스트를 읽게 하지 않고도 방대한 양의 텍스트를 처리하도록 가르치는 방법입니다. 훈련 데이터를 짧게 유지하되 끝부분의 위치 레이블을 "늘려"줌으로써, AI 는 "긴 거리"라는 개념을 효율적으로 학습합니다. 이는 마라톤을 뛰는 신발을 신은 채 짧은 거리를 질주하게 하여 마라톤을 뛰는 법을 가르치는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →