← 최신 논문
💬 NLP

CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs

이 논문은 RoPE(Rotary Positional Embeddings)의 저주파 성분에 소프트 클리핑을 적용하여 분포 외(out-of-distribution) 완화와 의미론적 모델링을 통합함으로써, 대규모 언어 모델의 컨텍스트 길이를 최대 256k까지 확장하여 최첨단 길이 일반화 성능을 달성하는 미니멀리즘 방식인 CoPE를 소개한다.

원저자: Haoran Li, Sucheng Ren, Alan Yuille, Feng Wang

게시일 2026-02-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haoran Li, Sucheng Ren, Alan Yuille, Feng Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 방대한 도서관의 책을 모두 읽은 매우 똑똑한 사서라고 상상해 보세요. 이야기를 이해하기 위해서 사서는 단어가 무엇인지뿐만 아니라, 그 단어가 문장 속 '어디'에 위치하는지도 알아야 합니다. AI의 세계에서 이 "어디"라는 정보는 RoPE(Rotary Positional Embedding, 회전형 위치 임베딩)라는 도구에 의해 처리됩니다.

RoPE를 모든 단어에 부착된 거대하고 복잡한 시계판이라고 생각해 보세요. 이야기가 길어짐에 따라, 이 시계의 바늘들은 서로 다른 속도로 회전합니다. 어떤 바늘은 매우 빠르게 돌고(고주파), 어떤 바위는 매우 느리게 돕니다(저주파).

문제점: 길을 잃는 느린 시계들

이 논문은 느리게 도는 시계들(저주파 성분)에서 발생하는 특정한 문제를 식별했습니다.

  1. "범위를 벗어난" 문제: 훈련 과정에서 AI는 특정 길이(예: 8,000단어)까지만의 이야기를 봅니다. 이때 느린 시계들은 이야기가 끝나기 전까지 한 바퀴를 다 돌지도 못합니다. 그런데 AI가 훨씬 더 긴 이야기(예: 256,000단어)를 읽으려고 하면, 이 느린 시계들은 AI가 한 번도 본 적 없는 영역으로 돌아가 버립니다. 이는 마치 자신의 동네만 커버하는 지도를 가지고 도시 전체를 항해하려는 것과 같습니다. 범위를 벗어나면 길을 잃게 됩니다. 이로 인해 AI는 터무니없고 잘못된 추측을 하게 됩니다.
  2. "기억의 희미함" 문제: 논문은 또한 이 느린 시계들이 멀리 떨어진 단어들의 '의미'를 기억하는 데 도움을 주어야 한다는 점을 발견했습니다. 하지만 이야기가 길어질수록 이 느린 시계들의 신호는 약해지고 흐릿해집니다. AI는 두 단어가 멀리 떨어져 있다는 이유만으로 서로 연관되어 있다는 사실을 잊기 시작합니다.

오랫동안 연구자들은 이 두 문제를 별개로 해결하려고 노력했습니다. 어떤 이들은 새로운 영역을 커버할 수 있도록 지도를 "늘리려"(내비게이션 문제 해결) 했고, 다른 이들은 시계의 속도를 높여 메모리 신호를 강화하려 했습니다(메모리 문제 해결).

해결책: CoPE (부드러운 조광기 스위치)

이 논문의 저자들은 CoPE를 통해 두 문제 모두 동일한 근원에서 비롯되었다는 것을 깨달았습니다. 즉, 느린 시계들이 이야기가 너무 길어질 때 제대로 작동하지 않는다는 것입니다.

지도를 늘리거나 시계의 속도를 높이는 대신, 저자들은 단순하고 우아한 해결책인 **소프트 클리핑(Soft Clipping)**을 제안했습니다.

느린 시계들을 더 긴 이야기를 들을수록 점점 더 커지는 잡음이 섞인 라디오 방송국이라고 상상해 보세요.

  • 기존 방식 (하드 클리핑): 일부 연구자들은 그냥 라디오 플러그를 뽑아버리려 했습니다(신호를 즉시 0으로 차단). 논문은 이것이 마치 문을 쾅 닫아버리는 것과 같아서, 음악의 나머지 부분을 망치는 큰 "쾅" 소리나 "울림"(스펙트럼 누설이라고 불림)을 만들어낸다고 설명합니다.
  • CoPE 방식 (소프트 클리핑): CoPE는 부드러운 조광기 스위치(dimmer switch) 역할을 합니다. 신호를 갑자기 끊는 대신, 문제가 되는 느린 시계들의 볼륨을 이야기가 길어짐에 따라 서서히 0으로 줄여 나갑니다.

이 단순한 동작은 세 가지 효과를 가져옵니다:

  1. AI가 "본 적 없는 영역"에서 길을 잃는 것을 막아줍니다(내비게이션 해결).
  2. 신호를 깨끗하게 정리하여 AI가 멀리 떨어진 단어들의 의미를 더 잘 기억할 수 있게 합니다(메모리 해결).
  3. 신호를 너무 거칠게 끊었을 때 발생하는 "울림" 소인을 방지합니다.

결과: "공짜 점심"

저자들은 64,000단어를 읽도록 훈련된 모델을 테스트한 후, 이 모델에게 최대 256,000단어 길이의 이야기를 읽게 했습니다.

  • 마법 같은 효과: 표준 RoPE를 자신들의 "소프트 클리핑" 버전인 CoPE로 교체하는 것만으로도, 이 모델의 성능은 초장문 작업에서 기존 모델보다 거의 두 배 가까이 향상되었습니다.
  • 부작용 없음: 결정적으로, 이것은 짧은 이야기를 읽거나 일반적인 질문에 답하는 모델의 능력을 해치지 않았습니다. 이는 "공짜 점심"이었습니다. 짧은 글에 대한 페널티 없이 긴 글에 대한 엄청난 개선을 이루어냈기 때문입니다.
  • 합성 데이터 vs 실제 데이터: 논문은 또한 많은 이전 테스트들이 모델 간의 실질적인 차이를 보여주지 못하는 너무 쉬운 가짜 이야기(합성 작업)를 사용했다는 점을 지적했습니다. CoPE는 긴 문서 요약, 방대한 텍스트에서의 질문 답변, 특정 사실 추출과 같은 실제 세계의 작업에서 그 가치를 입증했습니다.

요약

요약하자면, CoPE는 AI 모델이 텍스트 내에서 위치를 추적하는 방식에 적용된 아주 작고 미니멀한 수정 사항입니다. 매우 긴 텍스트에서 어려움을 겪는 시스템의 "혼란스러운" 부분들을 부드럽게 페이드 아웃(fade out) 시킴으로써, 모델이 모델의 구조를 변경하거나 처음부터 다시 훈련할 필요 없이 거대한 문서를 훨씬 더 높은 정확도로 읽고 이해할 수 있게 해줍니다. 이는 복잡하고 고장 난 신호를 깨끗하고 신뢰할 수 있는 신호로 바꾸어 놓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →