Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
Jet-Long은 짧은 문맥 충실도와 긴 문맥 외삽 사이의 균형을 맞추기 위해 RoPE 리스케일링 인자를 동적으로 조정하는 튜닝이 필요 없는 제로샷 방법으로, 효율적인 바이포컬 어텐션 메커니즘을 통해 최소한의 추론 오버헤드로 긴 문맥 벤치마크에서 최첨단 성능을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 어떤 특정 길이(예를 들어 32,000 단어)까지의 이야기를 읽도록 훈련된 아주 똑똑한 로봇 뇌(거대 언어 모델)가 있다고 상상해 보세요. 그런데 당신이 이 로봇에게 그보다 4배나 더 긴 소설 한 권이나 거대한 코드 저장소를 읽게 하고 싶어 합니다. 만로 단순히 긴 텍스트를 건네주면 로봇은 혼란에 빠집니다. 이는 마치 책의 페이지 번호가 100에서 갑자기 1,000,000으로 점프하는 것을 보는 것과 같습니다. 로봇의 내부 나침반(RoPE라고 불리는 것)이 격렬하게 회전하며, 로봇은 환각을 일으키거나 이야기의 중간 부분을 잊어버리기 시작합니다.
한동안 과학자들은 로봇의 시야를 확장하기 위해 하나의 "마법의 숫자"를 선택하여 이를 해결하려고 노력했습니다. 하지만 이것은 승자 없는 게임이었습니다. 만약 끝까지 보기 위해 시야를 너무 많이 늘리면 로봇은 앞부분을 잊어버렸습니다. 만약 앞부분을 기억하기 위해 시야를 좁게 유지하면 끝까지 볼 수 없었습니다.
여기에 등장한 Jet-Long은 로봇의 눈에 동적 이중 초점 렌즈(dynamic bifocal lens) 역할을 하는 새로운 방법입니다.
이중 초점 안경의 기술
로봇에게 책 전체에 대해 하나의 확장된 시야를 강요하는 대신, Jet-Long은 두 개의 안경을 동시에 제공합니다:
- 근거리 렌즈: 텍스트의 첫 번째 덩어리(로컬 윈도우)를 위해, 로봇은 훈련받은 그대로의 모든 것을 봅니다. 확장이나 왜곡이 없습니다. 이를 통해 로봇은 최근의 과거에 대한 기억을 날카롭게 유지합니다.
- 원거리 렌즈: 나머지 텍스트(리모트 윈도우)를 위해, 로봇은 특별한 기술을 사용합니다. 단순히 시야를 늘리는 것이 아니라, 동적으로 페이지들을 그룹화합니다. 책이 길어짐에 따라, 로봇은 얼마나 많은 페이지를 하나의 "슈퍼 페이지"로 묶을지를 자동으로 조정합니다.
마법은 이 그룹화 계수가 고정되어 있지 않다는 점에 있습니다. 이는 현재 텍스트의 길이에 따라 실시간으로 변합니다. 텍스트가 짧으면 로봇은 모든 단어를 개별적으로 봅니다. 텍스트가 매우 길어지면, 로봇은 내부 나침반이 차분하게 유지되고 통제력을 잃지 않도록 적절히 단어들을 그룹화합니다. 즉, Jet-Long은 짧은 작업에서는 완벽한 정확도를 유지하면서도, 방대한 문서를 길을 잃지 않고 읽을 수 있게 해줍니다.
속도의 "공짜 점심"
보통 두 가지 다른 계산(가까이 보기와 멀리 보기)을 동시에 수행하면 로봇이 두 배로 느려질 것입니다. 하지만 저자들은 이 두 계산을 결합하는 영리한 방법을 찾아냈습니다. 그들은 두 렌즈의 수학적 계산을 한 번의 과정으로 처리하는 특별한 엔진("퓨즈드 커널", fused kernel)을 구축했습니다.
이는 마치 보통 채소를 썰고, 삶고, 볶는 세 가지 과정을 각각 별도의 냄비에서 수행해야 하는 요리사가, 세 단계를 한 번에 수행하면서도 맛을 전혀 잃지 않는 마법의 냄비를 가진 것과 같습니다.
- 결과: 로봇이 128,000 토큰의 방대한 컨텍스트를 읽을 때, Jet-Long은 H100 칩에서 표준 방식(FlashAttention-2)보다 시작 단계(프리필 단계)에서 1.39배 더 빠릅니다.
- 주의점: 로봇이 한 번에 한 단어씩 새로운 텍스트를 생성할 때는 표준 방식보다 약 4% 정도 느립니다. 이는 도서관 전체를 읽을 수 있게 되는 것에 비하면 아주 작은 대가입니다.
테스트 내용 (그리고 하지 않은 것)
팀은 세 가지 크기의 로봇 뇌(17억, 40억, 80억 파라미터)를 대상으로 테스트를 진행했으며, Jet-Long이 이전의 최고 방법들을 일관되게 이겼다는 것을 발견했습니다.
- 로봇이 텍스트의 건초더미 속에서 숨겨진 바늘을 찾을 수 있는지 확인하는 RULER 테스트에서, Jet-Long은 가장 작은 모델에서 기존 최고 경쟁자보다 4.79점 높게, 가장 큰 모델에서는 2.03점 높게 점수를 기록했습니다.
- 실제 검색 작업을 시뮬레이션하는 HELMET-RAG 테스트에서, Jet-Long은 전반적으로 최고의 정확도를 달 achievement 했습니다.
- 오래된 책을 읽는 PG-19 테스트에서, 다른 방법들이 텍ema가 길어짐에 따라 로봇의 혼란(퍼플렉서티)을 급증하게 만든 반면, Jet-Long은 혼란을 가장 낮은 수준으로 유지했습니다.
중요 참고 사항: 논문은 로봇을 작동시키기 위해 처음부터 다시 훈련시킬 필요가 없다는 아이디어를 명시적으로 배제합니다. Jet-Long은 "제로샷(zero-shot)" 모델에서 작동합니다. 즉, 이미 훈련된 로봇을 가져와서 이 렌즈를 그냥 끼워 넣기만 하면 됩니다. 그러나 논문은 Jet-Long이 "회전하는 나침반" 문제는 해결하지만, "어텐션 확산(attention diffusion, 로봇이 너무 많은 옵션에 압도되는 현상)"이라는 다른 문제는 해결하지 못한다고 언급했습니다. 이 문제는 렌즈를 추가하는 것이 아니라 로봇의 구조 자체를 완전히 바꾸어야 해결되는 문제입니다.
결론
Jet-Long은 로봇을 무한히 똑똑하게 만드는 마법 지팡이는 아니지만, 기존의 로봇들이 정신을 잃지 않고 최대 128,000 토큰 길이의 텍스트를 처리할 수 있게 해주는 매우 효율적이고 튜닝이 필요 없는 도구입니다. 이는 단기 기억을 완벽하게 유지하면서도 장기적인 시야를 동적으로 조정하며, 표준 방식만큼 빠르게 실행됩니다. 저자들은 실제 하드웨어(H100 GPU)에서 이를 측정했으며, 다양한 모델 크기와 서로 다른 유형의 어텐션이 섞인 하이브리드 로봇 뇌에서도 작동함을 확인했습니다. 이는 더 긴 글을 읽게 만들려는 모든 이들에게 검증된 강력한 업그레이드입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.