YaRN: Efficient Context Window Extension of Large Language Models
YaRN은 기존 방식보다 훨씬 적은 연산량과 학습 데이터로도 LLaMA와 같은 언어 모델의 문맥 창(context window)을 효율적으로 확장하고, 학습 범위를 넘어선 긴 문장에서도 뛰어난 성능을 발휘하게 하는 새로운 RoPE 확장 방법론입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
1. 문제 상황: "기억력의 한계" (도서관 사서의 책상 크기)
인공지능 모델은 공부할 때 책상 위에 책을 펼쳐놓고 봅니다. 그런데 이 **책상의 크기(문맥 창)**가 정해져 있어요. 책상이 작으면, 책의 앞부분을 읽다가 뒷부분으로 넘어가면 앞의 내용을 까먹어 버립니다.
기존에는 이 책상을 넓히려고 두 가지 방법을 썼습니다.
- 방법 A (단순 확장): 책상을 그냥 억지로 늘리는 거예요. 하지만 책상이 너무 넓어지면 사서가 정보 사이의 거리를 헷갈려 해서, 글자가 흐릿하게 보이는 것처럼 정보가 뭉개져 버립니다.
- 방법 B (새로 만들기): 처음부터 아주 큰 책상을 가진 사서를 새로 교육시키는 거예요. 하지만 이건 돈과 시간이 어마어마하게 많이 듭니다.
2. YaRN의 핵심 아이디어: "똑똑한 돋보기와 맞춤형 안경"
이 논문에서 제안하는 **YaRN(야른)**은 책상을 새로 만드는 대신, 기존 사서에게 **'특수 안경'**을 씌워주는 방식입니다. 이 안경은 두 가지 마법을 부립니다.
① "중요한 건 크게, 덜 중요한 건 작게" (NTK-by-parts)
우리가 아주 긴 글을 읽을 때, 모든 글자를 똑같은 크기로 보면 눈이 피로하죠?
- 가까운 단어들(고주파): 단어와 단어 사이의 미세한 관계는 아주 중요합니다. YaRN은 이 부분은 돋보기로 보듯 아주 세밀하게 유지합니다.
- 먼 단어들(저주파): 아주 멀리 떨어진 문맥은 굳이 세밀할 필요가 없습니다. 이 부분은 멀리 보는 안경처럼 부드럽게 압축해서 보여줍니다.
이렇게 '거리별로 맞춤형 초점'을 맞춰주니까, 정보가 뭉개지지 않고 멀리 있는 내용까지 선명하게 읽을 수 있게 됩니다.
② "집중력 조절 장치" (Attention Scaling)
책상이 넓어지면 사서가 너무 많은 정보에 압도당해 집중력이 흐트러질 수 있습니다. YaRN은 사서가 정보를 처리할 때 **'집중력 온도(Temperature)'**를 살짝 조절해 줍니다. 너무 많은 정보가 들어와도 당황하지 않고, 중요한 정보에 딱 집중할 수 있도록 '마음의 평정심'을 유지하게 도와주는 장치라고 보시면 됩니다.
3. 결과: "가성비 끝판왕"
이 기술을 적용했더니 놀라운 결과가 나왔습니다.
- 엄청난 효율성: 기존 방식보다 10배 적은 데이터만 공부시켜도 되고, 학습 시간도 2.5배나 단축되었습니다. (적은 돈으로 엄청난 효과를 낸 거죠!)
- 기억력 폭발: 원래 4,000단어만 기억하던 모델을 아주 살짝만 추가 교육시켰더니, 128,000단어(책 한 권 분량)까지 거뜬히 기억하고 이해하게 되었습니다.
- 실전 능력: 단순히 기억만 하는 게 아니라, 아주 긴 글 속에 숨겨진 특정 숫자(Passkey)를 찾아내는 능력도 매우 뛰어났습니다.
요약하자면!
YaRN은 인공지능에게 "무작정 더 큰 책상을 사줘!"라고 하는 대신, **"기존 책상을 쓰되, 가까운 건 세밀하게 보고 먼 건 큼직하게 보는 '스마트 안경'을 써!"**라고 알려주는 기술입니다. 덕분에 인공지능은 훨씬 적은 비용으로도 엄청나게 긴 글을 완벽하게 읽어낼 수 있게 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.