← 최신 논문
💬 NLP

PERK: Long-Context Reasoning as Test-Time Learning

이 논문은 중첩된 메타 학습 루프를 통한 테스트 시점의 그래디언트 업데이트를 활용하여 긴 컨텍스트를 저차원 어댑터로 인코딩함으로써, 다양한 모델 규모에 걸쳐 롱 컨텍스트 추론 작업에서 표준 미세 조정 및 특화된 모델들을 크게 능가하는 파라미터 효율적인 프레임워크인 PERK를 소개한다.

원저자: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

게시일 2026-09-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 방대한 양의 텍스트를 학습하며 읽고 쓰는 법을 배운 강력한 도구입니다. 이 모델들은 정보가 바로 눈앞에 있을 때 패턴을 찾고 질문에 답하는 데 탁-월합니다. 하지만 정보가 책 한 권 분량의 문서나 긴 녹취록처럼 거대한 텍스트의 벽 속에 파묻혀 있을 때, 이 모델들은 중대한 장애물에 직면합니다. 텍xt이 길어질수록 모델은 무관한 노이즈를 무시하고 문제를 해결하는 데 필요한 특정 사실을 찾는 데 어려움을 겪는 경우가 많습니다. 이러한 어려움은 많은 모델이 텍스트의 맨 앞이나 맨 끝에 과도하게 집중하고, 중간에 숨겨진 세부 사항은 놓치는 경향 때문에 더욱 심화됩니다. 연구자들은 모델을 처음부터 다시 학습시키는 과정이 종종 매우 비용이 많이 들고 시간이 오래 걸린다는 점을 고려하여, 모델이 이러한 "롱 컨텍스트(long-context)" 작업을 처리할 수 있도록 돕는 방법을 오랫동안 모색해 왔습니다.

ICLR 2026 컨퍼런스에서 발표된 새로운 연구에서, EPFL의 연구진은 PERK라고 불리는 솔루션을 제안했습니다. PERK는 'Parameter Efficient Reasoning over Knowledge(지식에 대한 매개변수 효율적 추론)'의 약자입니다. 모델에게 거대한 문서를 한꺼번에 읽도록 강요하는 대신, PERK는 읽는 행위를 질문이 던져지는 바로 그 순간에 일어나는 학습 과정으로 취급합니다. 두꺼운 교과서와 특정 질문을 받은 학생이 페이지를 빠르게 훑어보며 메모장에 간결한 노트를 작성하는 모습을 상상해 보십시오. 일단 그 노트가 작성되면, 학생은 교과서를 치워두고 오직 그 노트만을 사용하여 질문에 답할 수 있습니다. PERK도 이와 유사한 방식으로 작동합니다. 긴 문서가 제시될 때, 모델은 전체 텍스트를 활성 메모리에 유지하지 않습니다. 대신, 짧은 내부 학습 단계를 사용하여 텍스트의 가장 중요한 부분을 자신의 내부 설정에 대한 작고 효율적인 조정값으로 압축합니다. 이 조정값들은 특수한 메모리 모듈처럼 작동하여 긴 문서의 정수를 저장합니다. 이 "메모장"이 생성되면 원래의 텍스트는 폐기되며, 모델은 업데이트된 새로운 설정을 사용하여 해당 내용에 관한 질문에 답합니다.

연구진은 모델이 이러한 압축과 검색을 효과적으로 수행하도록 가르치는 훈련 방법을 개발했습니다. 그들은 두 단계의 학습을 포함하는 기술을 사용했습니다. 첫 번째 단계에서 모델은 텍스트의 한 덩어리를 자신의 메모리 설정으로 빠르게 인코딩하는 법을 배웁니다. 두 번째 단계에서 모델은 그 설정을 사용하여 질문에 정확하게 답하는 법을 배웁니다. 이 과정을 효율적으로 유지하고 컴퓨터의 메모리 부족을 방지하기 위해, 모델은 전체 파라미터의 아주 작은 부분, 구체적으로는 '로우 랭크 어댑터(low-rank adapter)'라고 알려진 가벼운 추가 구성 요소만을 업데이트합니다. 이를 통해 모델은 핵심 지식 기반을 변경하지 않고도 문맥으로부터 학습할 수 있습니다. 연구진은 이 접근 방식을 단일 특정 사실을 찾아내기, 여러 조각의 정보를 연결해야 하는 복잡한 질문에 답하기, 유사해 보이는 긴 기록 목록에서 데이터를 검색하기 등 다양한 도전적인 과제들에 대해 테스트했습니다.

결과는 PERK가 모델을 단순히 긴 텍스터에 대해 나중에 질문에 답하도록 훈련하는 표준 방식보다 크게 우수한 성능을 보였음을 보여주었습니다. Qwen-2.5 모델을 이용한 테스트에서, PERK는 이러한 표준 방식에 비해 정확도를 최대 20% 향상시켰습니다. 이 방법은 모델이 훈련 중에 보았던 것보다 훨씬 더 긴 텍스트를 처리하도록 요청받았을 때도 견고함을 입증하며, 64,000개 및 128,000개 토큰의 문맥까지 성공적으로 일반화되었습니다. 또한, PERK는 정보의 위치를 무시하는 독특한 능력을 보여주었습니다. 다른 모델들은 관련 사실이 텍스트의 시작이나 끝에서 중간으로 이동할 때 자주 실패하는 반면, PERK는 정보가 어디에 나타나든 관계없이 높은 정확도를 유지했습니다. 이는 모델이 고정된 위치에 의존하는 대신 유연한 메모리 구조로 텍스트를 인코딩함으로써 더 안정적으로 추론할 수 있음을 시사합니다. 이 접근 방식은 0.5억 개의 파라미터를 가진 매우 작은 모델부터 80억 개의 파라미터를 가진 큰 모델에 이르기까지 다양한 모델 크기에서 일관되게 작동했으며, 롱 컨텍스트를 위해 특별히 설계된 거대 전문 모델들과 대등하거나 그 이상의 성능을 보여주었습니다.

정확성을 넘어, 이 연구는 이 방법의 효율성을 강조했습니다. 모델이 텍스트를 작고 관리 가능한 덩어리로 처리하고 인코딩 후 원래의 텍스트를 폐기하기 때문에, 매우 긴 문서를 처리할 때 훨씬 적은 컴퓨터 메모리가 필요합니다. 표준 방식이 128,000 토큰에서 메모리 제한으로 인해 중단되었던 테스트에서, PERK는 훨씬 적은 시간과 메모리를 사용하여 계속해서 기능을 수행했습니다. 연구진은 롱 컨텍스트 추론을 모델이 실시간으로 자신의 메모리를 적응시키는 '테스트 타임 학습(test-time learning)' 과제로 재정의함으로써, 전통적인 훈련의 막대한 계산 비용 없이도 탁월한 성능을 달eric 수 있다는 결론을 내렸습니다. 이 접근 방식은 대규모 언어 모델이 현실 세계의 방대하고 복잡한 정보를 처리할 수 있도록 만드는 유망한 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →