← 최신 논문
💬 NLP

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

이 논문은 트랜스포머 모델이 다양한 KV 캐시 정책과 공동 적응할 수 있도록 허용함으로써 적절한 하드웨어에서도 희소 주의 집중(sparse attention)을 통해 효율적인 장문맥 추론을 가능하게 하는 트랜스포머 모델용 미세 조정 방법을 소개하며, 이는 종종 정확한 주의 집중(exact attention) 방식보다 우수한 성능을 보여준다.

원저자: Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대적인 인공지능 시스템은 인간과 유사한 텍스트를 생성하기 위해 대화의 이전 내용이나 긴 문서의 내용을 기억할 수 있게 해주는 단기 기억 메커니즘에 의존합니다. 이 기억은 시스템이 새로운 단어를 처리할 때마다 커지는 디지털 버퍼에 저장됩니다. 시스템이 긴 텍스트 구간에서 잘 작동하려면 이 메모리가 방대해야 하지만, 이를 보유하는 데 필요한 컴퓨터 하드웨어는 비용이 많이 들고 제한적입니다. 메모리 버퍼가 가득 차면, 시스템은 새로운 공간을 만들기 위해 어떤 오래된 정보를 버릴지 결정해야 합니다. 만약 잘못된 정보를 버린다면, 시스템은 추론하거나 질문에 정확하게 답하는 능력을 상실하게 됩니다. 이는 어려운 트레이드오프를 만들어냅니다. 메모리를 작게 유지하면 비용을 절감하고 표준 장비에서 시스템을 실행할 수 있지만, 똑똑하게 작동하는 데 필요한 문맥을 잃을 위험이 있습니다.

연구자들은 시스템이 무엇을 유지할지 선택적으로 배우도록 가르치는 과정인 '희소 주의(sparse attention)'를 통해 이 문제를 해결하려고 오랫동안 노력해 왔습니다. 그러나 한 새로운 연구는 지금까지 이러한 시스템들이 훈련되어 온 방식에 결정적인 결함이 있음을 밝혀냈습니다. 기존의 대부분의 방법은 AI를 완벽하고 무제한적인 메모리를 가진 상태로 훈련시킨 다음, 나중에 이를 제한된 메모리로 운영하도록 강요합니다. 연구진은 이 접근 방식이 실패한다는 것을 발견했는데, 그 이유는 AI가 실제로 직면하게 될 특정한 제약 조건 하에서 어떻게 기능해야 하는지를 전혀 배우지 못했기 때문입니다. 처음부터 의도적으로 잊는 법을 배우고 고정된 메모리 크리에 적응하도록 모델을 훈련함으로써, 연구팀은 시스템이 무제한 자원을 사용하여 훈련된 모델보다 훨씬 더 잘 수행할 수 있음을 입증했습니다. 심지어 단일 개의 중간 정도 성능을 가진 컴퓨터 칩 위에서도 말입니다.

Amazon Web Services와 암스테르담 대학교의 과학자들이 이끄는 연구팀은 이러한 거대 언어 모델들을 미세 조정(fine-tuning)하는 새로운 방법을 개발했습니다. 거대한 슈퍼컴퓨터를 사용하여 완벽한 메모리를 시뮬레이션하는 대신, 그들은 모델이 특정 메모리 관리 정책과 함께 공동 적응(co-adapt)하도록 가르쳤습니다. 무한한 선반이 있는 도서관에서 책을 정리하도록 훈련받은 후, 나중에 아주 작은 방의 단 하나의 선반에서 일하라는 명령을 받는 사서를 상상해 보십시오. 큰 도서관에서 훈련받은 사서는 작은 방에서 무엇을 남기고 무엇을 버려야 할지 우선순위를 정하는 데 어려움을 겪을 것입니다. 반면, 이 논문에서 제안된 방법은 사서를 작은 방에서 직접 훈련시켜, 그 특정 공간의 규칙에 따라 어떤 책을 남기고 어떤 책을 버릴지를 정확히 가르칩니다. 이를 통해 모델은 과잉된 공간을 갖는 습관을 버리려고 노력하는 대신, 자신의 한계와 그 리듬에 맞춰 움직이는 법을 배울 수 있습니다.

연구진은 40억 개의 파라미터를 가진 모델을 대상으로 이 접근 방식을 테스트했습니다. 이는 상당한 규모이지만 관리 가능한 수준입니다. 그들은 40기가바이트 메모리를 가진 단일 그래픽 카드로 실험을 진행했는데, 이는 이전 방식들이 요구했던 수십 개의 카드 클러스터에 비해 많은 조직이 감당할 수 있는 저렴한 설정입니다. 그들은 이 새로운 훈련 기술을 여러 개의 비싼 장치에 걸쳐 메모리 부하를 분산시키는 '시퀀스 병렬 처리(sequence parallelism)'라는 표준 기술과 비교했습니다. 결과에 따르면, 새로운 방식으로 훈련된 모델은 특히 시스템이 길고 장황한 텍스트가 아닌 구체적이고 간결한 답변을 생성해야 하는 작업에서 표준 모델보다 뛰어난 성능을 보이는 경우가 많았습니다. 복잡한 질문과 데이터 추출을 포함한 여러 테스트에서, 표준 방식은 출력이 너무 길고 무작위의 무의미한 숫자로 가득 찬 반 слово를 생성한 반면, 새로운 방식은 적절한 시점에 멈추고 정확한 단일 값을 제공하는 법을 배웠습니다.

이 성공의 핵심은 어떤 정보를 유지할지 결정하는 인기 있는 전략인 '헤비 히터 오라클(heavy-hitter oracle)'을 개선한 것이었습니다. 이 전략은 모델이 시간이 지남에 따라 어떤 정보에 가장 많은 주의를 기울이는지를 추적하는 방식으로 작동합니다. 연구진은 기존 버전의 이 전략이 느리고 비효율적이라는 것을 발견했습니다. 그들은 시스템이 전체 과정을 늦추지 않고도 이러한 중요도 점수를 계산할 수 있도록 밑단의 코드를 훨씬 빠르게 재작성했습니다. 이러한 최적화를 통해 시스템은 일반적으로 수반되는 막대한 계산 능력 없이도 실시간으로 무엇을 잊을지에 대한 스마트한 결정을 내릴 수 있었습니다. 연구팀은 또한 이러한 기술을 다른 이들도 사용할 수 있도록 새로운 오픈 소스 소프트웨어 라이브库를 공개하여, 막대한 하드웨어 비용 없이도 롱 컨텍스트(long-context) AI 시스템을 구축하려는 사람들의 진입 장벽을 낮추고자 했습니다.

이 연구는 모델을 어떻게 훈련시키느냐가 하드웨어 자체만큼 중요하다는 점을 강조합니다. 연구진이 모델에게 실제 사용 시 마주하게 될 것과 정확히 동일한 메모리 제약 조건 하에서 훈련하도록 강제했을 때, 모델은 그 제약 조건을 효과적으로 다루는 법을 배웠습니다. JSON 데이터를 포함한 특정 테스트에서 표준 방식은 데이터 포인트를 찾지 못해 완전히 실패한 반면, 새로운 방식은 약 절반의 확률로 이를 식별하는 데 성공했습니다. 이는 긴 문맥을 처리하는 능력이 단순히 더 많은 메모리를 갖는 문제가 아니라, 시스템에게 자신이 가진 메모리를 어떻게 관리할지를 가르치는 문제임을 시사합니다. 이 연구 결과는 많은 응용 분야에서 가장 효과적인 길은 더 큰 컴퓨터를 만드는 것이 아니라, 이미 보유한 자원을 더 효율적으로 사용하도록 소프트웨어를 가르치는 것임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →