← 최신 논문
🤖 machine learning

The Query Knows What to Forget: A Second Erase Direction for Linear Attention

이 논문은 상태 간섭을 해결하고 훈련 윈도우를 넘어 사용 가능한 컨텍스트 길이를 크게 확장하기 위해 쿼리에 직교하는 두 번째 삭제 벡터를 추가하는 선형 어텐션의 새로운 메커니즘인 QED(Query-derived Erase Direction)를 소개한다.

원저자: Dhruman Gupta, Aritra Das, Debayan Gupta

게시일 2026-08-17
📖 6 분 읽기🧠 심층 분석

원저자: Dhruman Gupta, Aritra Das, Debayan Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 오래전에 들었던 이야기를 기억해내려고 노력하고 있다고 상상해 보세요. 당신의 뇌는 이러한 기억을 담아두기에 한정된 공간을 가지고 있습니다. 만약 그 작은 공간에 너무 많은 이야기를 억지로 집어넣으려 한다면, 세부 사항들이 서로 뒤섞여 흐릿해지기 시작할 것이고, 한 이야기의 결말과 다른 이야기의 시작을 혼동하게 될 수도 있습니다. 이것은 현대의 AI 모델이 긴 대화를 처리하는 방식과 다소 비슷합니다. 그들은 지금까지 말한 모든 내용을 기억하기 위해 '선형 어텐션(linear attention)'이라는 특별한 종류의 메모리를 사용하여 공간이 부족해지는 상황을 방지합니다. 모든 단어를 거대하고 계속 커지는 더미로 저장하는 대신, 그들은 정보를 고정된 크기의 '상태(state)'로 압축하는데, 이는 마치 새로운 단어가 도착할 때마다 스스로 업데이트되는 마법의 메모장와 같습니다.

하지만 여기에는 함정이 있습니다. 대화가 길어짐에 따라, 이 메모장에 적힌 오래된 기억들이 서로 간섭하기 시작합니다. 만약 AI가 특정 정보(예를 들어 10,000단어 전에 언급된 이름)를 찾으려고 할 때, 다른 모든 단어들로부터 발생하는 노이즈 때문에 올바른 답을 찾아내기가 어려워집니다. 과학자들은 AI가 무엇을 삭제할지 더 똑똑하게 결정하도록 만들어 이 문제를 해결하기 위해 노력해 왔습니다. 그들은 새로운 정보를 위한 공간을 만들기 위해 오래되고 불필요한 정보를 '지울' 수 있는 시스템을 구축했지만, 지금까지 이 지우개들은 다소 서툴렀습니다. 이 지우개들은 AI가 실제로 무엇을 찾고 있는지에 기반하여 삭제하는 것이 아니라, 오직 현재 처리 중인 단어만을 기준으로 무엇을 삭제할지 결정했기 때문입니다.

이 논문은 이 서투름을 고치기 위한 영리한 기술인 QED(Query-derived Erase Direction, 쿼리 유도 삭제 방향)를 소개합니다. 3억 4천만 개의 파라미터를 가진 모델을 사용하여 연구를 진행한 연구진은, AI의 "검색 질문"(쿼리)이 삭제할 내용을 결정하는 데 도움을 주게 함으로써 모델이 중요한 정보를 훨씬 더 오래 유지할 수 있다는 것을 발견했습니다. 그들은 150억 개의 토큰으로 구성된 방대한 데이터셋으로 모델을 학습시켰으며, 이 새로운 방식이 AI로 하여금 이전보다 훨씬 더 먼 과거의 대화 내용까지 기억할 수 있게 한다는 것을 발견했습니다. 구체적으로, S-NIAH-1이라는 테스트에서 이 새로운 방식은 모델이 신뢰성 있게 읽어낼 수 있는 텍스트의 양을 약 8,000단어에서 16,000단어로 두 배 늘렸습니다. 이 논문은 이것이 AI가 긴 문서를 읽는 능력을 향상시키는 데 있어 중요한 진전임을 시사하지만, 저자들은 이 새로운 도구의 특정 부분들이 엄격히 필요한 것인지 확인하기 위해 더 많은 테스트가 필요할 수 있다고 언급했습니다.

문제점: "단방향" 지우개

이 돌파구를 이해하기 위해, 현재 이러한 AI 모델들이 어떻게 작동하는지 살펴보겠습니다. AI의 메모리가 책(정보)이 끊임없이 교체되는 바쁜 도서관이라고 상상해 보세요. 새로운 책이 도착할 때, 사서(모델)는 공간을 만들기 위해 어떤 오래된 책을 버릴지 결정해야 합니다.

이 논문 이전의 모델들(Gated DeltaNet-2와 같은)에서는, 사서가 무엇을 버릴지 결정하기 위해 오직 새로운 책(키/key)만을 봅니다. 이것은 마치 "이 새로운 책은 고양이에 관한 것이니, 나는 고양이에 관한 오래된 책을 버리겠다"라고 말하는 것과 같습니다. 이것은 어느 정도 작동하지만, 사각지대가 있습니다.

문제는 AI가 단순히 새로운 책만 보는 것이 아니라, 답변하고자 하는 특정한 질문(쿼리/query)도 가지고 있다는 점입니다. 예를 들어 질문이 "주인공은 누구인가?"라면, 사서는 그 특정 질문에 대한 답을 찾아야 합니다. 하지만 기존의 "단방향" 지우개는 질문이 무엇인지가 아니라, 새로운 책의 주제를 바탕으로 무엇을 삭제할지만 알 수 있습니다.

저자들은 "간섭(interference)"—즉, AI를 혼란스럽게 만드는 노이즈—이 정확히 질문이 찾고 있는 곳에 존재한다는 것을 깨달았습니다. 만약 질문은 특정 세부 사항을 찾고 있는데, 사서가 질문이 무엇인지가 아니라 새 책의 주제에 따라서만 삭제한다면, 혼란스러운 노이즈가 질문의 경로에 그대로 남아있을 수 있습니다. 이것은 마치 바늘의 색깔과 닮은 건더기를 제거하는 사서 밑에서 바늘을 찾는 것과 같습니다. 바늘이 실제로는 짚더미 아래에 숨겨져 있다는 사실을 무시한 채 말이죠.

해결책: "양방향" 지우개

이 논문은 QED라고 불리는 해결책을 제안합니다. 하나의 지우개 대신, 그들은 질문 자체에 의해 유도되는 두 번째 지우개를 추가했습니다.

이렇게 생각해보세요: 이제 AI는 "키 유도 지우개(Key-Directed Eraser)"(기존의 것)와 새로운 "쿼리 유도 지우개(Query-Directed Eraser)"를 갖게 됩니다.

  1. 키 유도 지우개는 여전히 자신의 일을 합니다. 즉, 새로운 정보를 보고 그것과 일치하는 오래된 것들을 치웁니다.
  2. 쿼리 유도 지우개는 AI가 현재 무엇을 묻고 있는지에 주목합니다. 만약 질문이 "악당은 누구인가?"라면, 이 지우개는 그 질문에 대한 답을 가리고 있을지도 모르는 오래되고 혼란스러운 정보를 구체적으로 겨냥하여 제거합니다.

결정적으로, 이 새로운 지우개는 기존의 것과 "직교(orthogonal)"하도록 설계되었습니다. 쉬운 말로, 이것은 기존의 지우개가 닿을 수 없는 부분의 메모리를 청소한다는 의미입니다. 이것은 마치 빗자루가 놓친 방 구석의 먼지를 빨아들일 수 있는 진공청소기를 갖는 것과 같습니다.

연구진은 150억 개의 텍스트 토큰으로 모델을 학습시켜 이를 테스트했습니다. 그들은 "질문"이 지우개를 안내하게 했을 때, 모델이 긴 텍스트에서 특정 사실을 찾는 능력이 훨씬 더 좋아졌다는 것을 발견했습니다.

발견한 것 (그리고 발견하지 못한 것)

결과는 매우 유망했지만, 저자들은 과장하지 않도록 주의를 기울였습니다. 데이터가 실제로 보여준 것은 다음과 같습니다:

  • 긴 문맥의 초능력: S-NIAH-1(모델이 건초더미 속에서 바늘을 찾을 수 있는지 확인하는 테스트)에서, 새로운 방식은 정확도를 크게 향상시켰습니다. 예를 들어, 16,000 토큰(단어) 길이에서 표준 모델은 약 21.8%의 정답률을 보였으나, 새로운 QED 모델은 39.8%를 기록했습니다. 32,000 토근에서는 그 차이가 더욱 극적이었는데, 9.4%에서 15.8%로 뛰어올랐습니다.
  • 사용 가능한 길이의 두 배 증가: 저자들은 이 개선이 실질적으로 사용 가능한 문맥 길이를 두 배로 늘린다고 명시했습니다. 이전에는 모델이 8,000 토큰 근처에서 혼란을 느끼기 시작했지만, QED를 사용하면 16,000 토큰까지 신뢰성을 유지했습니다.
  • 마법 같은 퍼플렉시티(Perplexity)는 없음: 흥s롭게도, 새로운 방식은 AI가 글을 쓰거나 문장의 다음 단어를 예측하는 능력(검증 손실/validation loss라고 불리는 지표)을 향상시키지는 않았습니다. 손실 값은 동일하게 유지되었습니다. 이는 QED가 일반적인 의미에서 AI를 더 "똑똑하게" 만드는 것이 아니라, 압축된 상태로부터 특정 기억을 **인출(retrieval)**하는 능력을 더 좋게 만든다는 것을 시사합니다.

"절제 실험(Ablation)"의 미스터리: 어떤 부분이 중요한가?

연구진은 QED가 정확히 작동하는지 알아내기 위해, 새로운 시스템의 서로 다른 부분들을 꺼보는 실험을 수행했습니다. 이것은 자동차 엔진을 분해하여 어떤 볼트가 실제로 차를 더 빠르게 달리게 하는지 확인하는 것과 같습니다.

그들은 세 가지 주요 구성 요소를 테스트했습니다:

  1. 방향(Direction): 지우개를 안내하기 위해 "질문"(쿼리)을 사용하는 것.
  2. 게이트(Gate): 언제 삭제할지를 결정하는 스위치 (AI가 여전히 필요로 하는 것을 삭제하지 않도록 하기 위함).
  3. 투영(Projection): 새로운 지우개가 실수로 기존 지우개의 작업을 망치지 않도록 하는 수학적 규칙.

여기서 반전이 있었습니다. 결과는 다소 엇갈렸습니다.

  • 방향이 핵심이다: 지우개를 안내하는 데 "질문"을 사용할 때마다 모델은 더 좋아졌습니다. 이 부분이 진정한 주인공인 것으로 보입니다.
  • 게이트와 투영은 불분명하다: 게이트나 투영을 껐을 때, 결과는 일관되지 않았습니다. 훈련 시 사용한 무작위 시드(시작점)에 따라 모델이 더 좋아지기도 하고 나빠지기도 했습니다. 저자들은 이러한 부분들이 도움이 될 수도 있지만, 실험 결과가 그것들이 엄격히 필수적이라는 것을 증명하지는 못했다고 제안했습니다. 사용된 특정 규모의 모델에서는 "투영"이 실제로 큰 역할을 하지 않았을 수도 있는데, 이는 모델이 원래 해결하도록 설계된 문제를 스스로 피했기 때문일 수 있습니다.

결론

이 논문은 QED가 AI 모델이 긴 대화 속에서 무언가를 기억하도록 돕는 성공적인 방법이라고 결론짓습니다. "질문"이 삭제를 결정하도록 도움으로써, 모델은 기억을 가로막는 노이즈를 제거할 수 있습니다.

그러나 저자들은 자신들의 연구 결과에 대한 한계를 솔직하게 밝혔습니다. 그들은 "게이트"나 "투영"이 필수적이라는 것을 증명하지 못했으며, 단지 "쿼리"를 사용하여 지우개를 안내하는 것이 가장 일관된 개선을 가져온다는 것을 증명했을 뿐입니다. 또한, 테스트 시 지우개의 "강도"를 조절하는 것이 모델마다 다른 결과를 냈기 때문에, 이 새로운 지우개의 강도를 조정하는 법에 대해서도 추가적인 튜닝이 필요할 수 있다고 언급했습니다.

요약하자면, 만약 당신이 AI가 소설 한 권을 읽고 마지막 장에서 악당의 이름을 기억하게 하고 싶다면, "쿼리 유도 지우개"를 주어야 한다는 것입니다. 하지만 그 새로운 기계의 다른 조절 나사들을 정확히 어떻게 조절해야 할지 알아내기 위해서는 여전히 더 많은 테스트가 필요할 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →