← 최신 논문
🤖 machine learning

Attention Drift: What Autoregressive Speculative Decoding Models Learn

본 논문은 비정규화 잔차 경로로 인해 프롬프트에서 생성된 토큰으로 주의가 이동하는 자기회귀적 추측적 디코딩 모델의 주요 한계로 '주의 편향'을 규명하고, 포스트-노름과 퍼-히든-스테이트 RMSNorm 과 같은 구조적 수정을 제안하여 다양한 작업과 컨텍스트 길이에 걸쳐 수용 길이를 크게 향상시킨다.

원저자: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 느린 사서 (타겟 모델) 가 이야기를 쓰고 있다고 상상해 보세요. 시간을 절약하기 위해, 사서가 확인하기 전에 다음 몇 단어를 추측하는 빠르지만 경험이 적은 조수 (드래프터) 를 고용합니다. 조수가 맞히면 사서는 "잘했다"라고 말하고 넘어가며, 그 단어들을 생각내는 느린 작업을 건너뜁니다. 이를 Speculative Decoding (추측적 디코딩) 이라고 합니다.

하지만 이 논문은 이러한 조수들이 작동하는 방식에 있는 기이한 결함을 발견했는데, 저자들은 이를 "Attention Drift (주의력 표류)" 라고 부릅니다.

문제: 조수가 자기 집착에 빠지다

사서가 용에 대한 이야기를 하고 있다고 상상해 보세요. 조수는 다음 단어를 추측하기 위해 사서의 지시사항 (프롬프트) 에 주의를 기울여야 합니다.

하지만 조수가 "용", "날아갔고", "넘어", "그", "산"과 같은 긴 단어 사슬을 추측하려고 할 때 다음과 같은 일이 발생합니다:

  1. 시작: 처음에는 조수가 사서의 지시사항을 봅니다.
  2. 표류: 조수가 자신의 단어를 추측하기 시작하자마자 산만해집니다. 사서의 원래 지시사항을 보지 않고, 방금 쓴 단어들을 강렬하게 응시하기 시작합니다.
  3. 결과: 조수는 자신의 최근 출력물에 집착하게 됩니다. 이야기의 맥락을 잊어버립니다. 이야기 도입 방식을 변경하거나 (템플릿 교란) 이야기를 매우 길게 만들면, 조수는 완전히 혼란스러워져서 올바르게 추측하는 것을 멈춥니다.

이 논문은 이를 Attention Drift라고 부릅니다. 조수의 초점이 원본 자료에서 벗어나 자신의 최근 생각에 갇히게 됩니다.

왜 이런 일이 발생할까요? "볼륨 조절기" 비유

저자들은 수학을 파헤쳐서 이런 일이 발생하는지 알아냈습니다. 그들은 조수의 뇌 (내부 데이터 상태) 에 숨겨진 "볼륨 조절기" 문제를 발견했습니다.

  • 현재 설계 (Pre-norm): 조수가 단어를 말할 때마다 마이크가 더 커진다고 상상해 보세요.
    • 단어 1: 정상 볼륨.
    • 단어 2: 약간 더 큼.
    • 단어 10: 소리 지름.
    • 단어 20: 귀가 먹먹할 정도로 큼.

조수의 내부 "볼륨" (잠재 상태의 크기) 이 추측하는 단어마다 계속 커지기 때문에, 조수는 사서 위에 점점 더 많은 복잡성 층을 쌓는 것처럼 느껴지기 시작합니다. 단순한 추측자 역할을 그만두고 이전 추측들을 "정제"하려는 완전히 새롭고 깊은 모델처럼 행동하기 시작합니다. 이렇게 커지는 볼륨은 균형을 잃게 하고 원래 지시사항을 잊게 만듭니다.

해결책: "리셋 버튼" (Post-norm)

저자들은 간단한 해결책을 제안했습니다: Post-norm.

이는 조수가 단어를 추측할 때마다 "볼륨 리셋" 버튼을 추가하는 것과 같습니다.

  • 조수가 다음 단어를 추측하기 전에, 시스템이 내부 볼륨을 확인하고 표준 수준으로 정규화합니다.
  • 이로 인해 "볼륨"이 귀가 먹먹할 정도로 커지는 것을 방지합니다.
  • 이는 조수가 이전 추측들의 혼란스러운 쌓임이 아닌, 새롭고 독립적인 예측으로 각 추측을 하도록 강요합니다.

또한 조수가 추측을 시작하기 전에 사서로부터 들어오는 데이터에 대해 유사한 "리셋"을 추가하여 시작 신호가 너무 크거나 불균형하지 않도록 보장했습니다.

결과: 더 견고한 조수

이러한 "리셋 버튼" (Post-norm) 을 추가함으로써 조수는 자신의 업무에서 훨씬 더 나아졌습니다:

  • 산만함 감소: 원래 지시사항에서 벗어나는 표류가 멈췄습니다.
  • 더욱 견고함: 이야기 형식을 변경하더라도 (특정 태그 제거나 인사말 변경 등), 조수는 충돌하지 않았습니다. 이러한 변경 사항을 이전 버전보다 2 배 더 잘 처리했습니다.
  • 더 긴 이야기: 혼란스러워지지 않고 훨씬 더 긴 이야기를 처리할 수 있었습니다.
  • 더 빠른 학습: 조수가 더 안정적이었기 때문에 짧은 시퀀스로 학습할 수 있었고, 나중에 더 긴 시퀀스에서도 잘 작동했습니다.

핵심 요약

이 논문은 이러한 조수들이 실제 세계의 messy 한 상황에서 실패하는 이유가 단순히 "바보"이기 때문이 아니라, 작업하면서 내부 설계가 그들을 "시끄럽고" 자기 집착에 빠지게 만들기 때문이라고 주장합니다. 내부 볼륨을 일정하게 유지하기 위해 정규화 단계를 단순히 추가함으로써, 그들은 신뢰할 수 있고 일관적이며 큰 모델이 글을 쓰는 것을 돕는 데 훨씬 더 빨라집니다.

간단히 말해: 이 논문은 AI 드래프터들이 자신의 내부 "볼륨"이 계속 상승하기 때문에 자신의 작업에 산만해진다는 것을 발견했습니다. 간단한 구조적 수정으로 그 볼륨을 낮추면 업무 수행 능력이 훨씬 더 나아집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →