← 최신 논문
💬 NLP

ART: Attention Run-time Termination for Efficient Large Language Model Decoding

이 논문은 누적된 어텐션 출력이 미미해질 때 KV 캐시 접근을 종료함으로써 정확도를 저하시키지 않으면서도 대규모 언어 모델의 디코딩 처리량을 20% 향상시키는 경량 런타임 메커니즘인 ART를 소개한다.

원저자: Chen Qiu, Guozhong Li, Panos Kalnis

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chen Qiu, Guozhong Li, Panos Kalnis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 당신에게는 지금까지 모은 모든 단서가 담긴 거대한 참조 카드 상자(KV 캐시)가 있습니다. 거대 언어 모델(LLM)에서, AI가 다음 단어를 쓰고 싶을 때마다 매번 이 카드들을 찾아 가장 관련 있는 것을 찾아내야 합니다.

문제는 대화가 길어질수록 이 카드의 상자가 거대해진다는 점입니다. AI는 물리적으로 선반까지 걸어가서, 카드를 집어 들고, 읽고, 다시 제자리에 놓아야 합니다. 만약 상자가 너무 크다면, AI는 생각하는 시간보다 걷는 데 더 많은 시간을 쓰게 되어 속도가 느려집니다.

기존 방식: 누가 중요한지 추측하기

이전에는 이를 빠르게 만들기 위해 각 카드의 "제목"(Key)을 살펴보는 방법을 연구자들이 시도했습니다. 그들은 "오, 이 제목은 중요해 보이니 전체 내용을 읽어야겠다. 저 제목은 지루해 보이니 건너뛰어야지"라고 추측했습니다.

하지만 이 논문은 이러한 논리의 결함을 지적합니다: 제목이 항상 전체 이야기를 다 말해주지는 않습니다. 때로는 지루한 제목을 가진 카드 안에 매우 중요한 메시지(Value)가 들어있을 수 있습니다. 제목만 보고 이를 건너뛰면, AI는 결정적인 단서를 놓칠 수 있습니다.

새로운 솔루션: ART (Attention Run-time Termination)

저자들은 ART라는 새로운 방법을 제안합니다. ART는 어떤 카드를 읽을지 미리 추측하는 대신, AI가 카드를 하나씩 읽기 시작하고 충분한 정보를 얻는 즉시 멈추도록 합니다.

작동 방식은 다음과 같은 간단한 비유를 통해 이해할 수 있습니다.

"맛보기 테스트" 비유
당신이 국을 요리하면서 맛이 어떻게 변하는지 확인하기 위해 재료를 하나씩 넣고 있다고 상상해 보세요.

  1. 기존 방식: 레시피에 "재료 10개를 정확히 넣으시오"라고 적혀 있습니다. 재료 3개만 넣어도 국 맛이 완벽해졌더라도, 레시씨에 적혀 있기 때문에 나머지 재료를 계속 넣어야 합니다.
  2. ART 방식: 당신은 매 재료를 넣을 때마다 국 맛을 봅니다.
    • 처음 몇 가지(가장 중요한 것들)를 넣습니다.
    • 맛을 봅니다.
    • 다음 재료를 넣습니다. 다시 맛을 봅니다.
    • 마법의 순간: 만약 재료를 하나 넣었는데 맛이 전혀 변하지 않거나(혹은 알아차릴 수 없을 정도로 아주 조금만 변한다면), 당신은 멈춥니다. 남은 5개의 재료가 국 맛을 더 좋게 만들지 않을 것이기 때문에, 당신은 나머지 재료를 넣는 수고를 하지 않습니다.

기술적으로 ART가 작동하는 방식

컴퓨터 세계에서 "국"은 Attention Output(AI가 계산하는 최종 결과물)입니다.

  • 모니터링: AI는 데이터 블록을 처리하면서 결과의 "맛"을 지속적으로 확인합니다.
  • 두 가지 체크: AI는 두 가지를 확인합니다.
    1. 크기: 결과가 눈에 띄게 커지거나 작아졌는가?
    2. 방향: 의미가 완전히 다른 방향으로 바뀌었는가?
  • "인내심" 규칙: 가끔 맛은 우연히 아주 미세하게 흔들릴 수 있습니다. ART에는 "인내심" 설정이 있습니다. 이는 맛이 몇 단계 연속으로 안정되는지 지켜보는 것입니다. 만약 맛이 일정하게 유지된다면, ART는 "좋아, 끝났어"라고 판단하고 나머지 카드들을 가져오는 것을 멈춥니다.

이것이 왜 중요한가

  1. 스마트함: "제목"(Keys)만 보던 기존 방식과 달리, ART는 실제 "메시지"(Values)를 봅니다. 정보가 정말로 완료되었는지 알 수 있습니다.
  2. 안전함: 카드를 영구적으로 삭제하지 않습니다. 단지 "지금 당장은 이 특정 배치의 나머지를 읽을 필요가 없다"라고 결정할 뿐입니다.
  3. 범용성: ART는 다른 속도 향상 기술들과 함께 사용할 수 있습니다. 마치 터보 엔진이 달린 자동차에 "조기 정지" 버튼을 추가하는 것과 같습니다.
  4. 결과: 논문은 긴 대화를 대상으로 테스트를 진행했으며 다음과 같은 결과를 얻었습니다:
    • AI가 이전과 거의 동일한 정확도로 답을 찾아냅니다 (품질 저하가 거의 없음).
    • 많은 요청을 동시에 처리할 때 텍스트 생성 속도가 20% 더 빠릅니다. 이는 답을 바꾸는 데 도움이 되지 않는 카드를 읽느라 시간을 낭비하는 것을 멈췄기 때문입니다.

요요약

ART는 책의 첫 몇 장만 읽어도 결말을 알 수 있다는 것을 깨달은 똑똑한 사서와 같습니다. 당신에게 마지막 50페이지를 억지로 읽으라고 강요하는 대신, 사서는 "이제 충분해요, 여기서 멈춰도 됩니다"라고 말하며, 이야기의 핵심을 놓치지 않으면서도 시간과 에너지를 아껴줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →