← 최신 논문
🤖 machine learning

Do Transformers Need Three Projections? Systematic Study of QKV Variants

이 논문은 트랜스포머에서 쿼리(query), 키(key), 밸류(value) 프로젝션을 공유하는 것—특히 Q-K=V 변형 방식—이 비전 및 언어 작업 전반에서 경쟁력 있는 성능을 유지하면서도 추론 메모리와 KV 캐시 요구 사항을 크게 줄여, 결과적으로 효율적인 온디바이스 배포를 가능하게 한다는 점을 체계적으로 입증한다.

원저자: Ali Kayyam, Anusha Madan Gopal, M Anthony Lewis

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ali Kayyam, Anusha Madan Gopal, M Anthony Lewis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

트랜스포머 모델(현대 AI의 두뇌)을 거대한 책을 바탕으로 질문에 답하는 매우 효율적인 사서라고 상상해 보세요. 이를 위해 사서는 모든 단어에 대해 세 가지 특정 도구를 사용합니다:

  1. 쿼리 (Query, Q): "내가 무엇을 찾고 있는가?"라고 묻는 질문 카드입니다.
  2. 키 (Key, K): 질문과 일치하는지 확인하기 위한 책의 등표지(라벨)입니다.
  3. 밸류 (Value, V): 매칭이 잘 되었을 때 읽게 될 실제 페이지 내용입니다.

전통적으로 사서는 이 세 단계를 위해 모든 단어마다 새롭고 고유한 도구를 만듭니다. 이것이 표준적인 "QKV" 설정입니다. 이는 매우 잘 작동하지만, 무겁습니다. 사서는 각 단어마다 세 개의 무거운 도구 상자를 들고 다녀야 하며, 이는 공간(메모리)을 많이 차지하고 속도를 늦춥니다.

이 논문은 단순하고 대담한 질문을 던집니다: "우리가 정말로 세 개의 별도 도구가 필요할까, 아니면 하나로 합칠 수 있을까?"

연구진은 사서의 도구 상자를 단순화하는 세 가지 방법을 테스트했습니다:

세 가지 실험

1. "같은 질문, 같은 라벨" 접근 방식 (Q = K - V)

  • 아이디어: 사서는 질문을 던지고 라벨을 확인하는 데 동일한 도구를 사용합니다. 여전히 페이지를 읽기 위한 별도의 도구는 가지고 있습니다.
  • 결과: 이것이 최고의 승자입니다. 알고 보니 "질문" 도구와 "라벨" 도구는 매우 유사해서, 성능 저하 없이 동일한 객체로 사용할 수 있다는 것이 밝혀졌습니다.
  • 이점: 사서는 이제 세 개가 아닌 두 개의 도구만 필요합니다. 이는 "라벨"과 "페이지"를 저장하는 데 필요한 메모리를 절반으로 줄여줍니다. 이는 지도를 들면서 동시에 목적지를 가리킬 수 있도록 왼손을 사용하는 법을 깨달아, 두 번째 지도를 들고 다닐 필요가 없어진 것과 같습니다.

2. "같은 질문, 같은 페이지" 접근 방식 (Q - K = V)

  • 아이디어: 사서는 라벨과 페이지 내용에 동일한 도구를 사용하지만, 질문을 위한 별도의 도구는 유지합니다.
  • 결과: 이 방법 역시 잘 작동하지만, 언어 작업 측면에서는 첫 번째 옵션보다 효율성이 약간 떨어집니다. 이는 문을 열고 금고를 여는 데 같은 열쇠를 사용하는 것과 비슷하며, 검색의 방향성을 유지하기 위해 "질문" 도구는 고유하게 유지해야 합니다.

3. "모든 것을 위한 하나의 도구" 접근 방식 (Q = K = V)

  • 아이디어: 사서가 질문을 하고, 라벨을 확인하고, 책 내용을 읽는 데 단 하나의 단일 도구만 사용하려고 시도합니다.
  • 결과: 언어 작업에는 재앙입니다. 이는 망치를 사용하여 질문을 하고, 라벨을 확인하고, 책을 읽으려고 하는 것과 같습니다. AI는 "내가 찾는 것"과 "내가 찾은 것"을 구분하는 능력을 잃어버려 혼란에 빠지며 성능이 크게 떨어집니다.

이것이 중요한 이유: "배낭" 문제

이 논문의 가장 흥적인 부분은 단순히 AI를 더 똑똑하게 만드는 것이 아니라, AI를 더 가볍게 만드는 것입니다.

AI가 텍_스트를 생성할 때(예: 이야기를 쓰거나 채팅에 답할 때), 지금까지 작성한 모든 내용을 기억해야 합니다. 이 메모리를 **KV 캐시(KV Cache)**라고 부릅니다.

  • 표준 AI: "라벨"과 "페이지"를 위한 별도의 칸이 있는 무거운 배낭을 메고 있습니다.
  • 새로운 AI (Q-K=V): "라벨"과 "페이지"가 하나의 칸으로 합쳐진 배낭을 메고 있습니다.

실제 세계의 영향:

  • 두 배의 메모리: 배낭이 더 가볍기 때문에, 메모리가 부족해지기 전에 두 배 더 많은 단어를 AI의 메모리에 담을 수 있습니다.
  • 저렴한 서버: 만약 당신이 AI를 사용하는 회사를 운영한다면, 동일한 수의 컴퓨터로 두 배 더 많은 고객에게 서비스를 제공할 수 있습니다. 논문은 이 방식이 기업들에게 매달 수천 달러를 절약해 줄 수 있다고 계산했습니다.
  • 휴대폰에서 실행: 이러한 효율성은 강력한 AI 모델을 데이터 센터의 거대한 슈퍼컴퓨터가 아닌, 당신의 휴대폰이나 작은 엣지 기기에서 직접 실행하는 것을 훨씬 더 현실적으로 만들어 줍니다.

"더블 딥(Double Dip)" 보너스

논문은 또한 이 새로운 "가벼운 배낭" 기술이 **헤드 공유(Head Sharing)**라고 불리는 기존의 다른 기술(Llama 2나 Mistral에서 사용됨)과 완벽하게 함께 작동한다는 것을 발견했습니다.

  • 헤드 공유는 사서의 수는 줄이되 그들이 더 열심히 일하게 만드는 것과 같습니다.
  • **프로젝션 공유(Projection Sharing, 이 논문의 아이디어)**는 각 사서의 도구 상자를 더 작게 만드는 것과 같습니다.

이 두 가지를 결합하면 엄청난 승리를 얻을 수 있습니다. 연구진은 이 두 방법을 결합함으로써 메모리 필요량을 **97%**까지 줄일 수 있음을 보여주었습니다. 이것이 바로 AI를 소형 기기에서 실행하기 위한 "성배(Holy Grail)"입니다.

요약

이 논문은 표준적인 AI 설계가 다소 과잉 설계(over-engineered)되어 있음을 증명합니다. "질문"과 "라벨" 도구를 하나로 합침으로써, 지능의 손실 거의 없이 메모리 비용을 절반으로 줄일 수 있습니다. 이는 AI를 더 빠르고, 저렴하며, 당신의 주머니 속 기기에서 실행할 수 있게 만드는 단순하지만 강력한 개선책입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →