← 최신 논문
🤖 AI

When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

이 논문은 양자화된 Gated DeltaNet 모델의 청크 단위 선형 어텐션을 가속화하기 위해 구조적 마스킹과 병렬 잔차 보정을 결합한 절단된 노이만 전개를 사용하여, 정확도를 유지하면서도 최대 5배의 속도 향상과 20% 낮은 디코드 레이어 오버헤드를 달성하는 하드웨어 친화적인 곱셈 전용 행렬 역행렬 근사법을 제안한다.

원저자: Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 조각이 이전 조각에 의존하는 거대하고 복잡한 퍼즐을 풀려고 노력하고 있다고 상상해 보십시오. 인공지능의 세계, 특히 긴 대화나 이야기를 기억해야 하는 모델(이를 "롱 컨텍스트 모델"이라 부릅니다)에서는 **행렬 역행렬(matrix inversion)**이라는 특정 단계가 마치 교통 체증처럼 작용합니다.

현재 이 퍼즐을 한 조각씩 푸는 방식은 매우 느리고 비효율적이며, 특히 현대적인 스마트폰이나 기기에 탑재된 특수 칩(NPU)에서는 더욱 그렇습니다. 이는 마치 거대한 수영장을 커다란 양동이가 아닌 작은 컵 하나로 물을 나르며 채우려는 것과 같습니다.

이 논문은 이 퍼즐을 훨씬 더 빠르게 푸는 새로운 방법을 소개합니다. 다음은 이들의 해결책을 쉬운 비유를 통해 정리한 내용입니다.

1. 문제점: "전방 대입(Forward Substitution)" 교통 체증

표준적인 방법에서는 컴퓨터가 1번 조각의 답을 계산한 다음, 그 결과를 이용해 2번 조각을 찾고, 다시 3번 조각을 찾는 식으로 진행해야 합니다. 이를 "전방 대입"이라고 합니다.

  • 비유: 도장을 찍기 위해 줄을 서 있는 사람들을 상상해 보세요. 첫 번째 사람이 도장을 받아야 두 번째 사람이 받을 수 있고, 그 다음 사람도 첫 번째 사람이 끝날 때까지 기다려야 합니다. 줄이 느리게 움직이는 이유는 모두가 앞사람이 끝날 때까지 기다리고 있기 때문입니다.
  • 결과: 현대적인 하드웨어에서 이러한 "줄 서기" 방식은 매우 비효율적입니다. 강력한 엔진(행렬 연산 장치)들이 느린 순차적 단계가 끝나기를 기다리며 아무것도 하지 못한 채 놀게 됩니다.

2. 통찰: "적당히 괜찮은 것"이 사실은 완벽하다

저자들은 훌륭한 결과를 얻기 위해 반드시 퍼즐 전체를 완벽하게 풀 필요는 없다는 사실을 깨달았습니다.

  • 비유: 당신이 초상화를 그리고 있다고 상상해 보세요. 가장 중요한 세부 묘사는 얼굴 중심부(주 대각선)에 있습니다. 먼 구석의 세부 묘사(깊은 부대각선)는 너무 희미해서 거의 보이지 않습니다. 만약 당신이 중심부를 완벽하게 만드는 데 90%의 시간을 쓰고, 구석진 곳은 아주 빠르게 훑어본다면, 결과물은 인간의 눈에 똑같이 훌륭해 보이면서도 작업 속도는 10배 더 빨라질 것입니다.
  • 과학적 원리: 논문은 정답의 "에너지" 또는 중요도가 중심부에 집중되어 있음을 보여줍니다. 계산하기 어렵고 복잡한 먼 곳의 부분들은 최종 결과에 거의 기여하지 않습니다.

3. 해결책: "곱셈 전용" 지름길

저자들은 느린 "조각별" 방식 대신, 오직 행렬 곱셈(Matrix Multiplication)(한 번에 많은 계산을 수행하는 방식)에만 의존하는 새로운 알고리즘을 제안합니다.

그들은 세 단계의 트릭을 사용합니다.

  • 단계 A: 거친 스케치 (절단된 노이만 급수, Truncated Neumann Series)
    전체 무한 급수를 모두 계산하는 대신, 중간에 멈춥니다. 즉, 답의 처음 몇 개 "층"만을 계산합니다.

    • 비유: 1,000페이지짜리 책의 줄거리를 이해하기 위해 모든 페이지를 다 읽는 대신, 처음 10페이지만 읽는 것과 같습니다. 그러면 즉시 핵심 내용을 파악할 수 있습니다.
  • 단계 B: 안전망 (대각 마스킹, Diagonal Masking)
    중간에 멈추면 시스템을 다운시킬 수 있는 너무 크거나 이상한 숫자들(오버플로 오류 등)인 "노이즈"가 실수로 포함될 수 있습니다.

  • 비유: 지도를 스케치한다고 상상해 보세요. 주요 도로를 명확하게 그리지만, 빈 들판에 엉뚱하고 엉망인 선들을 실수로 그려 넣을 수 있습니다. 저자들은 이러한 엉뚱한 낙서 위에 "마스크"를 씌워 그 부분들을 지워버림으로써, 깨끗하고 중요한 도로들만 남깁니다. 이는 숫자가 너무 커져서 수학적 계산을 망가뜨리는 것을 방지합니다.

  • 단계 C: 빠른 수정 (병렬 잔차 보정, Parallel Residual Correction)
    중간에 멈췄기 때문에 스케치가 완벽하지는 않습니다. 약간의 오류가 남아 있을 수 있습니다. 이 오류들을 하나씩 수정하는 것은 느리기 때문에, 이들은 병렬 계산을 사용하여 한꺼번에 수정합니다.

  • 비례: 오타가 몇 개 있는 문서 초안을 가지고 있다고 상상해 보세요. 한 줄씩 읽으며 고치는 대신, "모두 바꾸기" 도구를 실행하여 순식간에 모든 오타를 동시에 수정하는 것과 같습니다.

4. 결과: 속도와 안정성

이 논문은 실제 AI 모델(Qwen3.5 제품군)에서 테스트를 진행했으며 다음과 같은 결과를 얻었습니다:

  • 속도: 새로운 방법은 핵심 계산 수준에서 5배 더 빠릅니다.
  • 효율성: 텍스트 생성(디코딩)에 소요되는 총 시간을 약 20% 단축합니다.
  • 정확도: 지름길을 사용했음에도 불구하고, AI의 답변은 느리고 완벽한 방식만큼 정확합니다. 이 방식은 공간을 절약하기 위해 숫자를 축소하는 방식(저정밀도/양자화)에서도 잘 작동하며, 이는 모바일 기기에서 AI를 실행하는 데 매우 중요합니다.

요약

이 논문은 AI에서 완벽함은 속도의 적이라고 주장합니다. 수학의 "주 대각선"만 완벽하면 된다는 점을 깨닫고, 나머지는 병렬로 수정할 수 있다는 점을 이용함으로써, 그들은 느린 순차적 병목 현상을 빠른 병렬 고속도로로 바꾸어 놓았습니다. 이를 통해 대규모 AI 모델이 지능을 잃지 않으면서도 우리 스마트폰과 엣지 기기 내부의 칩에서 훨씬 더 빠르게 실행될 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →