← 최신 논문
🤖 machine learning

LP-GEMM: Integrating Layout Propagation into GEMM Operations

이 논문은 BLAS API 의 제약으로 인한 불필요한 데이터 재패킹을 제거하기 위해 레이아웃 전파를 GEMM 연산에 통합한 LP-GEMM 을 제안하고, 이를 통해 순차적 GEMM 작업에서 OpenBLAS 대비 평균 2.25 배의 성능 향상을 달성함을 입증합니다.

원저자: César Guedes Carneiro, Lucas Alvarenga, Guido Araujo, Sandro Rigo

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: César Guedes Carneiro, Lucas Alvarenga, Guido Araujo, Sandro Rigo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏭 비유: 공장 컨베이어 벨트와 포장 상자

인공지능이 문제를 풀 때는 거대한 숫자 덩어리 (행렬) 를 계속 곱하고 더하는 작업을 반복합니다. 이를 **GEMM(행렬 곱셈)**이라고 부릅니다.

지금까지의 기존 방식 (OpenBLAS 같은 표준 라이브러리) 은 다음과 같은 비효율적인 공정을 거쳤습니다.

  1. 작업 A (첫 번째 곱셈): 숫자 덩어리를 공장에 가져옵니다.
  2. 포장 (Packing): 공장의 기계가 숫자를 잘 처리할 수 있도록 상자에 하나하나 정렬해서 담습니다.
  3. 작업 실행: 기계가 상자를 비우고 계산을 합니다.
  4. 해체 (Unpacking): 계산이 끝나면 다시 원래의 큰 상자에 다시 정리해서 꺼냅니다.
  5. 작업 B (두 번째 곱셈): 이제 다음 작업이 시작됩니다. 하지만 다음 기계는 다시 상자를 뜯어서 (해체) 다시 새 상자에 포장해야 합니다.

문제점:
계산이 끝날 때마다 '상자 포장'과 '상자 뜯기' 작업을 반복합니다. 계산 자체는 빠르지만, **상자를 다루는 시간 (데이터 이동)**이 너무 길어져서 전체 속도가 느려집니다. 마치 택배를 보낼 때마다 박스를 뜯고 다시 싸는 것과 같습니다.


✨ LP-GEMM 의 해결책: "포장 상태 유지하기"

이 논문에서 제안한 LP-GEMM은 이 비효율을 없애는 혁신적인 아이디어입니다.

핵심 아이디어:
"다음 작업이 바로 이어진다면, 상자를 뜯지 말고 그대로 전달하자!"

  1. 시작 (Initial GEMM): 첫 번째 작업만 상자를 포장합니다. 하지만 계산이 끝난 후, 결과를 포장된 상태 그대로 다음 기계로 넘겨줍니다.
  2. 중간 (Intermediate GEMM): 다음 기계는 뜯어진 상자를 볼 필요가 없습니다. 이미 포장된 채로 들어온 숫자를 바로 계산합니다. 계산이 끝나면 다시 포장된 상태로 다음 기계로 넘깁니다.
  3. 마무리 (Ending GEMM): 모든 계산이 다 끝난 마지막 단계에서만, 최종 결과를 사용자가 볼 수 있도록 원래의 큰 상자에 정리해서 (해체) 꺼냅니다.

효과:
중간 과정에서의 '포장'과 '해체' 작업이 완전히 사라집니다. 데이터가 공장을 통과할 때 상자를 뜯고 싸는 수고를 아끼니, 계산 속도가 비약적으로 빨라집니다.


🚀 실제 성과: 얼마나 빨라졌나요?

연구진은 이 기술을 두 가지 다른 컴퓨터 칩 (인텔 x86 과 RISC-V) 에서 테스트했습니다.

  • 인텔 칩: 기존 방식보다 평균 2.25 배 빨라졌습니다.
  • RISC-V 칩: 기존 방식보다 최대 5 배까지 빨라졌습니다. (RISC-V 는 포장/해체 비용이 더 커서 효과가 극대화되었습니다.)

특히 최근 화두인 LLaMA(대형 언어 모델) 같은 AI 모델을 실제로 돌려봤을 때도, 이 기술을 적용하면 AI 가 답변을 생성하는 속도가 눈에 띄게 빨라졌습니다.


💡 왜 이 기술이 중요한가요?

기존의 컴퓨터 과학자들은 "각 기계 (함수) 를 어떻게 더 빠르게 만들까?"에만 집중했습니다. 하지만 LP-GEMM 은 **"기계와 기계 사이를 어떻게 연결할까?"**에 집중했습니다.

  • 기존: 각 작업이 독립적으로 완벽하게 작동하는지 확인 (하지만 연결 부분에서 비효율 발생).
  • LP-GEMM: 작업들이 이어지는 흐름 (Layout Propagation) 을 고려하여, 불필요한 이동을 없앰.

이는 마치 레고 블록을 쌓을 때, 한 번 쌓은 구조를 무너뜨리지 않고 바로 다음 블록을 올리는 것과 같습니다. 결과적으로 AI 가 더 빠르고 효율적으로 생각할 수 있게 도와주는 기술입니다.

요약

LP-GEMM은 AI 계산 과정에서 불필요한 '데이터 포장과 해체' 작업을 없애고, 계산된 데이터를 그대로 다음 단계로 전달하게 하여, 전체 속도를 최대 5 배까지 끌어올린 혁신적인 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →