Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference
이 논문은 모델 가중치를 수정하지 않고도 다양한 모델 크기, 작업 및 모달리티에 걸쳐 확장 가능한 정확도-효율성 트레이드오프를 달로하며, 행렬 곱의 정보가 풍부한 슬라이스를 선택적으로 유지함으로써 트랜스포머 기반 모델의 계산 비용을 줄이는 학습이 필요 없는 입력 적응형 추론 방법인 Reduced Matrix Multiplication (RMM)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대적인 컴퓨터의 두뇌를 거대하고 초지능적인 사서라고 상상해 보세요. 이 사서는 단순히 책을 읽는 것에 그치지 않고, 책을 쓰고, 수학 문제를 풀며, 심지어 사진을 보고 이야기를 들려주기도 합니다. 이를 위해 사서는 '트랜스포머(Transformer)'라고 불리는 특별한 종류의 두뇌 구조를 사용합니다. 트랜스포머를 정보가 흐르는 조립 라인이 있는 거대한 공장이라고 생각해 보세요. 이 라인의 모든 정거장에서 공장은 거대한 계산을 수행합니다. 바로 거대한 숫자 격자들을 서로 곱하는 것인데, 이것이 마법을 일으키는 '행렬 곱셈(matrix multiplications)'입니다. 문제는 이 계산들이 믿기지 않을 정도로 무겁다는 점입니다. 마치 티스푼으로 모래 산을 옮기려는 것처럼 엄청난 에너지와 시간을 필요로 합니다. AI 모델이 더 똑똑해지고 커질수록 이 '산'은 더 높아지며, 이들을 실행하는 데 드는 비용과 시간은 늘어납니다. 과학자들은 오랫동안 궁금해했습니다. 사서가 매번 작업할 때마다 정말 그 모래 산에 있는 모든 모래알을 다 사용하는 걸까요, 아니면 사서가 눈치채지 못할 정도로 쓸데없는 모래가 아주 많이 섞여 있는 걸까요?
이 논문은 **축소 행렬 곱셈(Reduced Matrix Multiplication, RMM)**이라는 영리하고 새로운 기술을 소개합니다. 공장을 영구적으로 축소하거나 사서의 기억 일부를 삭제하는 대신(이는 문제를 일으킬 수 있습니다), RMM은 똑똑한 '실시간 필터'처럼 작동합니다. 사서가 거대한 계산을 하기 직전마다 RMM은 잠시 멈춰 서서 질문합니다. "지금 이 격자에서 실제로 핵심적인 역할을 하는 숫자는 무엇인가?" 그러고 나서 가장 중요한 숫자들, 예를 들어 상위 50%나 70%만을 골라내고 나머지는 그 순간 동안 무시합니다. 이는 요리사가 국물을 만들기 위해 냉장고에 있는 모든 채소를 다 다지는 대신, 국물 맛을 빠르게 본 뒤 지금 이 특정 풍미를 위해 필요한 당근과 양파만을 골라 사용하는 것과 같습니다. 가장 멋진 점은 사서가 이를 하기 위해 새로 훈련받거나 배울 필요가 없다는 것입니다. 이미 생성하고 있는 숫자들을 통해 자연스럽게 작동할 뿐입니다.
연구진은 이 아이디어를 10억 개의 파라미터를 가진 작은 모델부터 700억 개의 파라미터를 가진 거대 모델에 이르기까지 다양한 AI 모델에 대해 테스트했습니다. 그들은 이 모델들이 놀라울 정도로 유연하다는 것을 발견했습니다. 숫자의 일부만 남기고 계산량을 줄였음에도 불구하고, 모델들은 무너지지 않았습니다. 사실, 모델이 커질수록 모델은 정신줄을 놓지 않고도 더 많은 모래를 기꺼이 버릴 수 있는 것처럼 보였습니다. 예를 들어, 700억 개의 파라미터를 가진 거대 모델은 계산량을 50% 줄였음에도 불구하고 이전과 거의 비슷하게 질문에 답하고 이야기를 써 내려갈 수 있었습니다. 하지만 논문은 이 공장들이 어떻게 구축되어 있는지에 대한 재미있는 특징을 발견했습니다. '어텐션(attention)' 부분(모델이 어디에 집중할지 결정하는 부분)은 매우 느긋해서 작업량의 절반을 잃어도 쉽게 견뎌낼 수 있습니다. 그러나 'MLP' 부분(정보를 실제로 처리하고 변형하는 부분)은 훨씬 더 민감하여, 너무 많이 깎아내면 모델이 비틀거리기 시작합니다.
연구팀은 또한 이 기술이 텍스트 전용 모델뿐만 아니라 보고 말할 수 있는 모델에도 작동한다는 것을 보여주었습니다. 그들은 심지어 이러한 숫자들을 건너뛰는 것이 실제로 컴퓨터를 얼마나 더 빠르게 만드는지 증명하기 위해 특별한 소프트웨어 도구들을 만들었으며, 특히 이야기나 문장이 매우 길어질 때 효과적이었습니다. 이 논문은 이것이 AI를 더 저렴하고 빠르게 만드는 유망한 방법임을 시사하지만, 모두에게 적용되는 단 하나의 '완벽한' 설정은 없다는 점 또한 언급합니다. 모델의 특성과 무엇을 요청하느냐에 따라 얼마나 깎아낼지를 조정해야 합니다. 하지만 전반적으로 RMM은 이 디지털 거인들을 더 가볍게 실행할 수 있는, 별도의 훈련이 필요 없는 새로운 방법을 제공하며, 때로는 수학을 덜 하는 것이 오히려 더 명료하게 생각하는 데 도움이 될 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.