← 최신 논문
🤖 machine learning

SHUFFLESPARSE: Learned Shuffles for Structured Sparse Networks

이 논문은 다양한 희소성 패턴과 학습 패러다임 전반에 걸쳐 구조적 희소 네트워크와 비구조적 희소 네트워크 사이의 정확도 격차를 유의미하게 좁히는 동시에 추론 오버헤드를 최소한으로 유지하면서, 단일 치환 행렬을 학습하는 방법론인 SHUFFLESPARSE를 소개한다.

원저자: Abhishek Tyagi, Arjun Iyer, Liam Young, William H Renninger, Christopher Kanan, Yuhao Zhu

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abhishek Tyagi, Arjun Iyer, Liam Young, William H Renninger, Christopher Kanan, Yuhao Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 세상에서 가장 빠른 레이스 카를 만들려고 노력하고 있다고 상상해 보십시오. 당신에게는 복잡한 문제를 해결할 수 있는 강력한 엔진(심층 신경망)이 있지만, 이 엔진은 매우 무겁고 연료를 엄청나게 소모합니다. 더 빠르게 만들기 위해 엔지니어들은 종종 필수적이지 않은 부품을 제거하려고 노력하는데, 이를 "프루닝(pruning, 가지치기)"이라고 부릅니다. 만약 당신이 단순히 무작위로 볼트와 전선을 제거한다면, 남은 부품들이 공장 도구에 맞게 연결되지 않아 자동차가 제대로 달리지 못할 수도 있습니다. 하지만 만약 당신이 매우 구체적이고 조직적인 패턴(예를 들어, 격자 모양으로 매 줄마다 다른 볼트를 제거하는 방식)에 따라 부품을 제거한다면, 공장 기계들이 훨씬 더 빠르게 작동할 수 있습니다. 이것이 바로 "구조적 희소성(structured sparsity)"의 세계입니다. 즉, AI 모델이 깔끔하고 예측 가능한 패턴을 따르도록 강제함으로써 모델을 더 작고 빠르게 만드는 것입니다.

하지만 여기 함정이 있습니다. 너무 깔끔하게 만들다 보면 자동차가 둔해질 수 있다는 점입니다. 만약 당신이 엔진이 엄격한 격자를 따르도록 강제한다면, 특정 코너를 돌 때 꼭 필요한 부품을 실수로 잘라버려 자동차가 까다로운 코너를 핸들링하지 못하게 될 수도 있습니다. 이것이 연구자들이 직면한 문제입니다. 구조적 패턴은 빠르지만, "비구조적(unstructured)" 방식(부품을 어디든 자유롭게 제거할 수 있는 방식)에 비해 정확도를 잃기 쉽습니다. 큰 질문은 이것입니다. 우리는 정교한 격자의 속도를 유지하면서도 어떤 회전도 처리할 수 있는 유연성을 유지할 수 있을까요? 이 논문은 바로 그 퍼즐을 깊이 파고듭니다. 우리가 AI가 자신의 내부 연결을 아주 조금만 재배치하도록 가르쳐서, 그 엄격한 패턴이 완벽하게 작동하게 만들 수 있는지 탐구합니다.

이 연구를 수행한 로체스터 대학교의 연구팀은 SHUFFLESPARSE라는 영리한 새로운 기술을 선보였습니다. 신경망 레이어를 수많은 사람들(데이터)이 전문가 그룹(가중치)과 대화하려고 하는 거대한 방이라고 생각해 보십시오. 표준적인 "구조적" 설정에서는 전문가들이 마치 퍼레이드 중인 군인들처럼 엄격한 행과 열로 배치되어 있습니다. 이는 관리자가 명령을 빠르게 전달하기에는 용이하지만(빠른 연산), 방 안의 사람들이 엉뚱한 행에 서 있는 전문가와 대화해야 할 때는 문제가 됩니다.

보통의 해결책은 전문가들이 원하는 곳 어디든 서 있게 하는 것(비구조적)이지만, 그러면 관리자가 혼란을 느껴 속도가 느려집니다. SHUFFLESPARSE는 그 중간 지점을 제시합니다. 대화가 시작되기 전, 단 한 번의 마법 같은 "셔플(shuffle, 섞기)" 단계를 추가합니다. 음악이 시작되기 전, 모두가 특정 학습된 패턴에 따라 자리를 바꾸라고 지시받는 댄스 플로어를 상상해 보십시오. 이 셔플은 설계된 대로, 사람들이 마침내 앉아서 엄격하게 배치된 전문가들과 대화할 때, 전문가들은 움직이지 않았음에도 불구하고 실제로 '올바른' 사람들과 대화할 수 있도록 만들어졌습니다.

연구진은 AI에게 이 특정 "셔플"(치환 행렬)을 엄격한 패턴과 함께 학습시키면, 격자 형태 때문에 잃었던 정확도를 거의 모두 회복할 수 있다는 것을 발견했습니다. 이는 마치 군인들의 대형을 바꿀 필요 없이, 신병들이 다른 순서로 그들 앞에 줄을 서기만 하면 된다는 것을 깨달은 것과 같습니다.

연구팀은 이 아이디어를 두 가지 매우 다른 시나리오에서 테스트했습니다. 첫째, 이미지 인식 작업(고양이와 강아지 식별 등)과 언어 작업에 대해 처음부터 모델을 훈련했습니다(동적 희소 훈련). 그들은 SHUFFLESPARSE가 엄격하고 빠른 모델과 유연하지만 느린 모델 사이의 간극을 일관되게 좁힌다는 것을 발견했습니다. 예를 들어, ViT-B/16이라는 유명한 이미지 모델의 경우, 이 셔플을 추가함으로써 매우 높은 희소도 수준(90~95%)에서 정확도 격차를 거의 2%에서 1% 미만으로 줄였습니다. GPT-2와 같은 언어 모델에서도 마찬가지로, AI가 텍스트를 이해하는 능력(혼란도를 나타내는 척도인 '퍼플렉시티')을 크게 개선했습니다.

둘째, 이미 훈련된 거대한 언어 모델(LLaMA-2 및 Qwen과 같은)을 대상으로 실험했습니다. 이 모델들은 동결되어 있어 재학습이 불가능했습니다. 연구진은 가중치를 잘라내는 "원샷(one-shot)" 프루닝 방법을 사용한 후 SHUFFLESPARSE 셔플을 적용했습니다. 결과는 놀라웠습니다. LLaMA-2 7B 모델에서 이 방법은 기존의 최선인 비셔플(non-shuffled) 방식보다 제로샷(zero-shot) 정확도를 4.6포인트 향상시켰습니다. 이는 거대하고 이미 만들어진 모델이라 할지라도, 단순한 학습된 재배열이 재학습 없이도 숨겨진 잠재력을 끌어낼 수 있음을 시사합니다.

결정적으로, 저자들은 이것이 단순히 무작위로 섞는 것이 아님을 보여줍니다. 시스템을 학습된 셔플 대신 무작위의 고정된 셔플로 테스트했을 때, 성능은 오히려 떨어지거나 그대로였습니다. 마법은 AI가 작업에 가장 적합한 특정 셔플을 학습하는 데서 옵니다. 또한 논문은 이 셔플에 약간의 비용(모델 실행 시간을 약 3%에서 8.7% 정도 증가시킴)이 들지만, 구조적 패턴의 핵심적인 속도 이점을 유지하면서 정확도를 대폭 높일 수 있다는 점에서 이는 충분히 지불할 가치가 있는 작은 대가라고 언급합니다.

요약하자면, SHUFFLESPARSE는 우리가 속도와 지능 중 하나를 선택할 필요가 없다는 것을 시사합니다. 엄격하고 빠르게 처리되는 기어에 부딪히기 직전에 입력을 딱 알맞게 재배치하도록 AI를 가르침으로써, 우리는 케이크를 먹으면서 동시에 케이크를 자르는 것(두 마리 토코끼를 잡는 것)이 가능해집니다. 즉, 믿을 수 없을 정도로 빠르면서도 놀라울 정도로 정확한 모델을 가질 수 있습니다. 저자들은 이 학습된 치환(permutation)이 다양한 유형의 엄격한 패턴과 다양한 종류의 AI 작업에 걸쳐 작동하는 일반적인 도구이며, 효율적이고 고성능인 AI를 만드는 유망한 길을 제시한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →