GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs
GLASS 은 순위 집계(rank aggregation) 를 통해 국소적 프롬프트별 활성화와 전역적 모델 고유 사전 지식을 통합함으로써 대규모 언어 모델의 추론 시 희소화를 개선하여 동적 FFN 가지치기를 안정화하고, 특히 짧은 프롬프트의 긴 형식 시나리오에서 생성 충실도와 디코딩 속도를 크게 향상시키는 학습이 불필요한 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 매우 똑똑한 도서관 (대규모 언어 모델, 또는 LLM) 을 상상해 보세요. 이 도서관은 이야기를 쓰고, 질문에 답하며, 문제를 해결할 수 있습니다. 하지만 이 도서관은 너무 방대하여 휴대폰이나 노트북에 들어가지 않습니다. 너무 무겁고, 너무 느리며, 실행하는 데 너무 많은 에너지를 필요로 합니다.
이것을 당신의 기기에서 작동하게 하려면, 이를 '가지치기 (prune)'해야 합니다. 즉, 생각할 때 내부의 뇌 세포 (뉴런) 의 50% 를 무시하도록 지시해야 합니다. 그렇게 하면 더 빠르게 실행되고 메모리를 덜 사용하게 됩니다.
문제: 짧은 프롬프트의 '추측 게임'
기존 방법들은 당신이 입력한 첫 번째 것 (프롬프트) 을 보고 어떤 뇌 세포를 유지할지 결정하려고 시도합니다. 그들은 말합니다. "좋아, 당신은 짧은 질문을 했으니, 이 특정 뉴런들을 활성화 상태로 유지하자."
이 논문은 이것이 문 밖으로 나가는 첫걸음만으로 전체 도로 여행을 계획하려는 것과 같다고 주장합니다.
- 짧은 프롬프트: 짧은 질문을 하면, 모델이 곧 생성할 긴 답변에 대해 어떤 뉴런이 실제로 중요한지 알기에 충분한 정보가 부족합니다.
- 긴 답변: 모델이 긴 이야기를 쓰기 시작하면 뉴런의 '중요도'가 변합니다. 짧은 질문에는 중요해 보였던 것들이 이야기의 나머지 부분에는 쓸모없을 수 있습니다.
- 결과: 모델은 혼란을 겪고 실수를 저지르며, 잘못된 뉴런을 유지하고 올바른 뉴런을 꺼버렸기 때문에 글의 질이 떨어집니다.
해결책: GLASS (전역 - 지역 집계)
저자들은 GLASS라는 새로운 방법을 제안합니다. GLASS 를 하나의 정보원이 아니라 두 가지 다른 정보원을 사용하여 결정을 내리는 똑똑한 관리자라고 생각하세요.
- 지역적 관점 ('지금' 신호): 이는 당신이 방금 입력한 것을 봅니다. "이 특정 질문에 기반하여, 지금 어떤 뉴런들이 점등되고 있는가?"라고 묻습니다. 이는 문맥에는 좋지만 짧은 질문에는 신뢰할 수 없습니다.
- 전역적 관점 ('고유' 신호): 이것이 이 논문의 큰 혁신입니다. 모델이 당신의 질문을 보기 전에, 연구자들은 빈 프롬프트 (단순히 빈 공간) 를 사용하여 모델이 스스로와 대화하도록 하는 특별한 테스트를 수행했습니다. 그들은 "이 모델이 어떤 뉴런을 항상 사용하는가?"라고 물었습니다. 이는 모델의 가장 중요하고 신뢰할 수 있는 뇌 세포에 대한 '요약 노트'를 생성합니다.
GLASS 의 작동 방식: '순위 매기기' 비유
GLASS 는 둘 중 하나만 선택하지 않습니다. **순위 집계 (Rank Aggregation)**라는 교묘한 투표 시스템을 사용합니다.
스포츠 경기 팀을 뽑는다고 상상해 보세요:
- 지역 코치는 말합니다. "선수 A 는 이 특정 경기에는 훌륭합니다."
- 전역 코치는 말합니다. "선수 A 는 전체 경력을 바탕으로 볼 때, 우리가 가진 최고의 선수입니다."
지역 코치만 듣는다면, 한 플레이에는 좋지만 전체 경기에는 나쁜 선수를 뽑을 수 있습니다. 전역 코치만 듣는다면, 특정 전략에는 맞지 않는 스타 선수를 뽑을 수 있습니다.
GLASS 는 둘을 결합합니다. '지역' 목록과 '전역' 목록을 가져와서 병합합니다. 만약 어떤 뉴런이 두 코치 모두에게 높은 순위를 받으면, 그 뉴런은 확실히 유지됩니다. 한 코치가 불확실할 때 (예를 들어 프롬프트가 짧을 때), 다른 코치의 의견이 상황을 구합니다.
'널 프롬프트 자극 (Null Prompt Stimulation, NPS)' 트릭
방대한 책이나 위키백과 기사 데이터셋 없이 그 '전역' 요약 노트를 얻기 위해, 저자들은 **널 프롬프트 자극 (Null Prompt Stimulation)**이라는 트릭을 사용했습니다.
- 모델에게 읽을 책을 공급하는 대신, 아무것도 없는 ('널') 프롬프트에서 텍스트를 생성하도록 했습니다.
- 이는 모델이 자신의 내부 회로에 전적으로 의존하도록 강요합니다. 악보 없이 음계를 연주하도록 음악가에게 요청하여 어떤 손가락을 자연스럽게 가장 많이 사용하는지 보는 것과 같습니다. 이는 모델의 가장 중요한 뉴런에 대한 순수하고 편향되지 않은 지도를 제공합니다.
결과: 더 빠르고 똑똑해짐
이 논문은 Llama, Gemma, Mistral 등 다양한 모델에서 GLASS 를 테스트했고 다음과 같은 결과를 발견했습니다.
- 더 나은 품질: 짧은 프롬프트로 긴 이야기를 쓰도록 요청받았을 때, GLASS 는 이전 방법들보다 훨씬 적은 실수를 범했습니다. 이는 가지치기되지 않은 완전한 모델의 품질에 훨씬 더 가까웠습니다.
- 더 빠른 속도: 삼성 갤럭시 S25 울트라 (고사양 스마트폰) 에서 GLASS 는 일부 경우 모델이 최대 11 배 더 빠르게 실행되도록 했습니다. 이는 모델이 휴대폰의 빠른 메모리에 완전히 들어갈 정도로 작아져서, 데이터를 끊임없이 주고받는 느린 과정을 피했기 때문에 발생했습니다.
한 줄 요약
GLASS 는 거대 AI 모델을 작은 기기에서 실행되게 하는 '플러그 앤 플레이' 도구입니다. 모델이 지금 하고 있는 것과 모델이 본질적으로 잘하는 것을 결합하여 짧은 질문에서 '잘못 추측하는' 문제를 해결함으로써, AI 가 제한된 자원으로 작업할 때에도 똑똑하고 빠르게 유지되도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.