Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models
본 논문은 전문가 선택과 확률 재정규화를 분리함으로써, 축소된 활성 전문가 집단이 아닌 더 큰 참조 전문가 집단을 기준으로 정규화하여 성능을 유지하면서, 추론 시 미세 조정된 전문가 혼합(Mixture-of-Experts) 모델의 계산 비용을 절반으로 줄이는 학습이 필요 없는 방법을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
텍스트를 생성하는 현대의 인공지능 시스템은 종-종 자신이 보유한 전체 지식의 양과 각 단어를 생성할 때 수행하는 사고의 양을 분리하는 설계 방식에 의존합니다. 수천 권의 전문 서적이 담긴 거대한 도서관을 상상해 보십시오. 하지만 시스템은 문장을 하나 쓸 때마다 적절한 정보를 찾기 위해 그중 단 몇 권의 책만을 펼칩니다. '혼합 전문가(Mixture-of-Experts)' 모델로 알려진 이 방식은 컴퓨터가 말을 할 때마다 속도가 느려지지 않도록 방대한 양의 데이터를 저장할 수 있게 해줍니다. 시스템은 매 순간 전체 도서관의 아주 작은 부분만을 참조하도록 결정하기 위해, 어떤 특정 책들을 펼칠지 결정하는 작은 내부 가이드를 사용합니다. 이는 독특한 상황을 만듭니다. 컴퓨터는 어떤 주제에도 대응할 수 있도록 선반 위에 모든 책을 보관해야 하지만, 한 번에 읽는 것은 단 몇 페이지뿐이라는 점입니다.
컴퓨터는 이 모든 전문화된 섹션들을 메모리에 유지해야 하므로, 연구자들은 시스템이 훨씬 더 적은 페이지를 읽도록 강제함으로써 시스템을 더 빠르게 만드는 방법을 오랫동안 모색해 왔습니다. 이 작업을 수행하는 표준적인 방법은 간단합니다. 문장당 더 적은 수의 책을 열라고 시스템에 지시하는 것입니다. 그러나 이 직관적인 접근 방식은 역사적으로 시스템을 혼란스럽게 만들고 더 많은 실수를 유발했습니다. 이러한 혼란은 시스템에 적절한 책이 부족해서 발생하는 것이 아니라, 선택되는 책의 수가 줄어들 때 그 책들이 갖는 가중치(weight)가 예상치 못하게 변하기 때문에 발생합니다. 싱 첸(Xing Chen)과 헝슈아이 야오(Hengshuai Yao)의 새로운 연구는 이 혼란이 시스템이 자동으로 수행하는 숨겨진 수학적 조정을 통해 발생한다는 것을 밝혀냈으며, 그들은 시스템을 다시 학습시키거나 새로운 구성 요소를 추가하지 않고도 그 조정을 끌 수 있는 방법을 찾아냈습니다.
연구진은 350억 개의 파라미터를 가진 모델과 4,000억 개에 달하는 모델, 두 가지 매우 큰 언어 모델에 집중했습니다. 이 모델들은 처리 과정의 각 층마다 수백 개의 작고 전문화된 섹션, 즉 '전문가(experts)'들로 설계되어 있습니다. 표준 작동 방식에서 시스템은 단어를 처리할 때마다 8개의 전문가를 선택합니다. 연구진이 시스템의 속도를 높이기 위해 이 숫자를 절반으로 줄여 4개의 전문가만 사용하도록 강제했을 때, 성능은 크게 떨어졌습니다. 일반 지식에 대한 표준 테스트에서 정확도는 거의 5점 가까이 하락했습니다. 이 손실이 너무 심각했기에 많은 이들은 전문가의 수를 줄이는 것이 단순히 너무 비용이 많이 드는 일이라고 가정해 왔습니다. 연구진은 문제가 전문가 자체가 사라진 것이 아니라, 남은 전문가들의 중요도를 재조정하는 방식에 있다고 의심했습니다.
표준 설정에서는 시스템이 상위 전문가들을 선택할 때, 그들의 영향력이 항상 정해진 총합과 일치하도록 조정합니다. 이는 시스템을 안정적으로 유지하기 위한 안전 장치입니다. 그러나 이러한 세밀한 모델의 경우, 상위 8개의 전문가는 보통 가능한 전체 중요도의 아주 작은 부분만을 차지합니다. 시스템이 4개의 전문가만 선택하도록 강제되면, 표준 조정 방식은 차이를 메우기 위해 그들의 영향력에 큰 계수를 곱합니다. 이 갑작스러운 증폭은 시스템을 학습된 적 없는 상태로 몰아넣어, 시스템이 과잉 반응하고 오류를 범하게 만듭니다. 연구진은 시스템이 실제로 정보를 놓치고 있는 것이 아니라, 단지 원래 그래야 하는 것보다 더 크게 소리 지르라는 명령을 받고 있다는 사실을 깨달았습니다.
이를 해결하기 위해 연구팀은 추가 학습이나 추가적인 컴퓨팅 파워가 필요 없는 간단한 변화를 도입했습니다. 그들은 어떤 전문가를 사용할지에 대한 결정과 그들의 가중치를 어떻게 정할지에 대한 결정을 분리했습니다. 그들은 시스템이 작업을 수행할 위해 4개의 전문가만 선택하도록 허용하되, 중요도 가중치는 단 4개가 아닌 상위 16개의 전문가를 기준으로 계산하도록 했습니다. 이렇게 함으로써, 시스템은 활성화된 섹션의 수는 절반으로 줄었음에도 불구하고 평소 듣던 것과 동일한 양의 정보를 유지할 수 있었습니다. 이 작은 조정, 즉 단 하나의 정수 설정을 변경하는 것만으로 결과는 완전히 바뀌었습니다. 350억 파라미터 모델에서 이 새로운 설정을 사용하여 활성 전문가를 8개에서 4개로 줄였을 때, 정확도 하락은 0.35점에 불과했습니다. 이는 원래의 느린 시스템과 통계적으로 구분이 불가능할 정도로 미미한 차이였습니다.
연구는 이 방법을 4,000억 개의 파라미터를 가진 훨씬 더 큰 모델에서도 테스트했으며, 결과는 마찬가지로 극적이었습니다. 표준 방식으로 활성 전문가를 절반으로 줄였을 때는 상당한 성능 저하가 발생했지만, 새로운 가중치 방식을 사용하자 손실이 0.55점으로 줄어들었습니다. 연구진은 이 새로운 가중치 설정이 최적의 설정은 작업의 종류에 따라 달라진다는 것을 발견했습니다. 예를 들어, 텍스트를 읽을 때 가장 좋게 들리는 설정이 논리 퍼즐이나 지식 테스트에서 반드시 최고의 성능을 내는 것은 아니었습니다. 이 발견은 압축된 모델이 텍스트를 얼마나 잘 읽는지만 측정하는 것으로는 다른 작업에서의 성능을 보장하기에 충분하지 않음을 시사합니다. 연구진은 이러한 모델에 필요한 컴퓨팅 파워를 안전하게 줄이기 위해서는, 단순히 텍스트 유창성에 의존하기보다 실제 성능 테스트를 통해 이 가중치 설정을 신중하게 튜닝해야 한다고 결 결론지었습니다.
또한 논문은 왜 단순히 추가적인 전문가들을 일시적으로 적게 사용하는 것을 넘어 영구적으로 제거하는 것이 어려운지를 탐구했습니다. 연구진은 이러한 모델들이 코드나 일반 글쓰기와 같이 서로 다른 유형의 콘텐츠를 다루는 매우 전문화된 구조임을 발견했습니다. 전문가들이 매우 전문화되어 있고 시스템이 매우 균형 잡혀 있기 때문에, 다양한 주제를 다루는 능력을 잃지 않고 전문가를 영구적으로 삭제할 여지는 거의 없습니다. 따라서 가장 효과적인 길은 모델의 일부를 버리는 것이 아니라, 전체 정보의 양을 일정하게 유지하면서 한 번에 사용하는 부분의 수를 줄이도록 지시하는 것입니다. 이 접근 방식은 규칙의 적용 방식이 바뀔 때 발생하는 숨겨진 보정 오류를 바로잡음으로써, 이러한 강력한 시스템의 지능을 희생하지 않고도 더 빠르고 효율적으로 만드는 방법을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.