← 최신 논문
🤖 machine learning

Stabilizing Native Low-Rank LLM Pretraining

이 논문은 가중치 업데이트 성장을 제어함으로써 저차원(low-rank) 가중치만으로 처음부터 학습된 모델이 밀집(dense) 모델의 성능을 따라잡을 수 있도록 하여, 엔드 투 엔드 네이티브 저차원 LLM 사전 학습을 안정화하는 스펙트럴 재정규화 기법인 Spectron을 소개한다.

원저자: Paul Janson, Edouard Oyallon, Eugene Belilovsky

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Paul Janson, Edouard Oyallon, Eugene Belilovsky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 거대한, 북적이는 도서관이라고 상상해 보세요. 그곳에서는 거대하고 보이지 않는 서기들이 가장 똑똑한 책들을 써 내려가고 있습니다. 이 서기들은 "거대 언어 모델(LLM)"이며, 매일 더 커지고 더 똑똑해지고 있습니다. 하지만 한 가지 문제가 있습니다. 이 책들을 쓰기 위해 서기들에게는 너무나 거대한 도서관이 필요한데, 이를 건설하는 데는 엄청난 비용이 들고 불을 밝히기 위해 산더com만 한 양의 전기가 필요합니다. 이 모델들 내부의 "가중치(weights)"는 서기들의 기억 저장소와 같습니다. 기억이 많을수록 더 많이 배울 수 있지만, 그만큼 더 무겁고 운반하기 비싸집니다.

한동안 과학자들은 이 모델들을 작게 만드는 유일한 방법은 일단 전체를 다 써놓은 다음 나중에 압축하는 것, 즉 이미 짐이 가득 찬 거대한 여행 가방을 나중에 줄이려고 애쓰는 것뿐이라고 생각했습니다. 다른 이들은 실제 여행에는 작은 부분만 사용하면서도, 여행 가방의 "전체 크기" 백업본을 따로 보관하는 방법을 시도하기도 했습니다. 하지만 처음부터 필수적이고 가벼운 물건들로만 여행 가방을 쌀 수는 없을까요? 이것이 바로 "저차원(low-rank)" 학습의 꿈입니다. 즉, 처음부터 자연스럽게 작고 효율적인 모델을 구축하는 것입니다. 문제는 과학자들이 이 가벼운 모델들을 처음부터 만들려고 했을 때, 모델들이 계속 무너졌다는 점입니다. 모델 내부의 수학적 계산이 요동치고 숫자들이 폭발하며, 마치 엔진이 너무 높게 회전하여 가스켓이 터져버리는 자동차 엔진처럼 훈련이 중단되었습니다. 큰 질문은 이것이었습니다. 우리는 이 가벼운 모델들을 폭발 없이 밑바닥부터 구축할 수 있을까? 그리고 이 모델들이 무겁고 비싼 모델들만큼 똑똑할 수 있을까?

이 논문은 "그렇다"라고 답하는 Spectron이라는 새로운 방법을 소개합니다. 저자들은 이 가벼운 모델들이 무너졌던 이유가 내부의 숫자들이 마개 없는 풍선처럼 통제 불능으로 커졌기 때문이라는 것을 발견했습니다. 그들은 모델 내부에서 일어나는 변화의 "크기"(이를 "스펙트럼 노름(spectral norm)"이라 부릅나다)가 너무 빠르고 크게 증가하고 있다는 것을 찾아냈습니다. 이를 해결하기 위해 그들은 안전 밸브를 발명했습니다. 여러분이 매우 빠르고 가벼운 보트를 조종하고 있다고 상상해 보세요. 만약 키를 너무 세게 돌리면 보트는 통제력을 잃고 회전해 버립니다. Spectron은 자동 조종 장치처럼 작동하여, 보트가 너무 급격하게 회전하려고 할 때마다 키를 안전한 각도로 부드럽게 밀어줍니다. 이는 보트의 움직임의 "크기"를 지속적으로 확인하고, 보트가 멈추지는 않으면서도 안정성을 유지할 수 있을 만큼만 적절히 크기를 조절함으로써 이루어집니다.

연구진은 약 9,400만 개의 파라미터를 가진 작은 모델부터 4억 5,400만 개의 파라미터를 가진 더 큰 모델에 이르기까지 다양한 크기의 모델을 대상으로 테스트를 진행했습니다. 그들은 Spectron을 사용하면 "무거운" 백업 가중치 없이도 이러한 가벼운 모델들을 처음부터 훈련할 수 있다는 것을 발견했습니다. 이 모델들은 안정적이었을 뿐만 아니라, 무겁고 거대한 모델들만큼 잘 학습했습니다. 실제로 Spectron으로 훈련된 4억 5,400만 파라미터 모델을 7억 8,000만 파라미터의 무거운 모델과 비교했을 때, 가벼운 모델이 훨씬 적은 자원을 사용하여 동일한 수준의 지능을 달urch할 수 있음을 발견했습니다. 이는 마치 무거운 트럭만큼 빠르게 달리면서도 연료는 절반만 사용하는 스포츠카를 만드는 법을 찾아낸 것과 같습니다.

또한 이 논문은 최상의 결과를 얻기 위해 이 모델들을 어떻게 구축해야 하는지도 살펴보았습니다. 연구진은 모델의 크기와 읽어야 할 데이터 사이의 완벽한 균형을 찾기 위해 시뮬레이션을 실행했습니다. 그들은 이 가벼운 모델들의 경우, 최적의 지점(sweet spot)이 무거운 모델들과는 약간 다르다는 것을 발견했습니다. 즉, 약간 더 작은 모델이 데이터를 조금 더 많이 읽는 것이 더 낫다는 것입니다. 이는 미래에 우리가 슈퍼컴퓨터가 아닌 일반 컴퓨터에도 쉽게 설치할 수 있고, 운영 비용도 훨씬 저렴한 매우 똑똑한 AI 시스템을 구축할 수 있음을 시사합니다. 저자들은 다양한 크기와 작업에 걸쳐 이 방법이 안정적으로 작동함을 보여주는 실험 결과를 바탕으로 자신감을 표하며, 이는 차세대 효율적인 AI를 구축하기 위한 안정적인 레시피를 제공한다고 밝혔습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →