← 최신 논문
🤖 machine learning

Low-Rank Ternary Adaptation for Fine-Tuning Transformers

본 논문은 이산적인 가중치 업데이트를 작은 삼진 행렬을 통해 표현함으로써 삼진 도메인을 보존하고 역양자화 없이 직접적인 병합을 허용하는 동시에 언어 및 시각 모델 전반에서 성능을 크게 회복시키는 새로운 저계수 방법인 "삼진 곱셈 적응(ternary multiplicative adaptation)"을 제안한다.

원저자: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

게시일 2026-08-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능은 트랜스포머라고 불리는 거대한 컴퓨터 프로그램에 의존하고 있으며, 이들은 글쓰기 보조 도구부터 이미지 생성기에 이르기까지 모든 것의 엔진이 되었습니다. 이 프로그램들은 매우 강력하지만, 실행하는 데 방대한 양의 컴퓨터 메모리와 에너지를 필요로 하는 무거운 프로그램이기도 합니다. 이를 스마트폰이나 노트북 같은 더 작은 기기에서 사용할 수 있도록 만들기 위해, 연구자들은 수년간 이들을 축소하는 작업을 해왔습니다. 한 가지 인기 있는 전략은 프로그램 내부의 숫자들을 압축하여, 복잡하고 정밀도가 높은 값에서 더 단순하고 낮은 비트 버전으로 변환하는 것입니다. 고해상도 사진을 몇 가지 색상으로 줄이는 것을 상상해 보십시오. 이미지는 더 작아지고 처리 속도는 빨라지지만, 필연적으로 일부 디테일은 손실됩니다. 이 압축의 가장 공격적인 형태는 프로그램의 내부 숫자를 -1, 0, +1이라는 단 세 가지 값으로 제한하는 것을 포함합니다. '테너리 양자화(ternary quantization)'라고 알려진 이 방식은 메모리 필요량을 10분의 1로 줄여주며, 한때 대형 서버를 필요로 했던 모델을 표준 노트북에서도 실행할 수 있는 수준으로 바꿀 잠재력을 가지고 있습니다.

하지만 이러한 초소형 모델의 발전을 가로막는 중대한 문제가 있었습니다. 이 모델들은 작고 효율적이지만, 새로운 과업을 배우기가 어렵다는 점입니다. 이 프로그램들을 가르치는 표준적인 방법들은 숫자들에 미세하고 연속적인 조정을 가하는 방식입니다. 그러나 모델이 단 세 가지 값으로 제한되면, 모델은 미세한 조정을 할 수 없습니다. 대신 숫자의 부호를 바꾸거나 완전히 꺼버릴 수 있을 뿐입니다. 이러한 압축 모델을 가르치기 위한 기존 기술들은 숫자를 다시 원래의 크고 무거운 상태로 일시적으로 확장하여 변화를 준 다음, 다시 압축하는 과정을 거쳐야 합니다. 이 확장과 재압축의 과정은 오류를 유발하여 모델의 성능을 저하시키며, 종록히는 아무런 학습도 하지 않았을 때보다 결과가 더 나빠지게 만들기도 합니다.

델프트 공과대학교와 아마존의 연구팀은 이러한 확장과 오류의 순환을 피하는 새로운 학습 방법을 개발했습니다. 모델에 작은 연속적인 숫자를 더하려고 시도하는 대신, 그들의 방법은 엄격한 세 가지 값 체계 내에서 직접 작동합니다. 그들은 모델의 내부 숫자의 부호를 바꾸거나 완전히 끌 수 있는 스위치 세트처럼 작동하는 시스템을 설계했으며, 이 과정에서 압축 상태를 결코 벗어나지 않습니다. 이를 효율적으로 만들기 위해, 그들은 모든 숫자를 개별적으로 조정하려고 하지 않았습니다. 대신, 소수의 단순한 패턴이 모델의 방대한 구역을 동시에 제어할 수 있게 하는 수학적 구조를 사용했습니다. '저차원 테너리 적응(low-rank ternary adaptation)'이라고 부르는 이 접근 방식은 모델이 압축된 상태를 완벽하게 유지하면서 새로운 기술을 배울 수 있게 해줍니다.

연구진은 추론이 가능한 언어 모델과 이미지를 인식하는 시각 모델을 포함하여 여러 유형의 인공지능을 대상으로 이 방법을 테스트했습니다. 그들은 이미 세 가지 값의 한계로 압축된 모델들로부터 시작하여 새로운 학습 기술을 적용했습니다. 결과는 모델이 초기 압축 과정에서 잃었던 정확도의 상당 부분을 회복했음을 보여주었습니다. 언어 과업에 대한 테스트에서, 적응된 모델들은 확장과 재압축을 통해 학습을 강제하려 했던 이전의 시도들보다 훨씬 더 나은 성능을 보였습니다. 예를 들어, 30억 개의 파라미터를 가진 언어 모델의 경우, 이 새로운 방법은 9가지 서로 다른 과업에 걸친 평균 정확도를 약 32%에서 38%로 향상시켰으며, 모델의 예측을 훨씬 더 확신 있게 만들었습니다.

아마도 가장 중요한 점은, 이 과정의 최종 결과물이 초소형 형태를 유지하는 하나의 통합된 모델이라는 것입니다. 작은 모델과 함께 로드되어야 하는 별도의 무거운 지침 세트를 남겨두는 다른 방법들과 달리, 이 새로운 방식은 학습 내용을 작은 가중치 안에 직접 병합합니다. 연구진은 사물을 식별하는 것과 같은 시각적 과업에 대해, 그들의 방법이 학습 후 재압축하여 만들어진 모델보다 훨씬 더 정확한 모델을 생성한다는 것을 발견했습니다. 또한 그들은 학습 과정이 0이 된 숫자를 다시 살려내는 것이 아니라, 기존 숫자의 부호를 재배치함으로써 이루어진다는 것을 발견했습니다. 이는 모델이 존재하지 않는 연결을 새로 만드는 것이 아니라, 이미 가지고 있는 것을 재구성함으로써 학습한다는 것을 의미합니다.

이 연구는 고도로 압축된 인공지능 모델을 효율성과 정확도를 희생하지 않고도 가르칠 수 있다는 것을 입증합니다. 세 가지 값의 엄격한 제한을 존중하고 그 경계 안에서 학습하는 방법을 찾아냄으로써, 연구진은 이러한 작은 모델들이 많은 과업에서 더 큰 모델만큼 유능할 수 있음을 보여주었습니다. 이 방법은 사용 중에 추가적인 메모리나 컴퓨팅 파워를 요구하지 않는데, 이는 학습이 모델의 구조 안에 완전히 통합되어 있기 때문입니다. 이는 자원이 매우 제한적인 기기에서도 정교한 인공지능을 실행할 수 있는 길을 열어주며, 이전에는 배포가 불가능했던 곳까지 강력한 기능을 가져다줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →