LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment
LARA는 동결된 모델의 잔차 스트림(residual stream)에 저차원 보정(low-rank corrections)을 직접 주입하여, 파라미터 매칭 성능과 스케일링 인자를 통한 매끄러운 추론 시 제어, 그리고 단일 장치 내 다수의 서로 다른 동작 호스팅을 가능하게 하는 경량 적응 방법입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 거의 모든 인터넷 내용을 읽은 초지능 로봇이 있다고 상상해 보세요. 이 로봇은 천재적이지만, 동시에 조금 고집스럽기도 합니다. 한 번 배운 것은 쉽게 바꿀 수 없으며, 새로운 기술을 가르치려면 뇌를 망가뜨리거나 자신 전체의 새로운 버전을 저장하기 위한 엄청난 양의 메모리가 필요합니다. 이것이 바로 **거대 언어 모델(LLM)**의 세계입니다. 과학자들은 이 로봇이 파이썬 코드를 작성하거나 의학적 조언을 주는 것과 같은 특정 작업을 수행할 수 있도록 돕기 위해 '파인튜닝(fine-tuning)'이라는 기술을 사용합니다. 이것을 로봇에게 새로운 교과서를 주는 것이라고 생각하면 됩니다. 기존의 지배적인 방법인 LoRA는 로봇의 뇌를 해체하여 내부 지침서의 몇 페이지를 다시 쓰고 나서 다시 붙이는 것과 같습니다. 이 방법은 효과적이지만 무겁습니다. 만약 당신이 로봇에게 코더도 되고, 의사도 되고, 시인도 되길 원한다면, 세 가지 서로 다른 무거운 버전의 뇌를 계속 들고 다녀야 하는데, 이는 휴대폰 같은 작은 기기에서는 불가능한 일입니다.
여기 LARA(Lightweight Additive Residual Adaptation)가 있습니다. 로열 홀로웨이(Royal Holloway)와 웨스트 런던 대학교(University of West-London) 연구진이 제안한 새로운 아이디어입니다. LARA는 로봇의 내부 매뉴얼을 다시 쓰는 대신, 로봇의 생각 흐름 직전에 아주 작고 탈착 가능한 '메모'를 추가하는 방식으로 로봇의 뇌를 변하지 않는 고정된 토대로 취급합니다. 이 메모는 너무 작고 가벼워서, 하나의 로봇에 여러 가지 '성격'(코딩용, 수학용, 친절한 말투용 등)을 담은 전체 라이브러리를 동시에 담아둘 수 있습니다. 그러면 로봇은 단어 하나하나를 내뱉을 때마다 전체 뇌를 다시 불러올 필요 없이 즉각적으로 성격을 전환할 수 있습니다. 이 논문은 이 '메모하기' 방식이 무거운 '다시 쓰기' 방식만큼 잘 작동하면서도, 강력한 초능력을 가지고 있다고 제안합니다. 바로 새로운 행동의 볼륨을 높이거나 낮출 수 있으며, 아주 작은 공간 안에 많은 행동을 담을 수 있어, 당신의 기기에서 다재다능한 AI를 실행하는 것을 가능하게 한다는 점입니다.
문제점: 무거운 뇌
당신에게 거대한 천재 조각상이 있다고 상상해 보세요. 그 조각상은 완벽하지만 변할 수 없습니다. 만약 당신이 그 조각상이 프랑스어를 말하게 하고 싶다면, 단순히 속삭이는 것으로는 안 됩니다. 돌에 새로운 근육을 깎아내야 합니다. 대부분의 AI 적응 방식이 바로 이와 같습니다. 조각상을 깎으려고 시도하는 것이죠. 인기 있는 방식인 LoRA는 조각상의 근육 위에 얇은 점토 층을 덧씌우는 것과 같습니다. 효과적이긴 하지만, 만약 조각상이 프랑스어, 스페인어, 독일어를 말하게 하고 싶다면, 세 개의 서로 다른 조각상이 필요하거나, 계속 갈아 끼워야 하는 세 개의 서로 다른 점토 층이 필요합니다. 이는 느리고 많은 공간을 차지합니다.
해결책: 포스트잇
LARA를 개발한 연구자들은 다른 질문을 던졌습니다. "만약 우리가 조각상을 전혀 건드리지 않는다면 어떨까?" 그들은 깎거나 점토를 더하는 대신, 조각상이 무언가를 잡으려고 손을 뻗을 때마다 아주 작은 마법 포스트잇을 조각상의 손에 붙이기로 했습니다.
AI의 세계에서 이 '손'은 **잔차 스트림(residual stream)**이라고 불립니다. 이는 로봇의 생각을 실어 나르는 강물처럼 모델의 층을 통과하는 정보의 흐름입니다. LARA는 강바닥(고정된 가중치)을 바꾸지 않습니다. 그저 작고 낮은 순위(low-rank)의 스펀지를 강물에 살짝 담가, 약간의 '교정'을 짜낸 뒤 다시 물에 더할 뿐입니다.
- 스펀지: 이것은 약 239만 개의 학습 가능한 파라미터만을 가진 아주 작은 모듈입니다.
- 강물: 메인 모델(15억 개의 파라미터 모델)은 완전히 고정되어 손대지 않은 상태로 유지됩니다.
메인 모델은 절대 건드려지지 않기 때문에, '기본' 로봇은 항상 준비된 상태로 존재합니다. 스펀지는 그저 생각이 흘러갈 때 약간의 풍미를 더할 뿐입니다.
마법 같은 기술들
이 논문은 이 접근 방식에 대해 세 가지 멋진 사실을 발견했습니다.
1. 무거운 방식만큼 성능이 좋다
연구진은 코드 작성 작업과 '선호도(preference)' 작업(로봇이 더 도움이 되고 덜 무례하도록 가르치는 것)에 대해 LARA를 테스트했습니다. 그들은 동일한 수의 학습 가능한 파라미터를 사용하여 무거운 점토 방식(LoRA)과 비교했습니다. 결과는 어땠을까요? LARA는 LoRA와 대등했습니다. 원래의 뇌를 전혀 건드리지 않았음에도 불구하고, 코드를 작성하고 선호도를 따르는 능력이 LoRA만큼 뛰어났습니다. 마치 포스트잇이 매뉴얼을 다시 쓰는 것만큼 효과적이었던 것과 같습니다.
2. 볼륨 조절 노브
이 부분이 LARA가 정말 재미있어지는 지점입니다. '교정'은 그저 더해지는 메모이기 때문에, 로봇이 말하는 순간 ** (감마)**라고 불리는 다이얼을 돌릴 수 있습니다.
- 이면, 로봇은 메모를 무시하고 고정된 기본 모델과 똑같이 행동합니다.
- 이면, 메모를 온전히 사용합니다.
- 이면, 반반씩 섞어서 사용합니다.
논문은 이 노브를 조절함으로써 '지루한 기본 모델'과 '전문 코더' 사이를 부드럽게 오갈 수 있음을 보여줍니다. 일단 점토가 붙여진 LoRA 방식으로는 불가능한 일입니다. 그것은 영구적인 변화니까요. LARA를 사용하면, 볼륨을 조절하는 것만으로 "헤이 로봇, 코더 70%, 시인 30%로 행동해줘"라고 말할 수 있습니다.
3. 성격 라이브러리
이것이 핵심입니다. 기본 모델은 고정되어 있고 메모는 매우 작기 때문에, 동일한 15억 파라미터 모델에 일곱 가지의 서로 다른 행동을 동시에 살게 할 수 있습니다.
- 연구진은 여섯 가지의 미세 조정된 행동(코드, 일반 채팅, 수학, 의료, 두 번째 코드 세트, 요약)과 한 가지의 '선호도' 행동을 하나의 고정된 모델에 넣었습니다.
- 이 일곱 가지 행동의 총 추가 무게는? 단 33 MB였습니다.
- 만약 기존 방식을 사용했다면, 모델의 완전한 복사본 7개가 필요했을 것이며, 이는 21.6 GB를 차지했을 것입니다.
일곱 가지의 서로 다른 성격을 단 하나의 MP3 파일 크기에 담는다고 상상해 보세요. 모델은 '라우터(router)'라는 교통 경찰을 사용하여, 로봇이 말하려는 각 단어를 보고 어떤 성격을 빌려올지 결정합니다. 문장이 수학에 관한 것이라면 수학 메모를 가져옵니다. 코딩에 관한 것이라면 코드 메모를 가져옵니다. 문장이 모호하다면 두 가지를 혼합할 수도 있습니다.
한계 (그리고 미래)
이 논문은 이 방식이 아직 모든 것에 대한 만능 해결책은 아니라고 신중하게 밝히고 있습니다.
- '코드' 테스트: LARA가 LoRA만큼 잘 작동한다는 증거는 주로 코드 데이터셋을 통해 이루어졌습니다. 저자들은 이것이 다른 주제에도 적용될 가능성이 높다고 제가하지만, 아직 모든 가능한 주제에 대해 완전히 테스트하지는 않았습니다.
- '증폭'의 한계: 만약 볼륨 노브()를 너무 높게 설정하면(예를 들어 3으로 설정하면), 특히 여러 개의 메모가 쌓여 있을 때 로봇이 말을 더듬거나 실수를 하기 시작합니다. 단일 메모는 안정적이지만, 여섯 개의 메모를 쌓아두고 볼륨을 높이면 강물이 넘쳐버립니다.
- 라우터의 혼란: 두 가지 행동이 매우 유사할 때(예를 들어 두 가지 다른 코드 데이터셋), 교통 경찰이 가끔 혼란을 느껴 표를 나누게 됩니다. 하지만 논문에 따르면, 로봇이 혼란스러울 때도 두 메모 모두 코딩을 돕기 위한 것이기 때문에 여전히 좋은 성능을 냅니다.
이것이 왜 중요한가
이 논문은 우리가 새로운 기술을 위해 거대하고 별개의 뇌를 만들 필요가 없을지도 모른다는 점을 시사합니다. 대신, 우리는 하나의 단단하고 고정된 뇌와, 교체 가능한 작은 메모들이 가득 담긴 배낭을 가질 수 있습니다. 이는 메모리가 제한적인 휴대폰이나 노트북 같은 기기에서 AI를 실행하는 데 있어 매우 중요합니다. 이는 당신의 휴대폰이 거대한 앱을 다운로드하거나 대규모 업데이트를 기다릴 필요 없이, 수학 튜터에서 코딩 어시스턴트로, 다시 창의적 글쓰기 파트너로 즉각 전환할 수 있는 AI 모델 하나를 갖게 될 미래를 암시합니다. 연구진은 이를 '조합 가능한 적응(composable adaptation)'이라고 부르지만, 여러분은 그냥 로봇에게 '작고 마법 같은 포스트잇이 가득한 옷장'을 선물하는 것이라고 생각하면 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.