Modular Pretraining Enables Access Control
이 논문은 일반적인 성능을 유지하면서 특정 능력을 선택적으로 비활성화하고 사후 언러닝(post-hoc unlearning)보다 복구에 더 잘 저항함으로써, 모듈 절제(module ablation)를 통해 이중 용도 AI에 대한 확장 가능한 접근 제어를 가능하게 하는 비용 효율적인 사전 학습 방법인 그래디언트 라우팅 보조 모듈(Gradient-Routed Auxiliary Modules, GRAM)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 초지능 로봇 요리사가 있다고 상상해 보세요. 이 요리사는 백신부터 위험한 생물 무기에 이르기까지 모든 것을 요리할 수 있는 놀라운 능력을 갖추고 있습니다. 이것은 "이중 용도(dual-use)"의 딜레마입니다. 질병을 치료하는 지식이 곧 역병을 만드는 데 쓰일 수도 있다는 점이죠. 만약 당신이 이 요리사를 병원에 준다면 치료제를 얻게 될 것이고, 악당에게 준다면 문제를 일으키게 될 것입니다.
보통 악당을 막는 유일한 방법은 요리사를 아예 해고하는 것인데, 그렇게 하면 병원은 치료제를 얻을 수 없게 됩니다. 혹은 다섯 명의 서로 다른 요리사를 고용하는 방법도 있습니다. 각자 한 가지 특정 분야만 알도록 훈련받은 요리사들 말이죠(한 명은 백신, 한 명은 사이버 보안, 한 명은 핵물리학 등). 하지만 다섯 명의 요리사를 각각 고용하고 훈련시키는 것은 엄청나게 비용이 많이 들고 느린 일입니다.
여기 GRAM(Gradient-Routed Auxiliary Modules)이 있습니다. GRAM을 단순히 다섯 명의 요리사를 고용하는 것이 아니라, 하나의 마스터 셰프와 마법 같은 모듈형 앞치마를 고용하는 것이라고 생각해 보세요.
마법의 앞치마
일반적인 AI에서 모든 지식은 거대한 수프처럼 뒤섞여 있습니다. 만약 "생물 무기" 레시피를 제거하고 싶다면, 전체 솥을 저어야 하는데 그 과정에서 실수로 "백신" 레시피까지 망가뜨릴 수 있습니다.
GRAM은 주방의 레이아웃을 바꿉니다. 요리사에게 기본적인 것들(양파를 썰거나 물을 끓이는 일 등)을 처리하는 메인 앞치마(즉, "코어")를 줍니다. 하지만 여기에 몇 개의 작은 탈부착형 주머니를 추가합니다.
- 하나는 바이러스학을 위한 주머니입니다.
- 하나는 사이버 보안을 위한 주머니입니다.
- 하나는 핵물리학을 위한 주머니입니다.
- 하나는 특수 코드를 위한 주머니입니다.
여기서 마법 같은 기술이 나옵니다. 요리사가 학습할 때, 주방은 현재 수업에 필요한 특정 주머니만을 개방합니다. 만약 수업 주제가 바이러스라면, "바이러스학 주머니"에 모든 관심이 집중되고 업데이트됩니다. "핵물리학 주머니"는 지퍼가 잠긴 채로 유지되며 그날의 수업에 대해 아무것도 배우지 않습니다.
결과: 하나의 요리사, 여러 개의 인격
지식이 이러한 별도의 주머니에 저장되기 때문에, 일을 시작하기 전에 주머니의 지퍼를 여닫는 것만으로 요리사가 무엇을 알게 할지 제어할 수 있습니다.
- 병원을 위해서라면: "백신" 주머니는 열어두고 "무기" 주머니는 잠가둡니다. 그러면 요리사는 치료제의 천재가 되지만, 무기를 만드는 법은 전혀 모르게 됩니다.
- 연구소를 위해서라면: "사이버 보안" 주머니를 열고 나머지는 닫습니다.
논문에 따르면, 이 단일 요리사는 이 마법 같은 모듈형 앞치마를 입고 한 번 훈련되었을 때, 처음부터 다섯 명의 별도 요리사를 훈련시킨 것과 거의 동일한 성능을 보여줍니다. 실제로 연구진이 이 방법을 50억 파라미터(거대한 뇌) 모델에 테스트했을 때, 이 단일 모듈형 요리사는 "좋은" 기술을 유지하고 "나쁜" 기술을 잊어버리는 데 있어 매우 비싼 방식만큼이나 뛰어난 성능을 보였습니다.
왜 이 방식이 다른 기술보다 더 나은가
연구진은 이 문제를 해결하기 위해 다른 방법들을 시도했고, 그것들을 배제했습니다.
- "사후 망각(Post-Hoc Unlearning)" 기술: 이것은 요리사가 이미 배운 기억을 나중에 뇌에서 지우려고 노력하는 것과 같습니다. 논문은 이 방식이 약하다고 지적했습니다. 만약 나중에 무기 레시피를 "망각"하려고 시도하더라도, 요리사는 약간의 연습(미세 조정)만으로도 그것을 쉽게 다시 기억해 낼 수 있습니다. 이는 노래를 거꾸로 흥얼거려서 기억을 지우려는 것과 같습니다. 제대로 작동하지 않습니다.
- "모델 브랜칭(Model Branching)" 기술: 이것은 요리사에게 기초를 가르친 다음, 나중에 특정 기술을 배우기 위해 다섯 개의 다른 학교로 보내는 것과 같습니다. 이 방식도 어느 정도 작동하지만, 논문은 GRAM의 "모듈형 앞치마" 접근 방식이 특히 데이터의 라벨이 불분명한 상황에서 기술을 분리해 두는 데 더 뛰어나다는 것을 발견했습니다.
"부분 라벨(Partial Label)"의 놀라운 발견
여기에는 이상하면서도 멋진 발견이 있습니다. 때때로 어떤 레시피인지 알 수 없는 경우(데이터의 50%가 라벨링되지 않은 경우)가 있습니다.
- 별도의 요리사를 훈련시키거나 "브랜칭" 방식을 사용하면, 그들은 모든 것을 "기본" 지식으로 취급하기 때문에 실수로 위험한 기술까지 배워버립니다.
- 하지만 GRAM 요리사는 놀라울 정도로 똑똑합니다. 라벨이 절반이나 누락되었음에도 불구하고, 모듈형 주머니들은 위험한 기술을 격리하는 데 성공합니다. 논문은 일단 주머니가 전문화되기 시작하면, 라벨 없는 데이터가 자연스럽게 해당 주머니로 "표류"하여 코어 뇌를 깨끗하게 유지하기 때문이라고 설명합니다.
얼마나 확신하는가?
저자들은 자신들의 수치에 매우 자신감을 갖고 있지만, 한계점도 명확히 밝히고 있습니다.
- 그들은 합성된 이야기와 바이러스학, 사이버 보안, 핵물리학, 특수 코드를 다루는 실제 데이터를 사용하여 테스트했습니다.
- 모델 규모를 5천만 파라미터에서 50억 파라미터까지 확장했습니다.
- 이 실험들에서 GRAM은 "골드 스탠다드"(별도의 모델을 훈련시키는 것)의 성능을 일관되게 따라잡으면서도, 5가지 프로필 설정에서 훈련 비용(연산량)을 5배 적게 사용했습니다.
- 하지만 논문은 아직 이 방식이 절대적인 규모의 "프런티어" 모델에 대해서는 테스트되지 않았음을 인정합니다. 따라서 50억 파라미터까지는 추세가 매우 좋아 보이지만, 훨씬 더 큰 규모에서도 똑같이 작동할 것이라고 단정할 수는 없습니다.
결론
GRAM은 AI 개발자들에게 "최소 권한(least privilege)" 시스템을 제공하는 방법을 제시합니다. 모든 사람에게 주방 전체를 주는 대신, 단순히 주머니의 지퍼를 여닫는 것만으로 사용자에게 특정하고 안전한 버전의 요리사를 제공할 수 있습니다. 이는 매번 새로운 케이크를 구울 필요 없이, 케이크를 먹으면서 동시에 가지는 것(강력한 AI를 가지면서도 안전한 접근 제어를 실현하는 것)과 같습니다.
논문은 이것이 모든 문제를 해결하는 마법의 탄환은 아니라고 결론짓습니다(어떤 기술들은 너무 엉켜 있어서 분리하기 어렵습니다). 하지만 이는 매번 새로운 모델을 구축할 필요 없이, 더 안전하고 유연한 AI를 향한 유망한 단계입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.