Natively Unlearnable Large Language Models
이 논문은 공동 학습의 이점과 일반적인 언어 능력을 유지하면서도 개별 학습 소스의 효율적이고 견고하며 데이터가 필요 없는 언러닝(unlearning)을 가능하게 하기 위해, 공유된 백본 뉴런과 희소하게 활성화되는 소스별 싱크(sink)를 사용하는 모델 아키텍처인 NULLs(Natively Unlearnable LLMs)를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 뇌(대규모 언어 모델, LLM) 안에 거대한 지식의 도서관을 구축한다고 상상해 보세요. 보통 이 뇌를 가르칠 때는 모든 것을 한데 섞어서 학습시킵니다. 만약 당신이 "해리 포터"에 관한 사실과 "제2차 세계 대전"에 관한 사실을 함께 가르친다면, 이 기억들은 같은 뉴런 속에 뒤엉키게 됩니다. 만약 나중에 법적 요청 때문에 "해리 포터"의 기억을 삭제해야 한다면, 이는 스웨터에서 실 한 가닥을 뽑아내려다 전체를 풀어버리는 것과 같습니다. 실수로 역사 수업 내용까지 지워버릴 수도 있고, 혹은 해리 포터의 기억이 다시 몰래 스며들 수도 있습니다 있습니다.
이 논문은 NULLs(Natively Unlearnable LLMs, 태생적으로 학습 제거가 가능한 LLM)라고 불리는 새로운 방식의 AI 뇌 구축법을 소개합니다. 모든 것을 하나의 큰 더미로 섞는 대신, NULLs는 처음부터 특별한 "분류 시스템"을 갖추고 뇌를 구축합니다.
작동 원리는 다음과 같습니다. 쉬운 비유를 들어 설명하겠습니다.
1. "공용 주방" vs "개인 사물함"
AI의 뇌를 두 가지 유형의 저장 공간을 가진 것으로 생각해보세요:
- 공용 주방 (Backbone): 이곳은 AI가 문법, 문장 형성 방식, 또는 세상에 대한 일반적인 사실(예: "파리는 프랑스에 있다")처럼 모든 것에 적용되는 일반적인 것들을 배우는 곳입니다. 모두가 이 주방을 사용합니다.
- 개인 사물함 (Sinks): 이것이 새로운 발명품입니다. 모든 특정 정보 출처(예: 단일 위키피디아 문서나 특정 책)마다 AI에게는 그 출처만이 사용할 수 있는 고유한 세트의 "사물함"(뉴런)이 주어집니다.
AI가 특정 문서에만 해당하는 고유한 사실(예: 특정 뉴스 기사에 등장하는 특정 내부 고발자의 이름)을 배울 때, AI는 자연스럽게 그 사실을 해당 문서의 개인 사물함에 저장합니다. 반면, 일반적인 사실(예: "내부 고발자는 중요하다")을 배울 때는 이를 공용 주방에 저장합니다.
2. 마법의 스위치 (학습 제거)
표준 AI에서는 무언가를 잊게 만들고 싶을 때, 뇌 전체를 다시 학습시키거나 가중치를 정교하게 제거하려고 시도해야 하며, 이 과정은 종종 다른 기능들을 망가뜨리곤 합니다.
NULLs에서 "학습 제거(unlearning)"는 전등 스위치를 끄는 것만큼 간단합니다.
- 만약 한 출판사가 "우리 모델에서 특정 기사를 삭제해 달라"고 요청한다면, 모델을 다시 학습시킬 필요가 없습니다. 그저 해당 기사에 할당된 "개인 사물함"을 비활성화하기만 하면 됩니다.
- 그러면 AI는 즉시 그 기사의 고유한 사실들을 잊어버립니다. 왜냐하면 그 사물함이 잠겼기 때문입니다.
- 하지만 공용 주방은 열려 있는 상태로 유지됩니다. AI는 해당 주제에 대한 일반적인 사실들을 여전히 알고 있는데, 그 사실들은 특정 사물함이 아닌 공통 영역에 저장되어 있기 때문입니다.
이는 마치 손님마다 침실이 있고 거실을 공유하는 집과 같습니다. 손님이 떠나면, 그들의 침실 문을 잠그기만 하면 됩니다. 거실(사람들이 모이는 곳)은 똑같이 유지되며, 집 전체가 무너지지도 않습니다.
3. 연구진이 발견한 점
연구진은 이 아이디어를 두 가지 주요 방식으로 테스트했습니다.
- 위키피디아 테스트 (세밀한 수준): 연구진은 600만 개의 위키피디아 문서로 모델을 학습시켰습니다. 그리고 유사한 다른 문서들에 담긴 일반적인 지식은 삭제하지 않으면서, 딱 하나의 문서만을 제거할 수 있는지 확인하고자 했습니다.
- 결과: 한 문서의 사물함을 "잠갔을" 때, 모델은 그 문서만의 고유한 세부 사항은 잊었지만, 다른 문서들과 공유되는 일반적인 지식은 유지했습니다. 이는 모델을 처음부터 다시 학습시키는 것(보통 비용이 너무 많이 듭니다)과 거의 비슷하게 효과적이었습니다.
- 해리 포터 테스트 (포괄적인 수준): 연구진은 해리 포터 시리즈 전체로 모델을 학습시킨 후, 해리 포터와 관련된 모든 지식을 제거하려고 시도했습니다.
- 결과: "해리 포터 사물함"을 끄자, 모델은 마법사에 대해 말하는 것을 멈추고, 해리 포터 관련 문장이 입력되었을 때 일반적인 것들(예: 시의회 회의)에 대해 말하기 시작했습니다.
- 보너스: 연구진은 "적대적(adversarial)" 프롬프트를 사용하거나 약간의 재학습을 통해 모델이 해리 포터를 다시 기억하도록 속이려 했습니다. 표준 AI 모델들은 실패하고 빠르게 해리 포터를 기억해냈습니다. 그러나 NULLs 모델은 "학습 제거" 상태를 유지하며 이러한 속임수에 저항했습니다.
4. AI를 멍청하게 만드는가?
기억을 분리하면 AI의 일반적인 능력이 떨어질 수 있다는 큰 우려가 있습니다. 연구진은 표준 언어 벤치마크(과학 질문에 답하거나 논리 퍼즐을 푸는 등)를 통해 이를 테스트했습니다.
- 결과: NULLs 모델은 표준적인, 특화되지 않은 AI만큼 잘 작동했습니다. 일반적인 지능을 잃지 않았습니다.
요약
이 논문은 AI를 학습시킨 후에 어떻게 데이터를 삭제할지 고민하는 것이 아니라, 설계 단계부터 "삭제 버튼"을 직접 구조 안에 심어야 한다고 주장합니다. 모든 데이터 출처에 전용 "사물함"을 부여하면서도 공통의 "주방"을 공유하게 함으로써, 우리는 모델을 망가뜨리거나 처음부터 다시 학습시킬 필요 없이 특정 정보를 정교하게 제거할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.