What to Forget in Unlearning? Forget Set Curation for Language Models
이 논문은 단순한 선택 방식은 타겟 콘텐츠를 억제하는 데 실패하는 반면 지나치게 공격적인 전략은 모델 능력에 상당한 부수적 피해를 입힌다는 점을 보여줌으로써, 망각 세트(forget sets)의 큐레이션이 머신 언러닝(machine unlearning)에서 중요한 상류 과제임을 입증하는 벤치마크인 CleanSlate를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인류의 방대한 지식이 하나의 매우 똑똑한 컴퓨터 프로그램으로 압축된 세상을 상상해 보십시오. 언어 모델이라고 알려진 이 프로그램은 책, 웹사이트, 노래에서 추출한 수조 개의 단어를 읽으며 학습합니다. 이 과정에서 프로그램은 시인의 문체를 흉내 내거나 유명 소설의 문장을 완성할 정도로 정교해집니다. 하지만 때때로 이 프로그램의 소유자들은 특정 정보를 제거해야 할 때가 있습니다. 예를 들어, 허가 없이 노래가 사용되었거나 개인적인 이야기가 실수로 기억되었을 경우입니다. 목표는 컴퓨터가 전체 기억을 삭제하고 처음부터 다시 시작하지 않고도, 그 특정 콘텐츠를 '망각'하도록 만드는 것입니다. 이 과정을 머신 언러닝(machine unlearning)이라고 부릅니다. 수년 동안 연구자들은 어떤 단어를 대상으로 할지 정확히 알고 있다는 전제하에, 데이터를 어떻게 삭제할 것인가 하는 메커니즘에 집중해 왔습니다. 그들은 잊어야 할 단어 목록을 단순한 출발점으로 간주하며, 만약 컴퓨터에게 특정 문장을 잊으라고 말하면 그것이 단순히 실행될 것이라고 가정했습니다.
하지만 스탠퍼드 대학교의 새로운 연구는 이러한 가정이 결정적이고 어려운 단계를 놓치고 있다고 시사합니다. 연구자들은 현실 세계에서 무언가를 잊어달라는 요청이 정밀한 단어 목록과 함께 오는 경우가 드물다는 사실을 깨달았습니다. 사용자가 모델에게 특정 노래를 부르지 말라고 요청할 수 있지만, 그 노래는 컴퓨터의 기억 속에 다양한 형태로 존재합니다. 공식 가사 속에 나타날 수도 있고, 가사를 인용한 뉴스 기사, 멜로디를 논하는 팬 포럼, 텍스트를 저장하는 코드 파일, 또는 후렴구를 언급하는 리뷰 속에도 나타날 수 있습니다. 컴퓨터는 단 하나의 완벽한 복사본만으로 노래를 아는 것이 아니라, 이러한 다양한 언급들이 흩어져 있는 구름 형태의 데이터로부터 노래를 학습합니다. 새로운 연구는 근본적인 질문을 던집니다. 이 거대한 텍스트 도서관 안에서 어떻게 그 노래나 책의 흩어진 조각들을 모두 찾아내어 컴퓨터에게 그것들을 잊으라고 명령할 수 있을 것인가? 연구팀은 이 누락된 단계를 '망각 집합 큐레이션(forget set curation)'이라 부르며, 이를 잘못 수행할 경우 컴퓨터가 원치 않는 노래 이상의 것을 잃게 될 수 있다는 것을 발견했습니다.
이를 조사하기 위해 연구진은 CLEANSLATE라는 테스트 환경을 구축했습니다. 그들은 1970년부터 2025년까지의 빌보드 핫 100 차트에 오른 수천 곡의 노래와 50권의 책을 모았습니다. 그런 다음 서로 다른 방법들이 제거해야 할 특정 텍스트 파편들을 얼마나 잘 식별하는지 테스트했습니다. 그들은 두 가지 주요 접근 방식을 비교했습니다. 첫 번째 접근 방식은 사람이 검색 엔진을 사용하여 책을 찾는 것과 유사한 표준 검색 도구에 의존했습니다. 이 도구들은 단어나 구절의 정확한 일치를 찾았습니다. 두 번째 접근 방식은 더 공격적이었습니다. 이는 컴퓨터가 해당 내용을 재현할 가능성이 가장 높은 특정 텍스트 부분을 직접 찾아내어 이를 제거 대상으로 선택함으로써, 검색 단계를 건너뛰고 문제의 핵심 영역을 직접 겨냥했습니다.
결과는 놀라운 복잡성을 드러냈습니다. 연구진이 표준 검색 도구를 사용하여 텍스트를 찾았을 때, 결과는 종로 미흡했습니다. 검색 도구가 명백한 복사본들을 제거한 후에도 컴퓨터는 여전히 노래를 부르거나 책을 낭독했습니다. 이는 컴퓨터가 표준 검색 도구가 놓친 수많은 작고 흩어진 출처들로부터 노래를 학습했기 때문입니다. 노래의 '발자국'은 단순히 공식 가사만이 아니라, 인터넷 전반에 퍼져 있는 인용, 참조, 그리고 파편들의 확산된 네트워크입니다. 연구진이 컴퓨터가 노래를 생성하는 데 사용하는 정확한 텍스트 창(window)을 타겟팅하여 더 철저하게 시도했을 때, 그들은 또 다른 종류의 문제를 겪었습니다. 그들은 컴퓨터가 노래를 부르는 것을 성공적으로 막아냈지만, 그 과정에서 컴퓨터가 다른 것들을 기억하는 능력을 손상시켰습니다. 모델은 노래에 관한 사실에 대한 질문에 답하는 능력이 떨어졌고, 추론이나 수학 문제를 푸는 것과 같은 일반적인 기술도 상실했습니다.
이 연구는 어떤 텍스트를 제거할 것인가에 대한 선택이 단순한 기술적 세부 사항이 아니라, 해결책 자체의 핵심적인 부분임을 보여주었습니다. 연구진은 잊어야 할 텍스트 목록이 같더라도 어떤 알고리즘을 사용하여 삭제하느냐에 따라 매우 다른 결과가 초래될 수 있다는 것을 발견했습니다. 어떤 경우에는 한 컴퓨터 모델에 완벽하게 작동했던 방법이 다른 모델에는 심각한 손상을 입히기도 했습니다. 이는 단순히 단어 목록을 고르고 삭제가 깔끔하게 이루어질 것이라고 가정할 수 없음을 의미합니다. 데이터의 선택 과정과 삭제하는 과정은 깊게 연결되어 있습니다. 너무 적게 선택하면 원치 않는 행동이 남게 되고, 너무 많이 혹은 잘못된 종류의 텍스트를 선택하면 귀중한 지식을 지워버리고 컴퓨터의 일반 지능을 해칠 위험이 있습니다.
궁극적으로 이 연구는 단순하고 완벽한 '잊어야 할 목록'이라는 개념이 환상임을 시사합니다. 모델이 학습하는 무질서한 현실 속에서, 노래나 책은 거대하고 보이지 않는 텍스트의 웹으로 지탱됩니다. 모델의 정신을 해치지 않으면서 특정 콘텐츠를 진정으로 망각하기 위해서는, 해당 특정 컴퓨터 모델이 그 콘텐츠를 어떻게 학습했는지를 고려하여 데이터를 매우 신중하게 선택해야 합니다. 연구는 실질적인 언러닝이 단순히 삭제 도구를 개선하는 것만으로는 해결될 수 없다고 결 결론짓습니다. 그것은 무엇을 잊을 것인지 선택하는 방식과 잊는 방법이 함께 계획되는 시스템을 설계하는 새로운 사고방식을 요구합니다. 이를 통해 컴퓨터가 세상을 이해하는 능력을 잃지 않으면서도 특정 요청을 놓아줄 수 있도록 보장할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.