Unforgettable Generalization in Language Models
이 논문은 무작위 레이블을 통한 미세 조정을 통해 언어 모델이 기술을 '망각'할 때 어떻게 행동하는지를 조사하며, 망각의 일반화가 매우 예측 불가능하고 작업 의존적이며, 표면적으로는 무작위적인 출력을 냄에도 불구하고 특정 학습 사례를 넘어 확장되는 데 종종 실패하는 한편, 선형 프로빙(linear probing)을 통해 입증된 바와 같이 기저의 작업 능력은 온전하게 유지된다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 거의 모든 인터넷 내용을 읽은 초지능 로봇 친구가 있다고 상상해 보세요. 이 로봇은 시를 쓰고, 수학 문제를 풀고, 왜 하늘이 파란지 설명할 수 있습니다. 하지만 때때로 이 로봇은 당신이 알기를 원치 않는 것을 배우거나, 당신이 가르치지 않기를 바라는 특정 기술을 너무 잘 익히기도 합니다. 이것이 바로 "기계 망각(machine unlearning)"의 세계입니다. 이는 인공지능 연구의 한 분야로, "우리가 로봇을 진정으로 잊게 만들 수 있는가?"라는 까다로운 질문을 던집니다.
실험을 이해하려면 두 가지를 알아야 합니다. 첫째, 이 로봇들(대규모 언어 모델이라 불림)은 엄청난 양의 텍스트를 읽으며 학습한 뒤, 과학 질문에 답하는 것과 같은 특정 업무를 더 잘 수행하도록 특정 예시들을 통해 "미세 조정(fine-tuning)"됩니다. 둘째, 이들을 잊게 만드는 흔한 방법은 동일한 질문을 보여주되, 답변을 완전히 뒤섞거나 가짜로 만들어 보여주는 것입니다. 아이디어는 로봇을 충분히 혼란스럽게 만들면, 그 주제 자체를 아예 포기하게 될지도 모른다는 것입니다. 연구자들이 쫓고 있는 거대한 미스터리는 이것입니다: 이 혼란이 전염되는가? 로봇에게 특정 질문 하나에 대해 혼란을 주면, 로봇이 그와 유사한 모든 질문에 답하는 법을 잊게 되는 것일까요, 아니면 단지 그 특정 예시에 대해서만 혼란을 겪는 것일까요?
거대한 "역학습(Un-Training)" 실험
이 논문에서 MIT의 에릭 장(Eric Zhang), 레솄 초센(Leshem Choshen), 제이콥 안드레아스(Jacob Andreas) 연구진은 Llama2라는 거대 언어 모델을 가지고 "망각하기" 게임을 하기로 했습니다. 그들은 이 모델을 방금 시험에서 만점을 받은 학생처럼 취급했고, 무작위의 엉터리 답변들로 다시 가르침으로써 그 내용을 잊게 만들려고 시도했습니다. 그들은 이 학생이 과목 전체를 잊어버릴지, 아니면 보여준 특정 연습 문제들만 잊어버릴지를 확인하고 싶었습니다.
거대한 놀라움: 주제에 따라 다르다
연구진은 이를 '물리적 상식'(예: 어떤 물체가 더 무거운지 알아내는 것)부터 '함의(entailment)'(한 문장이 논리적으로 뒤따르는지 결정하는 것)에 이르기까지 21가지의 서로 다른 유형의 작업에 대해 테스트했습니다. 결과는 기상천외하고 예측 불가능했습니다.
때때로 망각은 완벽하게 작동했습니다. 만약 그들이 모델에게 함의 분류(문장에 대한 논리 퍼즐)를 잊게 하려 했다면, 모델은 머릿속이 하얘졌습니다. 모델은 한 번도 본 적 없는 새로운 질문들에 대해 무작위의 쓸모없는 답변을 내놓기 시작했습니다. 마치 로봇이 그 특정 유형의 논리를 수행하는 능력 자체를 상실한 것 같았습니다.
하지만 다른 경우에는 망각이 완전히 실패했습니다. 모델에게 물리적 상식(중력이 어떻게 작용하는지와 같은 것)이나 과학 질문을 잊게 하려 했을 때, 모델은 고집스러웠습니다. 무작위의 틀린 답변들로 훈련받은 후에도, 모델은 여전히 새로운 과학 질문들에 올바르게 답했습니다! 그것은 마치 특정 연습 시험의 오답을 암기하도록 강요받았지만, 실제 시험이 왔을 때는 여전히 정답을 알고 있는 학생과 같았습니다. 모델은 훈련받은 특정 예시들은 잊어버린 듯 보였지만, 일반적인 지식은 온전히 유지하고 있었습니다.
테스트의 난이도가 핵심은 아니다
여러분은 모델이 쉬운 것은 잘 잊고 어려운 것은 잘 기억한다고 생각할 수도 있습니다. 연구진은 이를 확인했으며, 결과적으로 그것이 사실이 아님을 밝혀냈습니다. 난이도는 모델이 망각할지를 예측하지 못했습니다. 예를 들어, 모델은 "쉬운" ARC 질문보다 "어려운" ARC Challenge 질문의 정답을 기억하는 데 오히려 더 뛰어났는데, 두 질문 모두 과학 질문이었습니다. 질문의 난이도는 중요하지 않았습니다; 중요한 것은 질문의 유형이었습니다.
비밀의 단서: 확신도와 "뇌"의 가변성
그렇다면 무엇이 어떤 기술을 잊기 쉽게 혹은 어렵게 만들까요? 연구진은 모델의 "뇌"(내부 데이터 표현) 안에 숨겨진 두 가지 단서를 찾아냈습니다.
- 확신도(Confidence): 만약 망각 실험을 시작하기 전에 모델이 이미 정답에 대해 매우 불확실한 상태였다면, 모델을 잊게 만들기가 더 쉬웠습니다. 모델이 확신을 가지고 있었다면, 정보를 더 꽉 붙잡고 있었습니다.
- 뇌의 가변성(Brain Variability): 이것은 모델의 생각이 얼마나 꿈틀거리는지 살펴보는 것과 비슷합니다. 만약 모델의 내부 "생각"(표현)들이 사방에 흩어져 있다면(높은 가변성), 지우기가 더 어려웠습니다. 만약 생각들이 매우 일관되고 유사하다면(낮은 가변성), 모델은 더 쉽게 "역학습"되었습니다.
"얕은" 망각
가장 놀라운 부분은 여기 있습니다. 모델이 기술을 성공적으로 잊은 것처럼 보일 때(모두에게 무작위 답변을 내놓을 때)조차, 연구진은 정보가 실제로 사라진 것이 아님을 발견했습니다. 그들은 "선형 프로브(linear probe)"라고 불리는 간단한 도구(작고 특화된 탐지기라고 생각하세요)를 구축하여 모델의 내부 뇌파를 살펴보았습니다.
놀랍게도, 이 탐지기는 모델 스스로는 아무것도 모르는 것처럼 행동하고 있음에도 불구하고 정답을 완벽하게 읽어낼 수 있었습니다. 이는 마치 학생이 수업 시간에 혼란스러운 척하며 무작위 답변을 내놓고 있지만, 그들의 노트를 들여다보면 정답이 완벽한 필체로 여전히 적혀 있는 것과 같습니다. "망각"은 표면적인 연기였을 뿐, 깊은 지식은 여전히 그곳에 존재하며 발견되기를 기다리고 있었습니다.
결론
이 논문은 단순히 무작위 답변으로 재훈련하는 방식이 특정 기술을 잊게 만들려는 시도에 있어 하나의 도박이라고 결론짓습니다. 이 방식은 어떤 작업(논리 퍼즐 등)에는 효과적이지만, 다른 작업(과학 및 상식 등)에는 실패합니다. 나아가, 설령 효과가 있는 것처럼 보이더라도 정보는 진정으로 삭제된 것이 아니라, 단지 혼란이라는 층 뒤에 숨겨져 있을 뿐입니다. 연구진은 우리가 원치 않는 것을 모델이 확실히 잊게 만들기 위해서는, 이 모델들이 어떻게 학습하고 정보를 저장하는지에 대해 훨씬 더 많이 이해해야 한다고 제언합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.