Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning
이 논문은 과학적 주장 언러닝(Scientific Claim Unlearning)이라는 과업과 새로운 벤치마크인 SciUnlearn을 도입하여, 현재의 머신 언러닝 방법들이 거대 언어 모델로부터 상호 연결되고 진화하는 과학적 주장들을 효과적으로 제거하는 데 실패하며, 종종 진정한 지식 제거보다는 표면적인 억제에 그친다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
대규모 언어 모델이라고도 불리는 현대의 인공지능 시스템은 방대한 인간 지식의 도서관 역할을 합니다. 이들은 질문에 답하고 문제를 해결하는 법을 배우기 위해 과학 논문을 포함한 거대한 텍스트 모음집을 읽으며 학습합니다. 하지만 과학은 정적인 기록 보관소가 아닙니다. 과학은 끊임없는 수정이 이루어지는 살아 움직이는 과정입니다. 새로운 연구가 기존의 아이디어가 틀렸음을 증명하거나, 오류로 인해 논문이 철회될 때 과학적 기록은 업데이트됩니다. 문제는 이러한 AI 모델들이 자동으로 스스로를 업데이트하지 않는다는 점입니다. 일단 사실을 학습하면, 과학계에서 그것이 거짓이라고 선언한 후에도 그 사실을 계속 붙들고 있는 경향이 있습니다. 이는 AI가 구식 정보나 이미 반박된 정보를 자신 있게 반복하여, 연구자들을 오도하거나 의학 같은 분야에서 심지어 해를 끼칠 수 있는 위험을 초래합니다.
이를 해결하기 위해 연구자들은 '머신 언러닝(machine unlearning)'이라 불리는 기술을 개발했습니다. 이 기술의 목표는 모델이 다른 질문에 답하는 능력은 그대로 유지하면서 특정 정보만을 "잊도록" 가르치는 것입니다. 특정 잘못된 책을 서가에서 제거하되, 나머지 도서관을 방해하거나 다른 책을 찾는 능력을 잃지 않고 수행해야 하는 사서의 모습을 상상해 보십시오. 이 기술은 개인 정보나 저작권이 있는 자료를 제거하는 데는 테스트되었지만, 과학자들은 아직 특정 과학적 주장을 효과적으로 제거하는 방법을 찾아내지 못했습니다. 이러한 주장들은 서로 깊게 연결되어 있기 때문에 까다롭습니다. 하나의 사실을 아는 것은 종종 다른 많은 사실에 대한 이해에 의존하기 때문입니다. 만약 하나의 사실을 제거하려고 시도하면, 모델은 지식을 유지하기 위해 단순히 그 내용을 약간 다르게 표현하는 법을 배우거나, 혹은 다른 모든 것을 실수로 잊어버릴 수도 있습니다.
TCS 리서치와 예일 대학교의 연구팀은 이 구체적인 문제를 해결하기 위해 나섰습니다. 그들은 현재의 AI 모델이 진정으로 과학적 주장을 잊을 수 있는지 확인하기 위해 'SciUnlearn'이라는 새로운 테스트 환경을 만들었습니다. 그들은 컴퓨터 과학과 의학 분야의 실제 과학 논문을 사용하여 데이터셋을 구축했으며, 여기에는 공식적으로 철회된 논문들도 포함되었습니다. 각 논문에 대해 핵심적인 과학적 주장을 추출하고, 이를 객관식, 참/거짓, 빈칸 채우기와 같은 다양한 유형의 질문으로 변환했습니다. 테스트의 공정성을 보장하기 위해, 그들은 질문을 두 그룹으로 나누었습니다. 한 그룹은 모델에게 잊도록 가르치기 위한 것이고, 다른 그룹은 동일한 근본 사실에 기반하여 재구성된 질문들로, 모델이 개념 자체를 정말로 잊었는지 아니면 단순히 특정 질문의 패턴을 암기한 것인지를 확인하기 위한 것이었습니다.
그 후 연구진은 기존의 언러닝 방법들을 가져와 이 모델들에 적용했습니다. 그들은 모델에게 첫 번째 그룹의 질문들을 잊으라고 요청한 뒤, 두 번째 그룹의 질문들과 일반 지식 질문들에 대해 테스트하여 모델이 쓸모없어지지 않았는지 확인했습니다. 결과는 시사하는 바가 컸습니다. 사용된 방법들은 모델이 학습하도록 훈련된 특정 질문들에 대해서는 실패하게 만드는 데 효과적이었습니다. 그러나 동일한 과학적 주장을 테스트하는 재구성된 질문들에 직면했을 때, 모델들은 여전히 정답을 맞히는 경우가 많았습니다. 이는 모델이 실제로 지식을 제거한 것이 아니라, 단지 훈련 질문에 사용된 단어의 특정 패턴을 억제했을 뿐임을 시사합니다. 마치 모델이 특정 문장을 무시하는 법을 배웠을 뿐, 그 뒤에 숨은 사실을 지운 것이 아닌 것과 같았습니다.
연구는 또한 모델이 다른 관련 없는 정보를 얼마나 잘 기억하는지도 살펴보았습니다. 대상이 되는 주장을 잊게 만들려는 일부 방법들은 모델이 일반적인 질문에 답하는 능력을 의도치 않게 저하시키기도 했지만, 어떤 방법들은 나머지 지식을 온전히 유지해 냈습니다. 연구진은 어떤 주장을 잊는 것의 난이도는 그 주장이 과학 문헌 속에 얼마나 깊게 박혀 있는지에 달려 있다는 것을 발견했습니다. 많은 다른 연구들에 의해 자주 인용된 논문의 주장들은 제거하기가 훨씬 더 어려웠습니다. 이러한 고인용 아이디어들은 관련된 텍스트의 넓은 그물망에 의해 강화되어, 단 한 번의 언러닝 시도로는 지우기 어려운 저항력을 가졌습니다. 반면, 인용이 적은 논문의 주장들은 방해하기가 더 쉬웠지만, 그럼에도 불구하고 그 '잊음'은 종종 질문의 정확한 표면 형태에 국한되었습니다.
결론적으로, 이 연구는 현재의 방법들이 진정한 과학적 주장 언러닝을 수행할 능력은 아직 갖추지 못했다고 결데합니다. 현재의 방식은 지식의 특정 사례를 숨길 수는 있지만, 근본적인 개념적 이해를 제거하는 데는 어려움을 겪습니다. 연구진은 향다면 모델의 지식 내에 있는 이러한 더 깊고 구조적인 연결을 목표로 하는 방법에 집중해야 한다고 제안합니다. 표면적인 패턴을 억제하는 것을 넘어 말입니다. 그때까지, 이러한 AI 모델들은 구식 과학의 무게를 계속 짊어진 채, 세상은 이미 지나쳐 왔으나 모델은 여전히 붙들고 있는 사실들을 간직하고 있을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.