← 최신 논문
💬 NLP

Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation

이 논문은 머신 언러닝(machine unlearning)에서 표준적인 클린 쿼리(clean-query) 지표와 적대적 강건성(adversarial robustness) 사이의 상당한 격차를 밝혀내며, 미세 조정(fine-tuning) 방식이 전통적인 평가 방식하에서는 데이터 망각에 성공한 것처럼 보일지라도 전략적인 프롬프팅을 통해 타겟 정보가 여전히 높은 수준으로 복구될 수 있음을 입증함으로써, 진정한 언러닝을 보장하기 위한 적대적 스트레스 테스트의 결정적인 필요성을 강조한다.

원저자: Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

모든 책이 인류 지식의 총합을 담고 있지만, 어떤 페이지에는 반드시 지워야 할 비밀들, 즉 개인 주소, 시대에 뒤떨어진 의료 조언, 또는 독점적인 공식 등이 들어 있는 도서관을 상상해 보십시오. 디지털 세계에서 인공지능 시스템은 이러한 방대한 텍스트 컬렉션을 학습한 거대한 도서관 역할을 합니다. 사용자가 컴퓨터에 특정 정보를 '잊어버리라'고 요청할 때, 목표는 기계가 그 데이터를 더 이상 회상할 수 없도록 철저하게 제거하면서도 다른 모든 것은 기억하게 만드는 것입니다. '기계 망각(machine unlearning)'이라고 알려진 이 과정은 개인정보 보호와 안전을 위해 필수적입니다. 그러나 한 가지 의문이 연구자들을 오랫동안 괴롭혀 왔습니다. 만약 컴퓨터가 무언가를 잊었다고 말한다면, 그것을 진정으로 신뢰할 수 있을까요? 아니면 그 정보는 단지 숨겨져 있을 뿐이며, 영리한 질문에 의해 파헤쳐지기를 기다리고 있는 것일까요?

매사추세츠 대학교 애머스트 캠퍼스와 마이크로소프트 코퍼레이션의 연구팀은 이러한 디지털 도서관이 실제로 얼마나 잘 잊을 수 있는지 그 한계를 테스트함으로써 이 질문에 답하고자 했습니다. 그들은 지시를 따르고 질문에 답하도록 훈련된 특정 유형의 인공지능 모델에 집중했습니다. 연구팀은 망각을 측정하는 데 사용되는 표준 테스트가 충분한지, 아니면 결정적인 약점을 놓치고 있는지를 확인하고 싶었습니다. 이를 위해 그들은 가상의 저자 전기를 활용한 통제된 실험을 설계했습니다. 그들은 모델에게 이 가짜 저자들에 대해 알도록 가르친 다음, 특정 저자들을 잊게 만들려고 시도했습니다. 그들은 두 가지 주요 방식을 테스트했습니다. 하나는 질문하는 방식을 변경하여 기억을 억제하려는 방법이었고, 다른 하나는 기억을 지우기 위해 모델의 내부 연결을 실제로 재구성하는 방법이었습니다.

연구진은 먼저 모델이 잊기로 되어 있는 정보에 대해 단순하고 직접적인 질문을 던지는 표준 테스트를 실행했습니다. 이러한 차분하고 비적대적인 조건 하에서는 몇몇 방법들이 완벽하게 작동하는 것처럼 보였습니다. 모델들은 매우 높은 점수를 기록했으며, 이는 목표한 사실들을 성공적으로 삭제했음을 시사했습니다. 한 방법은 특히 정보가 거의 완전히 잊힌 것처럼 보였으며, 점수는 거의 완전한 성공을 나타냈습니다. 마치 데이터가 영원히 사라진 것처럼 보였습니다.

하지만 연구팀은 거기서 멈추지 않았습니다. 모델이 단순한 질문에는 저항할 수 있지만, 더 복잡한 질문에는 속아 넘어갈 수 있다는 점을 의심했습니다. 이를 테스트하기 위해 그들은 전략적인 공격을 개시했습니다. 직접적으로 묻는 대신, 그들은 모델의 방어 체계를 우회하도록 설계된 수백 개의 까다로운 프롬프트를 생성하는 '해커' 프로그램을 사용했습니다. 이 프롬프트에는 모델에게 전문가인 척하도록 요구하는 역할극, 안전 규칙을 무력화하려는 지시, 그리고 가설적이거나 간접적인 방식으로 구성된 질문들이 포함되었습니다. 또한 모델이 언어가 바뀔 때 실수할 수 있는지 확인하기 위해 동일한 질문을 다른 언어로도 시도했습니다.

결과는 표준 테스트가 보여준 것과 실제로 일어나고 있는 일 사이의 놀라운 격차를 드러냈습니다. 모델들이 단순한 테스트에서는 만점을 받았던 반면, 전략적 공격 앞에서는 처참하게 실패했습니다. 연구진은 모델이 잊었다고 주장하는 정보조차도 다시 드러내도록 유도될 수 있다는 것을 발견했습니다. 실제로, 이러한 영리한 프롬프트로 공격했을 때 모델은 비밀 정보를 72% 이상의 확률로 누설했습니다. 일부 방법의 경우, 실패율은 아무것도 잊으라고 배우지 않은 모델의 실패율만큼이나 높았습니다. 정보는 사라진 것이 아니라, 단지 그것을 열 수 있는 적절한 열쇠가 나타나기를 기다리며 잠잠히 누워 있었던 것입니다.

연구팀은 질문 방식이 매우 중요하다는 것도 발견했습니다. 직접적인 질문은 때때로 저항하기 쉬웠지만, 권위 있는 인물을 내세우거나, 모델에게 문장을 완성하도록 요청하거나, 요청을 가설적인 시나리오로 구성하는 프롬프트는 모델의 기억을 깨뜨리는 데 훨씬 효과적이었습니다. 흥ingly, 연구진이 독일어, 스페인어, 일본어와 같은 다른 언어로 단순히 질문을 번역했을 때는 (까다로운 프로프팅 없이) 모델이 훨씬 더 잘 버텨냈으며, 정보 누설률은 3% 미만이었습니다. 이는 취약성이 단순히 언어의 문제가 아니라, 질문을 던지는 데 사용된 특정한 구조에 관한 것임을 시사합니다.

연구 결과의 정확성을 보장하기 위해, 연구진은 인간 전문가가 모델의 응답 샘 샘플을 검토하도록 했습니다. 그들은 자동화된 시스템이 누설을 판단하는 데 있어 대부분 정확하며, 인간의 판단과 10번 중 7번 일치한다는 것을 발견했습니다. 자동화된 시스템이 가끔 실수를 하여(잘못된 답변을 누설로 표시하거나 올바른 답변을 놓치는 등) 오류를 범하기도 했지만, 정보가 실제로 회복되고 있다는 신호를 신뢰성 있게 제공했습니다. 이는 공격의 높은 성공률이 실제 현상이지 테스트 소프트웨어의 결함이 아님을 확인해주었습니다.

이 연구는 기계가 무언가를 잊었는지 테스트하는 현재의 방식이 불충분하다고 결론짓습니다. 모델은 표준 성적표에서는 완벽해 보일 수 있지만, 여전히 결단력 있는 공격자에게 매우 위험하게 노출될 수 있습니다. 연구진은 데이터가 제거되었다는 것을 증명하기 위해 단순하고 깔끔한 질문에 의존해서는 안 된다고 주장합니다. 대신, 우리는 실제 세상의 공격자가 사용할 법한 영리하고 전략적인 질문으로 이러한 시스템을 스트레스 테스트해야 합니다. 모델이 비밀을 드러내도록 속임을 당하지 않는다는 것을 증명할 수 있을 때까지, 우리는 그것이 진정으로 잊었다고 확신할 수 없습니다. '잊은 것처럼 보이는 것'과 '실제로 잊는 것' 사이의 간극은 여전히 넓으며, 이 간극을 메우기 위해서는 이 강력한 디지털 지능을 테스트하고 구축하는 새로운 방법이 필요할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →