← 최신 논문
🤖 AI

Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models

이 논문은 멀티모달 거대 언어 모델(MLLM)을 위해 프로필 수준의 삭제보다 더 세밀한 대안으로서 속성 수준의 언러닝(attribute-level unlearning)을 도입하고, 정체성 관련 정보는 보존하면서 특정 속성만을 선택적으로 망각하는 과제를 평가하기 위한 포괄적인 벤치마크를 제안하며, 인과적 국소화(causal localization)와 유지 인지 투영(retain-aware projection)을 통해 이를 효과적으로 달성하는 경량화된 학습 불필요 프레임워크인 CLRP를 제시한다.

원저자: Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 사진을 보고 그에 대한 이야기를 들려줄 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 로봇은 수백만 권의 책을 읽었고 수십억 장의 사진을 보았기에 아주 많은 것을 알고 있습니다. 하지만 가끔 이 로봇은 누군가의 비밀스러운 생일이나 집 주소처럼 알지 말아야 할 것들을 기억하곤 합니다. 인공지능의 세계에서는 이러한 로봇들에게 다른 모든 것을 잊게 만들지 않으면서도 특정 비밀만을 '잊는 법'을 가르쳐야 할 필요성이 커지고 있습니다. 이 과정을 '머신 언러닝(machine unlearning)'이라고 부릅니다. 이것은 마치 일기를 편집하는 것과 같습니다. 당신은 여름 휴가에 대한 창피한 문장 하나를 지우고 싶지만, 친구와 가족에 대한 다른 즐거운 이야기들은 그대로 간직하고 싶어 합니다. 만약 페이지 전체를 찢어버린다면 모든 것을 잃게 됩니다. 만약 종이를 녹여버리는 화학 물질로 잉크를 지우려 한다면 책 전체를 망치게 될 것입니다. 과제는 나쁜 기억만을 정교하게 제거하면서도 로봇의 나머지 뇌가 완벽하게 작동하도록 유지하는 방법을 찾는 것입니다.

이 논문은 이 문제의 까다로운 새로운 버전을 다룹니다. 로봇에게 사람 전체를 잊으라고 하는 대신(예: "내 친구 Bob에 대한 모든 것을 잊어버려"), 연구자들은 Bob의 이름, 직업, 외모는 기억하면서도 오직 그의 '좋아하는 색깔'과 같은 특정한 한 가지 사실만을 잊도록 요청했습니다. 그들은 로봇의 뇌가 매우 복잡하다는 것을 발견했습니다. Bob의 좋아하는 색깔에 대한 기억은 Bob의 얼굴에 대한 기억과 뒤엉켜 있습니다. 색깔을 도려내려다 보면 종종 얼굴까지 함께 잘려 나가기도 합니다. 이 문제를 해결하기 위해 저자들은 로봇이 얼마나 정교한 망각을 수행할 수 있는지 측정하기 위한 새로운 테스트인 AMU-Bench를 구축했습니다. 그런 다음, 훈련이 필요 없는 영리한 도구인 CLRP(Causal Localization and Retain-Aware Projection)를 발명했습니다. CLRP를 로봇이 질문에 답할 때만 착용하는 '기억 안경'이라고 생각해 보세요. 이 안경은 로봇의 뇌를 바꾸는 것이 아니라, 그 순간 로봇이 자신의 생각을 바라보는 방식을 미세하게 조정합니다. '활성화 패칭(activation patching)'(이는 레고 탑에서 특정 브릭 하나를 교체하여 탑의 어느 부분이 흔들리는지 확인하는 것과 같습니다)이라는 기술을 사용하여, CLks는 비밀이 저장된 로봇 뇌의 정확한 위치를 찾아냅니다. 그런 다음, 나머지 이야기는 선명하게 유지하면서 그 특정 비밀만을 무음 처리하는 수학적 필터를 적용합니다.

연구진은 이 방법을 세 가지 로봇의 뇌(LLaVA-1.5-7B, LLaVA-1.5-13B, Qwen2.5-VL-3B)에 대해 테스트했으며, 그들의 방식이 이전의 시도들보다 훨씬 더 효과적이라는 것을 발견했습니다. 데이터의 5%를 잊게 만드는 주요 테스트에서, CLRP는 로봇이 비밀을 맞출 확률을 **20.00%**에서 단 **4.00%**로 떨어뜨릴 수 있었습니다. 더욱 놀라운 점은, 다른 방법들이 로봇이 '좋은 정보'까지 잊게 만든 반면, CLRP는 오히려 로봇이 비밀이 아닌 사실들을 더 잘 기억하도록 도와서, 해당 질문들에 대한 정확도를 **14.77%**에서 **17.79%**로 높였습니다. 이 논문은 이 접근 방식이 로봇을 처음부터 다시 훈련시킬 필요 없이, 무엇을 간직하고 무엇을 놓아줄지 선택할 수 있는 능력을 부여하는 유망한 방법임을 시사합니다. 또한 그들은 숫자(예: 전화번호)를 잊는 것이 긴 설명(예: 취미)을 잊는 것보다 로봇에게 더 쉽지만, 그 사람의 나머지 이야기를 안전하게 지키는 것이 가장 어려운 부분이라는 점도 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →