← 최신 논문
🤖 machine learning

One Mask to Rule Them All: On Hidden Facts after Editing and How to Find Them

본 논문은 ROME 및 MEMIT과 같은 트랜스포머 모델 내의 다양한 지식 편집이 지식을 덮어쓰는 것이 아니라 후속 계층에서의 과도한 주의를 억제하는 가중치의 공통 기능적 부분 공간에 의존하며, 이 메커니즘은 편집을 되돌리고 원치 않는 수정에 대한 방어를 알리기 위해 이진 마스크를 통해 격리될 수 있음을 밝힌다.

원저자: Ali Holmov, Paul Youssef, Nandi Schoots, Christin Seifert

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ali Holmov, Paul Youssef, Nandi Schoots, Christin Seifert

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (이 채팅을 구동하는 모델과 같은) 을 방대하고 첨단 기술이 집약된 도서관으로 상상해 보세요. 이 도서관 안에는 사실들이 책장에 진열되어 있습니다. 보통 "라듐을 발견한 사람은 누구인가?"라고 질문하면, 도서관의 내부 시스템이 '마리 퀴리'라는 라벨이 붙은 책장에서 해당 책을 찾아 당신에게 건네줍니다.

최근 과학자들은 도서관 전체를 재건하지 않고도 이 도서관을 "수정"할 수 있는 방법을 개발했습니다. 그들은 ROMEMEMIT라는 방법을 사용합니다. 이 아이디어는 이러한 방법들이 '마리 퀴리' 책이 놓인 특정 책장을 찾아 그 책을 꺼내고, 대신 "크립톤"이라고 적힌 새로운 책으로 교체한다는 것입니다.

이 논문의 연구자들은 다음과 같은 의문을 품었습니다: 그들은 실제로 책을 교체했을까, 아니면 단순히 기존 책 위에 표지판을 붙였을까?

대발견: 교체 (Replacement) 가 아닌 장악 (Hijack)

이 논문은 ROME 과 MEMIT 이 원래 지식을 실제로 지우거나 덮어쓰지 않는다고 주장합니다. 대신 그들은 도서관의 주시 시스템 (Attention System) 을 "장악"합니다.

다음은 비유입니다:
이 도서관에는 도서관 사서가 올바른 책을 찾도록 안내하는 매우 시끄럽고 번쩍이는 스포트라이트 시스템 (Attention Mechanism) 이 있다고 상상해 보세요.

  • 과거의 방식: 편집자들이 책장 위의 책을 조용히 교체한다고 생각했습니다.
  • 현실: 편집자들은 '마리 퀴리' 책에 손대지 않았습니다. 대신, "크립톤" 책 바로 위에 눈이 멀 정도로 밝고 번쩍이는 스포트라이트를 설치했습니다. 이 스포트라이트가 너무 강렬해서 사서의 눈이 오직 '크립톤'만 보도록 강요당합니다. '마리 퀴리' 책은 여전히 책장에 온전하게 그대로 놓여 있지만, 스포트라이트가 너무 산만해서 사서는 그것을 볼 수 없습니다.

이 논문은 이를 **"과도한 주의 (Overattention)"**라고 부릅니다. 이 수정은 기존 사실을 삭제하는 대신, 모델이 새로운 사실에 너무 집중하도록 강요하여 기존 사실을 효과적으로 가려버리는 방식으로 작동합니다.

"그들을 지배하는 하나의 가면 (One Mask to Rule Them All)"

이를 입증하기 위해 연구자들은 스포트라이트를 끄는 "스위치"를 찾으려 했습니다. 그들은 작고 디지털적인 가면 (모델을 위한 선글라스나 눈가리개라고 생각하세요) 을 훈련시켰습니다.

  • 실험: 그들은 이 단일한 선글라스를 수천 가지의 다른 수정 (마리 퀴리를 크립톤으로 변경, 에펠탑을 빅벤으로 변경 등) 에 적용해 보았습니다.
  • 결과:단 하나의 가면이 거의 모든 경우에 작동했습니다! 그들이 모델에 가면을 씌우자, 눈이 멀게 하는 스포트라이트가 꺼졌습니다. 갑자기 사서는 원래의 '마리 퀴리' 책을 다시 볼 수 있게 되었습니다.
  • 증거: 이 가면은 훈련 세트에서 약 **80%**의 수정을 되돌렸으며, 새로운 보지 못한 수정에 대해서는 **70%**의 성공률을 보였습니다.

이는 매우 중요합니다. 왜냐하면 이러한 모든 다른 수정들이 동일한 미세한 메커니즘에 의존한다는 것을 의미하기 때문입니다. 그들은 도서관 전체를 다시 쓰는 것이 아니라, 모두 동일한 유형의 눈이 멀게 하는 스포트라이트를 켜는 것뿐입니다.

"역방향 스위치" 테스트

이 스포트라이트가 수정의 원인 (단순한 부수 효과가 아님) 임을 확실히 하기 위해, 연구자들은 모델에 수정을 시도하기 전에 선글라스를 씌우는 교묘한 시도를 했습니다.

  • 결과: 수정이 실패했습니다. 모델은 새로운 사실 ("크립톤") 을 출력하기를 거부했습니다. 성공률은 **98% 에서 38%**로 떨어졌습니다.
  • 의미: 이는 "눈이 멀게 하는 스포트라이트"가 단순한 부수 효과가 아니라, 수정이 작동하게 하는 필수적인 엔진임을 증명합니다. 스포트라이트를 차단하면 수정이 발생할 수 없습니다.

왜 이것이 중요한가

  1. 지식은 사라지지 않았습니다: 원래 사실들은 모델의 기억 속에 여전히 존재하며, 단지 소음의 벽 뒤에 숨어 있을 뿐입니다. 이는 수정된 모델이 때때로 까다로운 질문을 받으면 실수를 저질러 원래 사실을 말하는 이유를 설명합니다.
  2. 파급 효과 없음: 편집자들이 도서관의 카탈로그 (지식 그래프) 를 실제로 다시 쓰지 않기 때문에, 변경 사항들은 관련 사실들로 퍼지지 않습니다. 프랑스의 수도를 변경하면 모델은 프랑스 지리에 대한 지식을 자동으로 업데이트하지 않습니다. 대신 단지 새로운 수도를 보도록 강요할 뿐입니다.
  3. 방어 메커니즘: 이러한 모든 수정이 동일한 "눈이 멀게 하는 스포트라이트" 트릭을 사용하므로, 우리는 이 단일 가면을 사용하여 원치 않는 수정을 탐지하거나 발생하기 전에 완전히 차단할 수 있습니다. 이는 AI 모델을 위한 보편적인 "장착 방지 (anti-hijack)" 도구를 갖는 것과 같습니다.

요약

이 논문은 현재의 AI 수정 도구들이 원래 사실을 실제로 삭제하지 않는다는 것을 밝혀냈습니다. 그들은 단지 AI 가 진실을 무시하고 새로운 거짓말에 집중하도록 강요하는 매우 시끄럽고 산만하게 만드는 스포트라이트를 설치할 뿐입니다. 이 스포트라이트를 끄는 작은 "가면"을 찾아냄으로써, 연구자들은 원래 진실을 복원할 수 있을 뿐만 아니라 새로운 거짓말이 처음부터 설치되는 것을 방지할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →