← 최신 논문
🤖 machine learning

Inference-Time Machine Unlearning via Gated Activation Redirection

GUARD-IT 는 추론 시 입력에 종속적인 게이트 활성화 리디렉션을 활용하여 모델의 유용성과 양자화 및 지속적 학습 시나리오 전반에 걸친 견고성을 유지하면서 기억된 데이터를 효과적으로 제거하는 새로운 훈련 없는 기계 망각 방법으로, 기존 경사 기반 접근법보다 우수한 성능을 보입니다.

원저자: Vinícius Conte Turani, Otávio Parraga, João Vitor Boer Abitante, Kristen K. Arguello, Joana Pasquali, Ramiro N. Barros, Flavio du Pin Calmon, Christian Mattjie, Rodrigo C. Barros, Lucas S. Kupssinskü

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Vinícius Conte Turani, Otávio Parraga, João Vitor Boer Abitante, Kristen K. Arguello, Joana Pasquali, Ramiro N. Barros, Flavio du Pin Calmon, Christian Mattjie, Rodrigo C. Barros, Lucas S. Kupssinskü

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수백만 권의 책을 암기해 둔 매우 똑똑하고 잘 읽은 사서 (AI 모델) 가 있다고 가정해 봅시다. 때로는 이 사서에게 특정 이야기를 '잊게' 하도록 요청해야 할 수도 있습니다. 아마도 그 이야기들이 개인 정보를 포함하고 있거나, 저작권이 있는 자료이거나, 혹은 단순히 제거하고 싶은 사실일 수 있기 때문입니다.

이를 수행하는 전통적인 방법은 사서의 전체 두뇌를 꺼내어 심장 수술을 하듯, 그 기억들을 담고 있는 특정 뉴런들을 외과적으로 제거하려는 시도와 같습니다. 이는 위험하고 비용이 많이 들며, 종종 사서를 혼란스럽게 만들어 다른 모든 것을 기억하지 못하게 하거나, 의미 없는 말 (지저분한 말) 을 하게 만듭니다.

이 논문은 GUARD-IT라는 새로운 방법을 소개합니다. 이는 두뇌의 일부를 잘라내는 대신, 사서의 책상 앞에 있는 스마트 교통 지시자처럼 작동합니다.

간단한 비유를 사용하여 이것이 어떻게 작동하는지 설명해 보겠습니다:

1. '전역 (Global)' 조종의 문제

AI 를 재학습시키지 않고 그 사고방식을 변경하는 '활성화 엔지니어링 (activation engineering)'에 대한 이전 시도들은 사서의 책상 위에 모든 사람에게 적용되는 "말하지 마세요"라는 표지를 붙이는 것과 같았습니다. 사서에게 "작가 X 에 대해 말하지 마세요"라고 지시하면, 그들은 작가 X 에 대해 말하지 않게 되지만, 작가 X 와 조금이라도 비슷하게 들리는 누구에 대해서도 실수로 말을 멈출 수 있습니다. 또한, "말하지 마세요"라는 표지가 너무 거칠기 때문에 이상하고 로봇 같은 말투로 말하기 시작할 수도 있습니다.

2. GUARD-IT 솔루션: "스마트 게이트"

GUARD-IT 는 모든 사람을 위한 거대한 표지판을 사용하지 않기 때문에 다릅니다. 대신, 스마트 게이트(유사성 게이트웨이)를 사용합니다.

  • 1 단계: 기억 분류 (오프라인 단계)
    사서가 작업을 시작하기 전에, 팀은 제거하려는 모든 책을 주제별로 분류하여 다른 더미로 정리합니다 (예: "더미 A: 프랑스 시인", "더미 B: 19 세기 전기"). 각 더미마다 특정 "반-기억" 지시를 생성합니다. 이것들을 각 주제별 "말하지 마세요" 카드라고 생각하세요.

  • 2 단계: 교통 점검 (온라인 단계)
    사용자가 질문을 하면, 스마트 게이트가 먼저 질문을 확인합니다.

    • 질문이 무작위 주제에 관한 경우 (예: "날씨는 어때요?"), 게이트는 "일치 없음"이라고 말하고 사서는 정상적으로 답변합니다. "말하지 마세요" 카드는 결코 건드리지 않습니다.
    • 질문이 특정 주제에 관한 경우 (예: "작가 X 에 대해 알려주세요"), 게이트는 주제를 인식하고 해당 더미를 위한 특정 "말하지 마세요" 카드를 가져와 적용합니다.

3. "마법 같은 회전" (Norm-Preserving Rotation)

게이트가 올바른 "말하지 마세요" 카드를 선택하면, GUARD-IT 는 사서의 두뇌를 새로운 방향으로 밀어 넣지 않습니다. 대신, 완벽한 회전을 수행합니다.

사서의 생각은 회전하는 팽이라고 상상해 보세요.

  • 이전 방법들은 팽이를 밀어 넘어뜨리려 했으며, 이는 종종 팽이가 흔들려 넘어지게 만들었습니다 (AI 가 nonsensical 또는 "지저분한 말"을 생성하게 함).
  • GUARD-IT 는 팽이가 새로운 방향을 가리키도록 부드럽게 회전시키지만, 회전 속도는 정확히 동일하게 유지합니다. 이렇게 하면 사서가 균형을 잃지 않고 유창하게 유지되되, 다른 것들에 대해 이야기하게 됩니다.

4. 이것이 중요한 이유

이 논문은 GUARD-IT 가 다른 방법들이 가진 세 가지 큰 두통을 해결한다고 주장합니다:

  • 뇌 수술 불필요: 모델을 재학습시키거나 영구적인 가중치를 변경할 필요가 없습니다. 두뇌를 재배선하는 대신 사서에게 임시 지시 세트를 제공하는 것과 같습니다.
  • "압축"을 견딥니다: 현실 세계에서는 AI 모델이 스마트폰이나 저렴한 서버에서 더 빠르게 실행되도록 종종 축소 (양자화) 됩니다. 전통적인 방법들은 모델이 축소될 때 종종 깨지는데, 이는 정밀한 조각이 빽빽하게 포장될 때 부서지는 것과 같습니다. GUARD-IT 는 무겁고 정적인 가중치가 아닌 정보의 흐름에 작동하기 때문에 모델이 압축되어도 완벽하게 작동합니다.
  • "지속적" 요청을 처리합니다: 다음 주에 새로운 책을 제거해야 한다면, 전체 수술을 다시 할 필요가 없습니다. 더미에 새로운 "말하지 마세요" 카드만 추가하면 됩니다. 사서는 혼란을 겪거나 관련 없는 사실을 잊어버리지 않고 무한한 제거 요청 흐름을 처리할 수 있습니다.

요약

간단히 말해, GUARD-IT 는 AI 가 특정 것을 "잊게" 만드는 학습 없이, 기울기 (gradient) 없이 작동하는 방법입니다. 이는 다음을 통해 이루어집니다:

  1. 잊어야 할 것들을 범주로 분류합니다.
  2. 사용자의 질문이 해당 범주와 일치하는지 확인합니다.
  3. 일치하면, AI 의 생각에 부드럽고 정밀한 "회전"을 적용하여 금지된 주제에서 벗어나게 합니다.
  4. 일치하지 않으면, AI 가 정상적으로 답변하도록 허용합니다.

이것은 AI 를 똑똑하고 유창하며 안전하게 유지하면서, 두뇌를 망가뜨릴 위험이나 비싼 재학습의 필요성 없이 보호합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →