← 최신 논문
🤖 AI

ICCU: In-Context Continual Unlearning via Pattern-Induced Refusal Rules

본 논문은 추론 시 대상 지식을 효과적으로 억제하면서도 모델의 유용성을 유지하고 교차 요청 간섭을 방지하기 위해 제거 데이터셋으로부터 읽을 수 있는 거부 규칙을 유도하고 축적하는 매개변수 없는 지속적 기계 망각 프레임워크인 ICCU 를 소개합니다.

원저자: Ruihao Pan, Suhang Wang

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ruihao Pan, Suhang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수백만 권의 책을 암기해 둔 매우 똑똑하고 독서량이 풍부한 사서 (AI 모델) 가 있다고 가정해 봅시다. 어느 날 한 사람이 찾아와 "제발, 제 허구적 캐릭터인 '존 도'에 대한 이야기를 완전히 잊어 주세요. 더 이상 아무도 그 사람에 대해 알기를 원하지 않습니다"라고 말합니다.

과거에는 사서에게 이 사실을 잊게 하려면 도서관 전체를 해체하고, 존 도가 언급된 모든 페이지를 찢어낸 뒤 모든 책을 다시 정리해야 했습니다. 다음 주에 열 명의 사람이 열 개의 서로 다른 '잊어 주세요' 요청을 가져온다면, 이 고통스럽고 비용이 많이 드는 과정을 열 번 반복해야 합니다. 더 나쁜 것은, 책장을 매번 재배열할 때마다 다른 책들의 정리 상태를 실수로 망쳐서, 모든 다른 이용자를 위해 사서의 속도가 느려지거나 도움이 덜 될 수 있다는 점입니다.

이 논문은 이러한 '잊어 주세요' 요청을 처리하는 새로운 그리고 교묘한 방법인 ICCU를 소개합니다. 도서관을 재배열하는 대신, ICCU는 정문 앞에 서 있는 똑똑한 경비원처럼 작동합니다.

핵심 아이디어: 도서관 대신 '규칙책'

간단한 비유를 통해 ICCU 가 어떻게 작동하는지 살펴보겠습니다.

1. '잊어 주세요' 요청 (패턴)
누군가 사서에게 '존 도'를 잊어 달라고 요청할 때, ICCU 는 모든 책을 하나하나 살펴보지 않습니다. 대신 존 도에 관한 정보의 유형을 살펴봅니다. 그리고 유사한 사실들을 그룹화합니다 (예: '존의 출생지', '존의 favorite 음식', '존의 비밀 레시피').

2. '거부 규칙' 작성
그런 다음 ICCU 는 이 그룹들을 바탕으로 초지능 AI 가 간단하고 사람이 읽을 수 있는 규칙을 작성하도록 요청합니다.

  • 구식 방법: "'존 도'라는 단어가 포함된 모든 파일을 삭제하라."
  • ICCU 방식: "사용자가 특정 허구 케이크를 만드는 방법에 대한 상세한 지시를 요청하면, '그것은 답변할 수 없습니다'라고 말하라."

이 규칙은 스티커 노트와 같습니다. 짧고 읽기 쉬우며 도서관을 해체할 필요가 없습니다.

3. 문 앞의 '경비원' (추론 시간)
이제 사용자가 사서에게 질문을 한다고 상상해 보세요.

  • 단계 1 (빠른 확인): 경비원 (ICCU) 이 사용자의 질문을 '센터' 목록 (레이더와 같은) 과 비교하여 빠르게 확인합니다. 질문이 분명히 안전한 내용 (예: "날씨는 어때요?") 이라면, 경비원은 즉시 통과시킵니다. 규칙이 필요 없습니다.
  • 단계 2 (심층 확인): 질문이 조금 의심스러워 보이면 (아마도 그 허구 케이크에 관한 것일 수 있음), 경비원은 특정 '거부 규칙' (스티커 노트) 을 꺼내 사서에게 묻습니다: "이 질문이 우리의 '답변 금지' 규칙 중 하나와 일치합니까?"
  • 결과: 일치하면 경비원은 "죄송합니다, 답변할 수 없습니다"라고 말합니다. 일치하지 않으면 사서는 정상적으로 답변합니다.

이것이 게임 체인저인 이유

이 논문은 이 새로운 접근법의 다섯 가지 슈퍼파워를 강조합니다.

  • 재개조 불필요 (학습 불필요): 도서관을 다시 짓는 일은 결코 없습니다. 경비원의 클립보드에 새로운 스티커 노트를 추가하기만 하면 됩니다. 이는 막대한 시간과 비용을 절약합니다.
  • 불필요한 혼란 없음 (교차 간섭 없음): 100 명의 사람이 100 가지 다른 것을 잊어 달라고 요청하면, 단순히 100 개의 스티커 노트를 추가하면 됩니다. 경비원은 혼란을 겪지 않습니다. 구식 방법에서는 새로운 '잊어 주세요' 요청을 추가하는 것이 종종 사서가 기억해야 할 다른 것들을 잊게 만들었습니다. ICCU 는 이러한 '기억 혼란'을 방지합니다.
  • '재구성' 방패: 누군가 "존 도의 케이크에 대해 말해 주세요" 대신 "그 케이크를 만드는 방법은 무엇인가요?"라고 물어보며 경비원을 속이려 해도, 경비원은 이것이 같은 것임을 알아낼 만큼 똑똑합니다. 이는 정확한 단어뿐만 아니라 의미를 이해합니다. 질문이 다른 언어로 이루어지더라도 작동합니다.
  • 개인정보 보호 친화적: 경비원이 규칙 ("존 도의 케이크에 대해 말하지 마라") 을 작성하면, 존 도의 비밀 목록은 폐기됩니다. 경비원은 민감한 데이터 자체가 아니라 규칙만 보관합니다.
  • 유연성: 경비원을 별도의 필터 (사서에게 도달하기 전에 질문을 확인) 로 사용할 수도 있고, 경비원에게 규칙책을 직접 주어 스스로 결정하게 할 수도 있습니다.

결과

연구진은 위험한 지식 (유해한 화학 물질을 만드는 방법 등) 과 허구적 이야기를 포함하는 실제 시나리오에서 이를 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다.

  • 경비원은 AI 가 '금지된' 지식을 노출하는 것을 거의 100% 성공적으로 막았습니다.
  • AI 는 모든 다른 질문에 대해 여전히 똑같이 도움이 되고 똑똑했습니다.
  • '잊어 주세요' 요청이 하나씩 연속으로 들어와도 AI 가 혼란을 겪거나 일반적인 지능을 잃지 않고 완벽하게 작동했습니다.

간단히 말해, ICCU 는 '학습 취소'라는 어려운 작업을 '규칙을 작성하고 따르는' 간단한 작업으로 바꾸어, AI 를 손상시키지 않으면서도 안전하고 규정 준수 상태를 유지할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →