← 최신 논문
💬 NLP

CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization

이 논문은 대규모 추론 모델 (LRM) 의 추론 과정 (CoT) 을 표적으로 삼아, 논리적으로 타당한 반사실적 추론 궤적을 생성하고 이를 반복적으로 선호도 최적화하는 'CiPO' 프레임워크를 제안함으로써, 기존 방법의 한계를 극복하고 지식 완전 제거와 추론 성능 유지라는 딜레마를 해결함을 보여줍니다.

원저자: Junyi Li, Yongqiang Chen, Ningning Ding

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junyi Li, Yongqiang Chen, Ningning Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 배경: 왜 지우기가 어려운가요?

과거의 AI(일반 언어 모델) 는 질문에 바로 답만 했다면, 최신의 **'거대한 추론 모델 **(LRM)은 답을 하기 전에 **머릿속에서 긴 생각의 과정 **(Chain-of-Thought)을 거칩니다. 마치 수학 문제를 풀 때 "이건 A 고, B 라면 C 가 되겠지..."라고 종이에 풀이 과정을 적어가는 것과 같습니다.

문제 상황:
이 모델이 민감한 정보 (예: 사생활, 저작권이 있는 내용) 를 학습했다면, 우리는 그 정보를 완전히 지우고 싶어요.
하지만 기존 방법들은 두 가지 큰 문제를 겪었습니다.

  1. 답만 지우면 안 됨: 답은 지웠는데, '풀이 과정'에 여전히 그 정보가 남아있으면, AI 가 다시 그 정보를 추론해 낼 수 있어요.
  2. 지우려다 망가짐: 정보를 억지로 지우려고 하면, AI 의 추론 능력 자체가 무너져서 "모르겠어요"라고만 말하거나, 엉뚱한 소리를 지껄이기 시작해요.

💡 해결책: CiPO (반사실적 선호 최적화)

이 논문은 **"정보를 억지로 지우는 게 아니라, '다른 진실'로 대체하자"**는 아이디어를 제시합니다. 이를 CiPO라고 부릅니다.

🎭 비유: "가짜 연극"으로 "진짜 기억"을 덮어쓰기

기존 방법들이 **"기억을 삭제하는 지우개 **(Eraser)였다면, CiPO 는 **"새로운 스토리를 써서 덮는 작가 **(Author)입니다.

  1. **반사실적 **(Counterfactual)

    • 상황: AI 가 "A 라는 사람은 B 도시에서 태어났다"는 사실을 기억하고 있어요. 우리는 이걸 지우고 싶어요.
    • CiPO 의 방법: AI 에게 "A 라는 사람은 실제로는 C 도시에서 태어났다고 생각해 봐"라고 시켜요.
    • 이때 중요한 건, AI 가 논리적으로 타당한 이유를 들어 C 도시라고 주장하는 **새로운 생각 과정 **(CoT)을 스스로 만들어내게 한다는 점입니다.
    • 예: "A 라는 사람은 B 도시가 아니라, 가족 사정 때문에 C 도시에서 태어났을 거야. 왜냐하면..." (이런 식으로 논리적인 거짓말을 만들어냄).
  2. **반복적인 훈련 **(Iterative Optimization)

    • 한 번에 지우려고 하면 AI 가 혼란스러워합니다. 그래서 CiPO 는 반복적으로 훈련합니다.
    • 1 단계: AI 가 원래 기억한 내용 (B 도시) 을 말하면, "아니야, 우리가 만든 새로운 논리 (C 도시) 가 더 맞아!"라고 가르칩니다.
    • 2 단계: AI 가 조금씩 바뀌면, 다시 새로운 질문을 던져서 "여전히 B 도시를 말하지 않고 C 도시를 말하게 하라"고 훈련시킵니다.
    • 이 과정을 반복하면 AI 는 **원래의 기억 **(B 도시)을 완전히 잊어버리고, **새로운 논리 **(C 도시)를 자연스럽게 받아들이게 됩니다.

🏆 왜 CiPO 가 특별한가요?

기존 방법들과 비교하면 다음과 같은 장점이 있습니다.

방법 비유 결과
**기존 방법 **(지우개) "그건 모른다"고 강제로 막거나, 머릿속을 무작위로 뒤섞음. AI 가 멍해지거나, 엉뚱한 소리를 함. (추론 능력 파괴)
**기존 방법 **(거부) "모르겠어요"라고만 반복함. AI 가 모든 질문을 거부하게 되어 유용성이 떨어짐.
**CiPO **(새로운 스토리) **논리적인 대안 **(C 도시) **원래의 정보 **(B 도시)

📝 요약

이 논문은 **"AI 의 머릿속에서 민감한 정보를 지울 때, 단순히 지우지 말고 '논리적으로 타당한 다른 진실'로 대체하라"**고 말합니다.

마치 기억을 지우기 위해 뇌를 망가뜨리는 대신, 새로운 기억을 심어주어 오래된 기억을 자연스럽게 밀어내는 것과 같습니다. 이를 통해 AI 는 민감한 정보는 잊어버리면서도, 여전히 똑똑하게 추론할 수 있는 능력을 유지하게 됩니다.

이 기술은 개인정보 보호저작권 문제가 중요한 시대에, AI 를 안전하게 관리할 수 있는 획기적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →