← 최신 논문
💬 NLP

Wisdom is Knowing What not to Say: Hallucination-Free LLMs Unlearning via Attention Shifting

이 논문은 기존 기계 소거 방법의 utility 손실과 환각 문제라는 딜레마를 해결하기 위해, 중요도 인식 억제와 주의 유도 유지 강화를 통해 지식 소거와 일반적 성능 보존을 동시에 달성하는 '주의 이동 (Attention-Shifting)' 프레임워크를 제안합니다.

원저자: Chenchen Tan, Youyang Qu, Xinghao Li, Hui Zhang, Shujie Cui, Cunjian Chen, Longxiang Gao

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenchen Tan, Youyang Qu, Xinghao Li, Hui Zhang, Shujie Cui, Cunjian Chen, Longxiang Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 배경: 인공지능의 '기억'과 '잊음'의 딜레마

인공지능 (LLM) 은 방대한 양의 데이터를 학습해서 지식을 쌓습니다. 하지만 만약 그 안에 사용자의 사생활이나 비밀 같은 민감한 정보가 섞여 있다면, 우리는 그 정보를 '지우기' 원합니다. 이를 **머신 언러닝 (Machine Unlearning)**이라고 합니다.

하지만 기존 방법들은 두 가지 큰 문제를 겪고 있었습니다:

  1. 과격한 삭제 (Aggressive): 정보를 강제로 지우려다 보니, 인공지능이 멍해져서 다른 일반적인 질문에도 엉뚱한 답을 하거나 아예 말을 못 하게 됩니다. (기억력 상실)
  2. 온건한 삭제 (Conservative): 정보를 지우지 않고 답을 바꾸려다 보니, 인공지능은 "모르겠다"라고 말하지 않고, **사실과 다른 엉뚱한 거짓말 (할루시네이션)**을 자신 있게 해버립니다. (기억은 지웠는데, 거짓말은 계속 함)

💡 해결책: '주의력 이동 (Attention Shifting)' 기술

이 논문이 제안한 AS(Attention Shifting) 기술은 인공지능의 '주의력'을 조절하는 방식입니다.

🎯 비유: "도서관 사서와 빨간 펜"

인공지능이 정보를 떠올릴 때, 마치 도서관 사서가 책장 사이를 훑어보며 중요한 단어를 찾아내는 것과 같습니다.

  • 기존의 문제: 민감한 정보 (예: "지훈 씨의 집 주소") 를 지우려면, 사서가 그 책을 아예 불태워버리는 (과격한 삭제) 식이거나, "지훈 씨의 집 주소는 없습니다"라고 말하면서도 속으로는 그 정보를 계속 떠올려서 "아마 서울 강남이겠지?"라고 엉뚱한 추측을 하는 (온건한 삭제) 식이었습니다.
  • AS 의 방식: 이 기술은 사서에게 **"그 책 (민감한 정보) 을 볼 때, 그 책의 제목과 저자 (사실 정보) 에 초점을 맞추지 말고, 책장 가장자리나 빈 공간 (중립적인 단어) 으로 시선을 옮겨라"**라고 지시합니다.

핵심 메커니즘:

  1. 중요한 단어에 대한 시선 줄이기: "지훈", "주소", "서울" 같은 사실 정보를 담고 있는 단어에 인공지능이 집중하는 힘을 약하게 만듭니다. (Suppression)
  2. 중립적인 단어에 대한 시선 늘리기: 대신 문장의 연결고리나 문법적인 단어에 집중하도록 유도합니다. (Retention)

이렇게 하면 인공지능은 민감한 정보를 기억에서 완전히 지우는 것이 아니라, 그 정보를 꺼내지 않는 습관을 들이게 됩니다. 마치 "그 질문에는 답할 수 없다"라고 자연스럽게 거절하는 것처럼요.

✨ 이 기술의 장점 (왜 이것이 '지혜'인가?)

  1. 거짓말을 안 합니다: 인공지능이 "모르겠다"라고 말하거나, "그런 정보는 없습니다"라고 정중히 거절할 때, 엉뚱한 거짓말을 지어내지 않습니다. (할루시네이션 방지)
  2. 기타 능력은 그대로: 민감한 정보만 잊었을 뿐, 다른 일반적인 지식 (날씨, 역사, 수학 등) 은 여전히 잘 기억하고 잘 대답합니다. (기억력 유지)
  3. 자연스러운 거절: "비밀입니다"라고 말하기보다, 질문을 받았을 때 자연스럽게 "그건 알 수 없습니다"라고 대답하는 것처럼, 문맥을 해치지 않고 잊어버립니다.

📊 실험 결과

연구진은 이 기술을 테스트해 보았습니다.

  • 기존 방법들: 민감한 정보를 지우려다 보니, 다른 질문을 했을 때 정확도가 50% 이상 떨어지거나, 거짓말을 30% 이상 했습니다.
  • 이 기술 (AS): 민감한 정보는 완벽하게 잊었으면서도, 다른 질문들에 대한 정확도는 거의 떨어지지 않았습니다. 오히려 기존 방법들보다 정확도가 10~15% 더 높았습니다.

🏁 결론

이 논문은 인공지능에게 **"무엇을 말해야 하는지"**를 가르치는 것이 아니라, **"무엇을 말하지 않아야 하는지"**를 가르치는 새로운 지혜를 제시했습니다.

비유하자면, 과거의 방법은 민감한 정보를 지우려다 머리를 다쳐서 멍청해지거나, 거짓말을 하느라 정신이 혼란스러웠다면, 이 새로운 방법은 **"그건 비밀이니까 말하지 않겠어요"**라고 자연스럽게 거절하면서도, 다른 대화는 여전히 똑똑하게 이어가는 매너 있고 똑똑한 비서를 만든 것입니다.

이 기술은 개인정보 보호가 중요한 의료, 법률, 금융 분야에서 인공지능을 안전하게 사용할 수 있는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →