Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation
이 논문은 새로운 지식으로 인한 LLM 의 사실적 환각 현상을 분석하여, 특정 지식 유형의 불 familiarity 가 핵심 개체 주의를 약화시키고 이를 통해 환각이 전파되는 메커니즘을 규명하며, 훈련 후기 단계에서 기존 지식을 재도입함으로써 이를 완화할 수 있음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎓 이야기: "새로운 과목 배우다가 기존 실력을 망친 AI"
상상해 보세요. 아주 똑똑한 학생 (AI) 이 있습니다. 이 학생은 이미 학교에서 수천 권의 책을 읽어서 역사, 과학, 문학 등 **기존 지식 (Pre-training)**을 아주 잘 알고 있습니다.
하지만 이제 이 학생에게 **완전히 새로운 과목 (새로운 지식)**을 가르치려고 합니다. 그런데 이상한 일이 일어납니다. 새로운 과목을 배우는 동안, 학생은 예전에 잘 알던 옛날 지식까지 잊어버리거나 엉뚱한 거짓말을 하기 시작합니다.
이 논문은 바로 **"왜 새로운 것을 배우면 기존 지식이 망가질까?"**를 파헤친 연구입니다.
🔍 1. 실험: "완벽한 가짜 인물" 만들기
연구진들은 AI 가 이미 알고 있는 지식이 섞이지 않도록, **완전히 가짜 인물 (Biography-Reasoning)**을 만들어 실험을 했습니다.
- 가짜 인물: "다레우스 허오"라는 이름의 사람.
- 새로운 사실: 출생 연도, 사망 연도, 전공, 대학 등 4 가지 정보.
- 실험 방법: AI 에게 이 가짜 인물들의 정보를 가르치면서, **어떤 정보는 처음 보는 것 (새로운 지식)**으로, **어떤 정보는 이미 아는 것 (기존 지식)**으로 설정했습니다.
💥 2. 발견한 놀라운 사실들
① "새로운 것만 배우면, 아는 것도 망가진다"
AI 에게 새로운 가짜 인물 정보만 가르치니, AI 는 그 새로운 정보에 대해 잘 말해주기보다, 예전에 잘 알던 다른 인물들의 정보까지 엉뚱하게 말하기 시작했습니다. 마치 새로운 과외를 하느라 학교 시험을 망친 학생처럼요.
② "조금만 섞여도 괜찮다? 아니요, '완전 낯선' 게 문제다"
가장 중요한 발견입니다.
- 상황 A: 새로운 정보 90% + 기존 정보 10% 가 섞여 있을 때 → AI 는 그래도 버텨냅니다.
- 상황 B: 새로운 정보 100% (기존 정보 0%) 가 한 과목에 모였을 때 → AI 는 완전히 미쳐버립니다.
즉, 새로운 정보가 얼마나 많은지보다, **"특정 주제가 완전히 낯선 상태인가?"**가 더 중요합니다. 완전히 낯선 주제 하나만 배우게 해도 AI 는 그 주제뿐만 아니라 다른 것까지 망가뜨립니다.
🧠 3. 왜 그럴까? (원인 분석)
연구진들은 AI 의 뇌 (모델 내부) 를 들여다보며 원인을 찾았습니다.
- 핵심 원인: "주의 집중력 (Attention) 의 상실"
AI 가 질문을 할 때, **핵심 단어 (예: 사람 이름)**에 집중해야 정답을 맞힙니다. 그런데 새로운 지식을 배우는 과정에서 AI 는 핵심 단어에 집중하는 힘을 잃어버리고, 주변 문맥이나 엉뚱한 단어에 집중하게 됩니다.- 비유: 시험 문제를 풀 때, 문제의 '주제'를 보지 않고 '지문'만 보고 대충 추측하는 꼴이 된 것입니다. 그래서 엉뚱한 답을 만들어냅니다.
💊 4. 해결책: "기존 지식의 '패치' (KnownPatch)"
이 문제를 해결하기 위해 연구진은 아주 간단한 약을 개발했습니다. 바로 KnownPatch입니다.
- 방법: 새로운 지식을 배우는 훈련이 거의 끝날 때, 아주 작은 양의 '기존에 아는 지식'을 다시 섞어서 가르쳐 줍니다. (전체 데이터의 5~20% 정도만)
- 효과: 놀랍게도 아주 적은 양의 기존 지식만 다시 보여줘도, AI 의 주의 집중력이 원래대로 돌아옵니다.
- 비유: 길을 잃고 헤매던 학생에게, "아, 네가 예전에 잘 알던 '서울역'이 여기 있구나!"라고 한 번만 알려주면, 다시 방향 감각을 되찾고 길을 찾아냅니다.
🌊 5. 거짓말이 퍼지는 방식
또 다른 재미있는 발견은 거짓말이 퍼지는 방식입니다.
- AI 는 의미가 비슷한 내용보다는 단어가 겹치는 (문장 구조가 비슷한) 내용에서 거짓말이 더 잘 퍼집니다.
- 비유: "사과"에 대한 거짓말을 배우면, "배"에 대한 질문에도 엉뚱한 답을 할 수 있지만, "사과"와 단어가 비슷하게 생긴 "사과 (과일)"와 "사과 (죄)"를 구분하지 못하고 혼란을 겪는 것입니다. 즉, 문장의 '모양'이 비슷하면 거짓말이 전염됩니다.
📝 요약: 이 연구가 우리에게 주는 메시지
- 새로운 지식을 가르칠 때 조심하세요: AI 에게 완전히 새로운 정보만 계속 주면, 기존에 잘 하던 일도 망가질 수 있습니다.
- 완전 낯선 주제는 위험하다: 특정 주제에 대해 AI 가 아는 게 하나도 없으면, 그 주제뿐만 아니라 전체 성능이 떨어집니다.
- 해결책은 간단합니다: 훈련 마지막에 약간의 기존 지식을 다시 넣어주면 (KnownPatch), AI 가 다시 제정신을 차리고 거짓말을 줄입니다.
- 주의 집중이 핵심: AI 가 거짓말을 하는 이유는 지식이 부족해서가 아니라, 질문의 핵심을 놓치고 주변을 보게 되었기 때문입니다.
이 연구는 AI 를 더 똑똑하고 신뢰할 수 있게 만들기 위해, 무작정 새로운 데이터만 쌓는 것이 아니라, 기존 지식과의 균형을 맞추는 훈련 방법이 중요함을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.