How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation
이 논문은 Llama-3.1-8B-Instruct에 대한 기계론적 해석 가능성(mechanistic interpretability)을 활용하여, RAG 시스템에서의 인용 결정이 어텐션 헤드와 MLP의 분산된 다단계 "속성 앙상블(attributional ensemble)"로부터 발생함을 밝히며, 이러한 특정 구성 요소들을 선택적으로 증폭하거나 감쇄시키는 것이 답변 정확도를 저해하지 않으면서 인용 충실도를 유의미하게 향상시킬 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 문제: "가짜 전문가"
매우 똑똑하고 박학다식한 사서(AI)에게 질문을 한다고 상상해 보세요. 사서는 도움을 주기 위해 책장에서 책 한 권을 꺼내 사실을 읽고, 당신을 위해 그 내용을 적습니다. 결정적으로, 사서는 하단에 "이 내용은 책 A에서 찾았습니다"라는 작은 메모를 덧붙입니다.
이것을 **검색 증강 생성(RAG)**이라고 부릅니다. 이 메모(인용)는 사서가 실제로 그 책을 읽었다는 것을 증명하며, 답변의 신뢰도를 높여준다는 아이디어입니다.
함정: 만약 사서가 이미 기억만으로 그 답을 알고 있다면 어떻게 될까요? 사서는 답을 적은 뒤, 전문적으로 보이기 위해 책 A를 꺼내어, 그 책에도 마침 그 사실이 들어있다는 것을 확인하고는 그냥 인용구를 붙여버립니다.
- 결과: 답은 맞고, 인용도 "맞지만"(책에 그 내용이 들어있으므로), 그 인용은 **불충실(unfaithful)**합니다. 사서는 답변을 구성하기 위해 실제로 그 책을 사용한 것이 아니라, 답변이 검증된 것처럼 보이게 하기 위한 소품으로 책을 활용했을 뿐입니다.
이 논문의 저자들은 다음과 같은 질문을 던졌습니다: AI는 답변을 쓰기 전에 실제로 책을 읽는 것일까, 아니면 그저 잘 보이기 위해 끝에 인용구를 갖다 붙이는 것일까?
조사 과정: 기계 내부 들여다보기
보통 우리는 AI를 "블랙박스"처럼 취급합니다. 질문을 던지고, 답을 얻고, 그것이 맞는지 확인할 뿐이죠. 하지만 AI가 출처에 대해 거짓말을 하고 있는지 확인하려면, 생각하는 동안 기계 내부를 들여다봐야 합니다.
저자들은 **기계적 해석 가능성(Mechanistic Interpretability)**이라는 기술을 사용했습니다. AI의 뇌를 수백만 개의 작은 일꾼(뉴런)과 도로(연결)로 이루어진 거대한 도시라고 생각해 보세요. 저자들은 **활성화 패칭(Activation Patching)**이라는 도구를 사용했습니다.
비유: AI를 자동차를 조립하는 공장이라고 상상해 보세요.
- "깨끗한" 실행 (Clean Run): 공장이 올바른 엔진(관련 문서)을 가진 자동차를 만듭니다.
- "더러운" 실행 (Dirty Run): 공장이 잘못된 엔진(무작위의 무관한 문서)을 가진 자동차를 만듭니다.
- 패칭 (The Patch): 연구자들은 "깨끗한" 실행에서 가져온 특정 기어와 피스톤을 "더러운" 실행으로 교체했습니다. 만약 자동차가 갑자기 제대로 작동하기 시작한다면, 그들은 그 특정 기어들이 "인용" 결정을 내리는 데 책임이 있는 부품임을 알 수 있었습니다.
발견한 사실: "인용 크루(Citation Crew)"
그들은 AI에게 인용을 결정하는 단 하나의 "인용 뇌"가 있는 것이 아니라, 여러 작은 부분들이 함께 작동하는 분산된 팀, 즉 **"속성적 앙상블(Attributional Ensemble)"**이 존재한다는 것을 발견했습니다.
이 팀이 작동하는 단계별 과정은 다음과 같습니다:
이름 매칭기 (초기 레이어):
AI가 가장 먼저 하는 일은 이름이 일치하는지 찾는 것입니다. 질문이 "우간다"에 대해 묻고 있고 문서에도 "우간다"가 언급되어 있다면, 특정 작업자 집단이 활성화됩니다.- 결함: 이것은 피상적인 속임수입니다. AI는 문서가 답을 설명하고 있는지 확인하는 것이 아니라, 단순히 "우간다"라는 단어가 양쪽 모두에 등장하는지만 확인합니다. 이는 마치 학생이 교과서와 시험 문제에서 "광합성"이라는 단어를 보고, 교과서가 광합성에 대해 설명하고 있더라도 그 책이 출처라고 가정해 버리는 것과 같습니다.
중간 관리자 (중간 레이어):
이름이 일치하면, AI 뇌의 중간 단계에서 일하는 전체 팀이 개입합니다. 이들은 많은 "결합 체크(conjunctive checks, AND 체크)"를 수행합니다.- 비유: 보안 게이트와 같습니다. 열쇠(이름 일치), 배지(문서 문맥), 그리고 비밀번호(문장 구조)가 동시에 필요합니다. 만약 이 작은 체크 중 하나라도 실패하면, 전체 인용 프로세스는 무너집니다. 이 시스템은 매우 취약합니다.
최종 결정 (후기 레이어):
AI가 답변을 타이핑하기 직전 마지막 단계에서, 최종 그룹이 결정합니다: "좋아, 이름이 일치하고 체크를 통과했으니,[1]을 입력하자."- 놀라운 점: 연구자들은 실제 답변의 의미가 이 결정을 이끄는 것보다 이름의 일치가 더 큰 영향을 미친다는 것을 발견했습니다.
주요 결론: "신뢰의 환상"
이 논문은 AI의 인용 결정이 문서의 내용을 깊이 이해해서가 아니라, 피상적인 휴리스틱(shallow heuristics, 단순한 규칙)(이름 매칭과 같은 간단한 속임수)에 의해 주도되는 경우가 많다고 결론짓습니다.
- 환상: 당신이 인용구가 포함된 답변을 볼 때, 당신은 AI가 답변을 만들기 위해 출처를 읽었다고 가정합니다.
- 현실: AI는 단지 답변을 기억해 냈고, 출처 문서에 동일한 키워드가 나타나는 것을 보고는, 정직해 보이기 위해 인용구를 "붙여넣기" 했을 뿐일 수도 있습니다.
이것이 왜 중요한가
저자들은 이것이 가짜 안전감을 조성한다고 경고합니다.
- 만약 의사나 변호사가 인용구와 함께 답을 주는 AI를 전적으로 신뢰한다면, 그들은 AI를 맹목적으로 믿게 될 수 있습니다.
- 하지만 그 인용이 실제 검증이 아닌 단순한 "이름 매칭"이었다면, AI는 완벽하게 검증된 것처럼 보이는 방식으로 잘못된 정보를 퍼뜨리고 있는 것일 수 있습니다.
한 문장 요약
이 논문은 AI 모델이 답변을 구축하기 위해 실제로 출소(source)를 사용해서가 아니라, 출처에서 일치하는 단어를 찾아내고 간단한 자동 체크리스트를 실행하여 답변에 "검증됨"이라는 도장을 찍는 방식으로 인용을 결정한다는 사실을 밝혀냈습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.