LMs as Task-Specific Knowledge Bases: An Interpretability Analysis
이 논문은 행동 및 메커니즘 분석을 통해 사실적 지식이 작업별 방식으로 인코딩되며, 질의 문맥에 따라 서로 다른 파라미터 부분 집합이 활성화됨을 입증함으로써 언어 모델을 통일된 지식 베이스로 보는 관점에 이의를 제기하고, 이를 통해 사실적 검색의 일관성과 신뢰성을 저해한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 인터넷의 거의 모든 것을 읽은 거대하고 매우 똑똑한 백과사전을 가지고 있다고 상상해 보세요. 당신은 이 백과사전을 모든 사실이 특정 위치에 저장되어 있는 하나의 완벽한 도서관이라고 생각할 수도 있습니다. 만약 당신이 "프랑스의 수도는 어디인가요?" 또는 "파리가 프랑스의 수도인가요?"라고 묻는다면, 당신은 도서관이 항상 똑같은 파일과 똑같은 답변을 주기 위해 같은 선반에서 정확히 같은 파일을 꺼내올 것이라고 기대할 것입니다. 이것이 전통적인 데이터베이스가 작동하는 방식입니다: 하나의 진실, 하나의 출처.
이 논문은 대규모 언어 모델(LLM)—챗봇과 같은 도구 뒤에 있는 AI의 두뇌—이 그 완벽한 도서관처럼 작동하는지 조사합니다. 연구자들인 Amit Elhelo, Amir Globerson, Mor Geva는 그렇지 않다는 것을 발견했습니다.
단일하고 통합된 도서관 대신, AI의 "지식"은 오히려 **특화된, 작업별로 구분된 도구 세트(toolkits)**의 모음과 같습니다. 다음은 그들의 발견을 쉬운 비유를 사용하여 정리한 내용입니다.
1. "서로 다른 도구 세트" 비유
당신에게 스위스 아미 나이프(맥가이버 칼)가 있다고 상상해 보세요. 여기에는 드라이버, 칼날, 코르크 따개가 있습니다.
- 전통적인 관점: 당신은 병을 따는 방법이라는 "지식"이 칼의 한 중앙 부분에 저장되어 있다고 생각할 수 있습니다.
- 논문의 발견: 실제로는 AI가 도구 상자와 같아서, 병을 따라는 요청을 받았을 때만 코르크 따개 부분에 "병을 따는 방법"에 대한 지식이 저장됩니다. 하지만 만약 당신이 "이것은 코르크 따개입니까?"(다른 유형의 질문)라고 묻는다면, AI는 동일한 대상에 대한 질문임에도 불구하고도 완전히 다른 도구 세트를 사용하여 답변합니다.
연구자들은 AI에게 동일한 사실(예: "파리는 프랑스의 수도이다")을 다양한 방식으로 물어보며 이를 테스트했습니다.
- 생성(Generation): "프랑스의 수도는 어디인가요?" (AI가 직접 답을 써야 함).
- 판별(Discrimination): "파리가 프랑스의 수도인가요? 예 또는 아니오." (AI가 선택지를 골라야 함).
그들은 AI가 "쓰기" 작업에 대해서는 그 사실을 학습하지만, "고르기" 작업에 대해서는 그 사실을 "알지" 못하는 경우가 많다는 것을 발견했습니다. 이는 마치 AI에게 서로 소통하지 않는 "쓰기 뇌"와 "고르기 뇌"가 있는 것과 같습니다.
2. "훈련 캠프" 관찰
연구자들은 코치가 학생이 다양한 시험을 위해 공부하는 것을 지켜보는 것처럼, AI가 시간이 지남에 따라 학습하는 과정을 관찰했습니다.
- 기대치: 만약 학생이 쓰기 시험을 위해 "파리는 수도이다"라는 사실을 배웠다면, 그것은 동일한 사실이므로 객관식 시험에서도 즉시 알아야 합니다.
- 현실: 학생은 종종 쓰기 시험은 통과했지만, 며칠 후 객관식 시험에서는 여전히 낙제했습니다. 지식이 서로 다른 형식 간에 "공동 출현(co-emerge)"하지 않았습니다(동시에 나타나지 않았습니다). 이는 AI가 사실을 한 곳에 중앙 집중적으로 저장하는 것이 아니라, 특정 유형의 질문에 대해 그 사실을 처리하는 특정한 방식을 학습한다는 것을 시사합니다.
3. "수술" 실험 (기계론적 분석)
이를 증명하기 위해 연구자들은 AI의 두뇌(내부 파라미터)에 "수술"을 수행했습니다. 그들은 특정 방식으로 질문했을 때 "파리는 수도이다"라는 것을 알고 있는 아주 작고 구체적인 뉴런 그룹을 찾으려 했습니다.
- 결과: 그들은 각 작업에 대한 별도의 뚜렷한 뉴런 그룹을 발견했습니다.
- 만약 "쓰기" 작업에 사용되는 뉴런을 "끄면", AI는 쓰기 질문에 대한 답을 잊어버렸지만 "예/아니오" 질문에는 여전히 완벽하게 답할 수 있었습니다.
- 만약 "예/아니오" 뉴로를 "끄면", AI는 그 테스트에는 실패했지만 답을 쓰는 것은 여전히 할 수 있었습니다.
- 비유: 이것은 같은 문을 여는 두 개의 서로 다른 열쇠를 가진 것과 같습니다. 한 열쇠는 문을 왼쪽에서 밀 때 열리고, 다른 열쇠는 오른쪽에서 당길 때 열립니다. 만약 "밀기" 열쇠를 잃어버린다면, "당기기" 열쇠가 여전히 작동하더라도 그 동작에 대해서는 문이 잠긴 것과 같습니다.
4. "생각의 사슬(Chain of Thought)"의 놀라움
논문은 또한 AI에게 답변하기 전에 "단계별로 생각하라"고 요청하는 "생각의 사슬(CoT)" 추론을 살펴보았습니다.
- 발견: AI에게 소리 내어 생각하도록 요청하면, AI는 이러한 서로 다른 도구 세트들을 혼합하여 사용하는 것처럼 보입니다. 만약 최종 답변을 위한 특정 뉴로를 제거하더라도, AI는 문제를 "생각하며" 풀어나가는 과정에서 평소 직접적인 답변을 할 때는 사용하지 않을 다른 작업별 도구 세트의 지식을 빌려옴으로써 여전히 정답을 맞힐 수 있는 경우가 많습니다.
- 비류: 이것은 보통 단 하나의 단서(직접적인 답변)를 보고 사건을 해결하는 형사와 같습니다. 하지만 만약 그들에게 전체 보고서를 작성하도록 강요한다면, 그들은 다른 파일들을 확인하고 다른 도구 세트들을 교차 참조하기 시작하며, 이를 통해 주요 단서가 없더라도 사건을 해결할 수 있게 됩니다.
핵심 요점
이 논문은 AI를 "지식 베이스"(단일한 진실의 원천)로 보는 개념이 신화라는 결론을 내립니다. 대신, AI가 무엇을 아느냐와 어떻게 질문하느냐는 서로 얽혀 있습니다.
- 신뢰성 리스크: 만약 당신이 AI를 편집하여 한 유형의 질문(예: 객관식 퀴즈)에 대해 특정 사실을 "잊게" 만든다면, 쓰기 프롬프트에 대해서는 여전히 그 사실을 기억할 수도 있습니다.
- 평가 리스크: 만약 당신이 한 가지 유형의 질문으로만 AI를 테스트한다면, 당신은 AI가 어떤 사실을 알고 있다고 생각할 수 있지만, 다른 형식으로 질문했을 때는 완전히 무지할 수도 있습니다.
요약하자면, AI는 단일하고 통합된 기억을 가지고 있지 않습니다. AI는 특정 방식으로 질문하는 것에 맞춰 조정된, 특화된 기억들의 조각 모음(patchwork)을 가지고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.