Factual Retrieval in LLMs Is a Redundant, Distributed and Non-Contiguous Process
이 논문은 거대 언어 모델의 사실적 정보 검색이 여러 층에 걸쳐 중복되고 분산되며 비연속적인 계산 경로에 의존한다는 점을 밝힘으로써, 지식 저장의 국소성 가설에 도전하고 지식 편집에서 관찰되는 불일치 현상을 설명한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델(LLM)을 세상의 모든 지식이 담긴 아주 작은 조각들이 들어있는 수많은 층으로 이루어진 거대한 도서관이라고 상상해 보세요. 오랫동안 연구자들은 만약 "앙겔라 메르켈의 모국어는 무엇인가?"와 같은 특정 사실을 찾고 싶다면, 그 답이 모델의 특정 층(특정 레이어)이라는 특정 방에 저장되어 있고, 1층부터 꼭대기 층까지 직선 형태로 검색될 것이라고 생각했습니다.
이 논문은 현실이 훨씬 더 혼란스럽고, 유연하며, 중복적이라고 주장합니다. 다음은 이들의 발견을 쉬운 비유를 통해 정리한 내용입니다.
1. "비연속적인" 엘리베이터 탑승
기존의 생각: 정보를 얻기 위해 모델의 내부 "엘리베이터"(데이터 처리 과정)가 지면에서 꼭대기 층까지 모든 층에 멈춰 서서 각 단계마다 정보를 확인한다고 생각했습니다.
논문의 발견: 엘리베이터는 모든 층에 멈추지 않습니다. 실제로 모델은 종종 층을 통째로 건너뜁니다.
- 비유: 택배 배달을 한다고 상상해 보세요. 배달 트럭이 거리의 모든 집마다 멈출 필요는 없습니다. 때때로 트럭은 2층에서 바로 8층으로 점프하여 중간 층들을 무시하고도 올바른 문 앞까지 택배를 전달할 수 있습니다.
- 발견 내용: 저자들은 하나의 사실을 인출하기 위해 모델이 특정하고 흩어져 있는 레이어들만 필요하다는 것을 발견했습니다. 모델은 특정 사실을 위해 불필요하다고 판명된 중간 단계들을 건너뛰고, 네트워크를 통해 정보를 "순간이동" 시킬 수 있습니다.
2. "중복된 백업 경로"
기 기존의 생각: 사실을 찾기 위한 단 하나의 "올바른" 경로가 존재합니다. 만약 그 경로를 차단하면 모델은 실패합니다.
논문의 발견: 모델에는 똑같이 작동하는 여러 개의 백업 경로가 있습니다.
- 비유: 고속도로가 있는 도시를 생각해 보세요. 만약 고속도로를 막더라도 교통이 멈추지는 않습니다. 대신 즉시 복잡한 뒷길, 골목길, 심지어는 더 길고 구불구불한 다른 고속도로로 우회합니다. 두 경로 모두 목적지에 도달하지만, 모습은 완전히 다릅니다.
- 발견 내용: 연구진은 테스트한 거의 모든 사실에 대해 "주 경로"(가장 짧고 효율적인 경로)와 적어도 하나 이상의 "대체 경로"(더 길고 깊은 경로)를 발견했습니다. 주 경로를 차단하더라도 모델은 백업 경로를 사용하여 답을 찾을 수 있습니다. 이는 지식이 단 한 곳에 저장된 것이 아니라, 분산되어 있고 중복되어 있음을 의미합니다.
3. "최소한의 팀" 대 "전체 오케스트라"
기존의 생각: 모델 전체가 협력하여 모든 답을 생성합니다.
논문의 발견: 일을 수행하기 위해서는 특정 소수의 팀만 필요합니다.
- 비유: 교향악단이 곡을 연주하고 있다고 상상해 보세요. 당신은 모든 연주자가 모든 음표를 연주하는 데 필요하다고 가정할 수 있습니다. 하지만 저자들은 특정 사실에 대해서는 오직 몇몇 특정 연주자(레이어)들만이 실제로 음표를 연주한다는 것을 발견했습니다. 나머지 오케스트라는 본질적으로 침묵하거나 다른 일을 하고 있습니다.
- 발견 내용: 그들은 "최소 속성 계산 경로(minimal attribute computation path)"를 식별했습니다. 이것은 올바른 답을 만들어내는 데 필요한 가장 작은 레이어 그룹입니다. 놀랍게도 이 그룹은 종종 모델의 중간에서 끝납니다. 정보가 이 몇몇 레이어들에 의해 처리되고 나면, 나머지 모델은 답을 알기 위해 더 이상의 무거운 작업을 수행할 필요가 없습니다.
4. "편집 불일치"의 미스터리
기존의 생각: 모델의 사실을 바꾸고 싶다면(예: "메르켈의 언어는 독일어이다"를 "프랑스어이다"로 변경), 그 사실이 저장된 특정 레이어를 수정해야 합니다.
논문의 발견: 사실이 "저장된" 곳과 수정해야 할 "편집" 지점은 종-종 서로 다른 곳에 있습니다.
- 비유: 공장의 조립 라인을 상상해 보세요. 제품을 만드는 부분은 라인의 시작 부분에 있을 수 있지만, 실수를 수정하는 부분은 라인의 맨 끝에 있을 수 있습니다. 만약 시작 부분에서 제품을 고치려 한다면, 기계를 망가뜨릴 수도 있습니다.
- 발견 내용: 모델은 이러한 흩어져 있고 중복된 경로를 사용하기 때문에, 단순히 데이터가 "답처럼 보이는" 레이어를 찾는 것만으로는 충분하지 않습니다. 사실을 성공적으로 편집하려면, 반드시 지식이 놓여 있는 곳이 아니라 특정 "변환 단계(transformation stage)"에서 개입해야 하는 경우가 많습니다.
"큰 그림" 요약
저자들은 LLM이 사실을 저장하고 인출하는 방식이 서랍 하나를 꺼내는 파일 캐비닛과 같지 않다고 결론짓습니다. 대신, 다음과 같은 매우 유연하고 중복적인 신경망과 같습니다:
- 지식은 분산되어 있다: 지식은 한 곳에 잠겨 있는 것이 아니라 여러 레이어에 퍼져 있습니다.
- 경로는 유연하다: 모델은 동일한 답을 찾기 위해 짧고 직접적인 경로를 택하거나, 길고 구불구불한 백업 경로를 택할 수 있습니다.
- 건너뛰기는 정상이다: 모델은 종종 중간 레이어들을 무시하고, 정보가 필요한 곳으로 바로 점프합니다.
이는 왜 AI 모델이 매우 견고한지(백업이 있기 때문), 동시에 왜 특정 사실이 정확히 "어디에" 사는지 혹은 어떻게 안정적으로 변경할 수 있는지 파악하기가 그토록 어려운지를 설명해 줍니다. 그 과정은 비선형적이고 흩어진 방식으로 일어나는 복잡하고 다단계적인 춤과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.