← 최신 논문
💬 NLP

Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models

본 논문은 언어 모델 내의 기억 내부 지식 충돌에 대한 기계론적 연구를 제시하며, 이러한 충돌이 보편적인 메커니즘보다는 별도의 회로를 통해 주로 마지막 레이어에서 해결된다는 점과, 특화된 어텐션 헤드 분포의 차이로 인해 실제 세계의 충돌에 대한 개입이 합성 데이터 기반의 충돌에 비해 현저히 덜 효과적이라는 점을 밝힌다.

원저자: Minh Vu Pham, Hsuvas Borkakoty, Yufang Hou

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Minh Vu Pham, Hsuvas Borkakoty, Yufang Hou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 디지털 뇌를 상상해 보세요. 이 뇌는 인터넷에 있는 거의 모든 것을 읽었습니다. 거대 언어 모델(LLM)로 알려진 이 뇌는 질문에 답하고, 이야기를 쓰고, 문제를 해결할 수 있는 초스마트 사서와 같습니다. 하지만 여기에는 함정이 있습니다. 때때로 이 사서는 혼란에 빠집니다. 만약 당신이 "닐스는 어디로 학교를 다녔나요?"라고 묻는다면, 사서는 두 가지 서로 다른 답변을 동시에 기억할 수도 있습니다. 어떤 부분의 기억은 "A 대학교"라고 말하는 반면, 다른 부분은 "B 대학교"라고 주장할 수도 있습니다. 이것은 사서가 새로운 책(외부 정보)을 보고 있기 때문이 아니라, 사서 자신의 내부 노트가 엉망이기 때문입니다. 과학자들은 이를 "내적 지식 충돌(intra-memory knowledge conflict)"이라고 부릅니다. 이는 마치 같은 공책에 같은 이야기의 서로 다른 두 버전을 적어 놓아서, 사서가 어떤 것을 소리 내어 읽어야 할지 모르는 것과 비슷합니다. 이것은 매우 중요한 문제입니다. 왜냐하면 이 AI 시스템들이 현실 세계의 과업들을 신뢰받게 되려면, 환각을 일으키거나 모순된 답변을 내놓는 것을 멈춰야 하기 때문입니다. 연구자들은 알고 싶어 합니다: 정확히 이 디지털 뇌의 어디에서 이 혼란이 발생하는지, 그리고 혼동을 일으키는 특정 부분을 고칠 수 있는지 말입니다.

"지식이 충돌하는 곳(Where Knowledge Collides)"이라는 제목의 이 논문은 이러한 AI 뇌의 내부 작동 방식을 깊이 파고들어 혼란의 근원을 찾아냅니다. 저자들은 네 가지 서로 다른 AI 모델을 사용하여 특별한 테스트 환경을 구축했습니다. 그들은 의도적으로 상충하는 사실들을 심어 놓은 가짜 전기(존재하지 않는 사람들을 위한 가짜 위키피디아 페이지라고 생각하면 됩니다) 데이터셋을 만들었습니다. 예를 들어, 그들은 가상의 인물인 "닐스 카발리"가 "우코프눔 대학교"를 졸업했다고 말하면서도, 동시에 동일한 닐스가 "오프그르그르 대학교"를 졸업했다고 AI에게 말했습니다. 이렇게 뒤섞인 이야기들로 AI를 학습시킴으로써, 그들은 모델이 머릿속에 두 가지 상반된 사실을 동시에 보유해야만 하는 통제된 환경을 만들었습니다.

무슨 일이 일어나고 있는지 알아내기 위해, 연구자들은 "기계적 해석 가능성(mechanistic interpretability)"이라는 기법을 사용했습니다. AI를 아래층에서 위층으로 정보가 흐르는 다층 공장이라고 상상해 보세요. 각 층에는 일꾼들(레이어라고 불림)이 있고, 각 층 안에는 서로 다른 업무를 처리하는 특정 팀들(어텐션 헤드라고 불림)이 있습니다. 연구자들은 "로짓 렌즈(logit lens)"라는 도구를 사용하여 공장의 모든 층을 들여다보며, AI가 질문을 처리함에 따라 확신도가 어떻게 변하는지 관찰했습니다. 그들은 매우 일관된 사실을 발견했습니다: 혼란은 공장의 시작 부분이나 중간에서 발생하는 것이 아니었습니다. 대신, 충돌은 항상 마지막 몇 개의 레이어에서 터져 나왔습니다. 이는 마치 AI가 대부분의 시간을 사실을 수집하는 데 보내지만, 말을 하기 직전인 바로 마지막 단계에서 두 가지 상충하는 기억이 서로 충돌하여 모델을 흔들고 불확실하게 만드는 것과 같습니다.

연구팀은 AI를 "패치(patching)"함으로써 문제를 해결하려고 시도했습니다. 이것은 공장 안으로 손을 뻗어 특정 팀의 작업물을 정답을 알고 있는 팀의 작업물로 교체하는 것과 같습니다. 그들은 두 가지 주요 접근 방식, 즉 전체 층을 고치는 방식(레이어 단위 개입)과 하나의 특정 팀만을 고치는 방식(헤드 단위 개입)을 시도했습니다. 결과는 명확했습니다: 전체 층을 고치는 것도 괜찮았지만, 특정 팀을 고치는 것이 훨씬 더 좋았습니다. 실제로, 잘못된 사실을 담당하는 특정 "어텐션 헤드"를 타겟팅함으로써 그들은 AI를 높은 성공률로 정답으로 유도할 수 있었습니다. 그들은 심지어 자신들의 가짜, 통제된 세계 안에서 하나의 특정 사실만을 신경 쓰는 "전문가" 헤드들이 존재한다는 것을 발견했습니다. 그러나 이 방법을 실제 세상의 데이터(실제 인간의 지식이 뒤섞인 DynamicQA 데이터셋)에 적용했을 때는 효과가 덜했습니다. 이는 실제 세계의 충돌은 실험실에서 만든 깨끗한 합성 데이터보다 더 얽혀 있고 풀어내기 어렵다는 것을 시사합니다.

이 논문이 반박하는 가장 흥-미로운 점 중 하나는 "보편적 회로(universal circuit)"라는 개념입니다. 당신은 모든 AI 모델이 모든 지식 충돌을 처리하는 전용 스위치나 경로, 즉 "갈등 해결 버튼" 같은 것을 가지고 있을 것이라고 생각할 수도 있습니다. 저자들은 이것이 아마도 사실이 아닐 것이라고 제안합니다. 대신, 그들의 연구 결과는 서로 다른 지식 조각들이 서로 다른 별개의 회로에 저장되어 있다는 아이디어를 가리킵니다. AI가 내놓는 최종 답변은 당신의 질문으로부터 어떤 경쟁적인 회로가 더 강력한 신호를 받느냐에 달려 있습니다. 단 하나의 "갈등 관리자"가 있는 것이 아니라, 그것은 마치 서로 다른 작업자 그룹 간의 줄다리기와 같으며, 가장 세게 잡아당기는 쪽이 승리하는 것입니다.

연구자들은 또한 모델 중 하나인 GPT-2 XL이 다른 모델들보다 고치기 어려웠다는 점에 주목했습니다. 그들은 이것이 모델이 고장 났기 때문이 아니라, 단지 더 크기 때문이라고 판단했습니다. 이 모델은 훨씬 더 많은 "일꾼들(어텐션 헤드)"을 가지고 있었기에, 작은 모델들과 같은 결과를 보기 위해서는 더 많은 수를 고쳐야 했습니다. 이는 작은 마을의 교통 체증을 해결하는 것과 거대한 도시의 교통 체증을 해결하는 것의 차이와 같습니다. 도시에서는 동일한 흐름을 만들기 위해 더 많은 차를 치워야 합니다.

결국, 이 연구는 이러한 내부적 충돌이 어디에서 발생하는지에 대한 우리의 첫 번째 실제 지도를 제공합니다. 이 연구는 이러한 충돌이 AI의 사고 과정의 결승선 바로 직전에서 발생한다는 것을 알려줍니다. 비록 우리가 아직 무질서한 실제 세계의 이러한 충돌을 완벽하게 고칠 수는 없지만, 이 논문은 잘못된 사실을 담당하는 작고 구체적인 팀들을 타겟팅함으로써 우리가 AI 시스템을 더 신뢰할 수 있게 만들 수 있음을 시사합니다. 이는 AI가 단순히 똑똑하게 들리는 것을 넘어, 실제로 자신이 말하는 바를 제대로 알게 만드는 데 있어 중요한 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →