← 최신 논문
💻 computer science

Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models

이 논문은 언어 모델이 사실적 질문에 답할 때 개체 (entity) 를 선택하는 특정 MLP 뉴런이 초기 레이어에 국한되어 있으며, 이를 인과적 개입을 통해 조작함으로써 개체 기반 사실 회수를 유도하거나 망각시킬 수 있음을 규명했습니다.

원저자: Itay Yona, Dan Barzilay, Michael Karasik, Mor Geva

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Itay Yona, Dan Barzilay, Michael Karasik, Mor Geva

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 1. 핵심 아이디어: "할머니 세포 (Grandmother Cell)"의 등장

우리는 뇌과학에서 **"할머니 세포"**라는 가설을 들어본 적이 있습니다. "어떤 사람의 얼굴을 보면 뇌의 특정 세포 하나만 켜져서 그 사람이 누구인지 바로 알아챈다"는 이론이죠.

이 연구는 **"인공지능도 비슷한가?"**를 묻습니다.

  • 질문: "바락 오바마"라는 단어를 입력했을 때, AI 의 두뇌 (신경망) 속에서 딱 하나의 스위치가 켜져서 오바마에 대한 모든 정보를 불러오는 걸까요? 아니면 정보가 여러 층에 걸쳐 퍼져서 서서히 만들어지는 걸까요?

🔍 2. 연구 방법: "디지털 탐정"의 작업

연구팀은 200 개의 유명 인물과 장소 (예: 오바마, 파리, FBI 등) 를 대상으로 AI 를 조사했습니다.

  1. 찾아내기 (국소화): AI 가 "오바마의 출생지는?"이라는 질문을 받을 때, 어떤 부분에서 가장 활발하게 반응하는지 찾아냈습니다.
  2. 실험 (개입): 찾은 그 '특정 스위치'를 끄거나 (삭제), 강제로 켜서 (주입) AI 의 반응을 관찰했습니다.

🎯 3. 놀라운 발견 (Qwen2.5-7B 모델 기준)

이 연구는 Qwen2.5-7B라는 모델에서 가장 뚜렷한 결과를 얻었습니다.

📍 발견 1: 기억은 '초반'에 모여있다

  • 비유: AI 의 두뇌는 28 층짜리 빌딩이라고 상상해 보세요. 보통은 정보가 1 층부터 28 층까지 올라가며 정교해지리라 생각하지만, 이 연구는 **1 층~5 층 (초반 층)**에 오바마나 파리에 대한 '핵심 기억'이 이미 모여 있다는 것을 발견했습니다.
  • 의미: AI 는 정보를 처음 접하자마자 "아, 이건 오바마구나!"라고 바로 인식하고 그 정체성을 확정 짓는 것 같습니다.

🚫 발견 2: 스위치를 끄면 '기억 상실'이 온다 (인과성 확인)

  • 실험: 찾은 그 '특정 스위치'를 강제로 끄고 (음수 배수) 질문을 던졌습니다.
  • 결과: AI 는 문장을 자연스럽게 이어가지만, 오바마에 대한 사실은 완전히 잊어버렸습니다. 마치 오바마라는 사람이 존재하지 않는 것처럼 대답했습니다. 하지만 다른 사람 (예: 트럼프) 에 대한 기억은 그대로였습니다.
  • 비유: 오바마 관련 정보만 들어있는 '특정 서랍'을 잠그니, 그 서랍의 내용만 사라진 셈입니다.

🔌 발견 3: 스위치 하나만 켜도 기억이 돌아온다

  • 실험: 질문에서 오바마라는 이름을 지우고 'X'로 대체한 뒤, 그 '특정 스위치'만 강제로 켜주었습니다.
  • 결과: 이름이 없는데도 AI 가 **"오바마의 배우자는 미셸입니다"**라고 정답을 맞췄습니다.
  • 비유: 이름이 적힌 책 표지가 없어도, 그 책의 '핵심 내용'을 담고 있는 스위치 하나만 누르면 책의 내용이 바로 떠오르는 것과 같습니다.

🌍 발견 4: 이름이 바뀌어도 같은 스위치가 켜진다

  • 실험: "Barack Obama", "Obaama"(오타), "FBI"(약자), "파리(중국어/히브리어)" 등 표기가 달라도 같은 스위치가 켜지는지 확인했습니다.
  • 결과: 네, 똑같은 스위치가 켜졌습니다.
  • 의미: AI 는 단순히 '단어'를 외우는 게 아니라, 그 단어 뒤에 숨겨진 **'실체 (정체성)'**를 인식하고 있다는 뜻입니다.

⚠️ 4. 한계점: 모든 모델이 똑같은 것은 아님

이런 현상은 Qwen2.5 모델에서는 매우 뚜렷했지만, 다른 모델 (Llama, Mistral 등) 에서는 덜 명확하거나 아예 찾기 어려웠습니다.

  • 비유: 어떤 도서관은 책이 정해진 서랍에 깔끔하게 정리되어 있지만, 다른 도서관은 책이 여기저기 흩어져 있거나 정리 방식이 다를 수 있다는 뜻입니다.

💡 5. 결론: 왜 이 연구가 중요한가요?

이 연구는 AI 가 사실을 기억하는 방식이 **"점점 쌓아 올리는 과정"**이 아니라, **"특정 핵심 스위치를 통해 바로 꺼내 쓰는 방식"**일 수 있음을 보여줍니다.

  • 실용적 가치: 만약 우리가 AI 의 특정 '기억 스위치'를 정확히 알고 있다면, AI 가 잘못된 정보를 말했을 때 그 스위치만 고쳐서 수정할 수 있거나, 특정 정보를 의도적으로 지울 수도 있게 됩니다.
  • 요약: AI 의 두뇌 속에는 '할머니 세포'처럼, 특정 대상을 대표하는 아주 작고 강력한 스위치들이 존재할 수 있습니다. 이 스위치를 찾으면 AI 의 기억을 더 잘 이해하고 조절할 수 있게 됩니다.

이 연구는 AI 가 어떻게 '생각'하는지 그 내부 작동 원리를 밝히는 중요한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →