AI Engram: In Search of Memory Traces in Artificial Intelligence
이 논문은 생물학적 기억 기준을 공식화하여 선형 산술을 통해 심층 신경망 내의 특정 기억 흔적을 식별, 격리 및 외과적으로 조작할 수 있는 'AI 엔그램(AI engrams)'이라는 기하학적 프레임워크를 소개하며, 이를 통해 생물학적 기억 이론과 인공 표현 학습 사이의 간극을 메운다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 복잡한 도서관을 상상해 보세요. 그곳의 모든 책은 숫자로 이루어진 언어로 쓰여 있습니다. 이 도서관은 인공지능(AI)입니다. 이곳에서 지식은 "고양이 사실"이나 "수학 공식"처럼 별도의 라벨이 붙은 상자에 담겨 저장되지 않습니다. 대신, 정보는 거대한 소용돌이치는 스무디처럼 한데 뒤섞여 있습니다. 모든 개별 재료(AI 코드 속의 숫자 하나하나)가 전체 음료의 맛을 만드는 데 기여합니다. 만약 당신이 특정 "딸기" 맛(특정한 기억)만을 골라내고 싶다면, 단순히 딸기만 떠낼 수는 없습니다. 보통은 스무디 전체를 버리고 처음부터 다시 만들거나, 아주 작은 액체 한 방울을 제거하기 위해 추측을 거듭해야 합니다.
이 논문은 AI의 스무디에서 다른 맛을 망치지 않고 특정 "맛"을 찾아내어 제거하는 새로운 방법을 소개합니다. 저자들은 이 특정한 기억의 흔적을 **"AI 엔그램(AI Engrams)"**이라고 부릅니다.
저자들이 사용한 방법은 다음과 같습니다. 이해를 돕기 위해 쉬운 비유를 사용했습니다.
1. 문제점: 얽혀 있는 스무디
생물학에서 과학자들은 오랫동안 뇌의 어디에 특정 기억이 살고 있는지, 즉 '엔그램(enggram)'을 찾아왔습니다. 그들은 기억이 존재한다는 것은 알지만, 뇌세포들이 모두 연결되어 있기 때문에 정확한 위치를 찾는 것이 어렵다는 것을 알고 있습니다.
AI에서도 이는 훨씬 더 어렵습니다. AI의 "두뇌"는 거대한 숫자 격자입니다. AI가 어떤 사진을 보고 "고양이"라고 학습할 때, 단순히 스위치 하나를 켜는 것이 아닙니다. AI는 수백만 개의 숫자를 동시에 미세하게 조정하며, 그 숫자들은 또한 AI가 "개"나 "자동차"를 인식하는 데에도 도움을 줍니다. 즉, 기억들은 얽혀(entangled) 있습니다.
2. 해결책: "외과적 필터"
저자들은 외과적 필터 역할을 하는 수학적 도구를 만들었습니다. AI를 천천히 미세 조정하는 방식(시간이 오래 걸리고 종종 오류를 일으키는 방식) 대신, 이들은 단 한 번의 단계로 특정 "딸기" 맛을 분리해 내는 수학 공식을 사용합니다.
이들은 신경과학의 네 가지 규칙을 바탕으로 했습니다:
- 특이성(Specificity): 기억은 "개"가 아닌 오직 "고양이"에 관한 것이어야 합니다.
- 재활성화(Reactivation): 만약 이 기억을 찾아낸다면, AI가 고양이를 다시 "기억"하게 할 수 있어야 합니다.
- 충분성(Sufficiency): 이 기억을 빈 AI에 넣는다면, 그 AI는 즉시 고양이가 무엇인지 알게 되어야 합니다.
- 필요성(Necessity): 만약 이 기억을 제거한다면, AI는 고양이는 잊어버리되 다른 모든 것은 여전히 기억해야 합니다.
3. 작동 원리: "그림자" 비유
그림자 인형극을 상상해 보세요. 빛(AI의 현재 지식)은 복잡합니다. 저자들은 만약 특정 "필터"(AI가 학습한 데이터에 기반한 수학 공식)를 통해 빛을 통과시킨다면, 단 하나의 인형 그림자만을 분리해 낼 수 있다는 것을 깨달았습니다.
- 기존 방식: 인형 하나를 없애기 위해 무대 전체의 조명을 어둡게 만들어, 다른 인형들은 그대로 둔 채 그 인형의 그림자만 흐릿해지기를 바라는 방식입니다. 이는 지저도하고 느립니다.
- 새로운 방식 (엔그램): 단순한 수학적 트릭을 사용하여 "고양이" 그림자의 정확한 형태를 계산합니다. 그런 다음, 전체 빛에서 그 정확한 형태를 뺍니다. "고양이" 그림자는 사라지지만, "개"와 "자동차"의 그림자는 완벽하게 선명하게 남습니다.
4. "선형 산술"의 마법
그들의 발견 중 가장 놀라운 부분은 이 기억들이 수학적인 **벡터(vectors, 화살표)**처럼 행동한다는 점입니다.
- 기억을 더할 수 있습니다: 만약 "안경"이라는 기억과 "수염"이라는 기억이 있다면, 이 둘을 더해 "안경을 쓴 수염 난 사람"을 인식하는 AI를 만들 수 있습니다.
- 기억을 뺄 수 있습니다: "수염" 부분은 건드리지 않고 "안경" 부분만 빼낼 수 있습니다.
- 이 모든 과정은 AI를 다시 학습시키거나 복잡한 컴퓨터 시뮬레이션을 돌릴 필요 없이, 단순한 덧셈과 뺄셈만으로 즉각적으로 수행할 수 있습니다.
5. 이론 검증
저자들은 이 이론을 다양한 유형의 AI에 대해 테스트했습니다:
- 단순한 AI: 동물 사진으로 학습된 AI에서 "고양이" 개념을 제거했습니다. AI는 고양이는 잊었지만 개와 자동차는 여전히 알고 있었습니다.
- 복잡한 AI (LLM): 대규모 언어 모델(챗봇 같은 것)에 이 방법을 적용하여, 모델이 암기한 특정 사실을 "잊게" 할 수 있는지 확인했습니다. 그 결과, 이러한 사실들의 "기억"이 AI 코드의 특정 부분(특히 주의 집중(attention)과 논리를 처리하는 부분)에 집중되어 있음을 발견했습니다. 그 부분만을 정밀하게 타격함으로써, AI의 언어 능력이나 추론 능력은 유지하면서도 특정 사실을 잊게 만들 수 있었습니다.
6. 왜 빠른가?
AI에게 무언가를 "잊게" 만드는 대부분의 방법은 정보를 잊기 위해 AI를 수천 번의 연습 과정(마치 시험 공부를 하는 것처럼)을 거치게 해야 합니다. 이는 많은 시간과 컴퓨터 자원을 소모합니다.
"엔그램" 방식은 마치 **치트 키(cheat sheet)**를 가진 것과 같습니다. 정확한 수학 공식을 찾아냈기 때문에, 단 한 단계만으로 기억을 제거할 수 있습니다. 강력한 컴퓨터를 사용했을 때 약 2분 정도밖에 걸리지 않으며, 다른 방법들은 몇 시간 또는 며칠이 걸릴 수도 있습니다.
요약
이 논문은 우리가 이제 인간의 기억을 편집할 수 있다거나 AI가 갑자기 의식을 갖게 된다는 것을 말하는 것이 아닙니다. 단지 이것을 말하고 있습니다: 우리는 AI의 코드 내부에서 특정 기억의 위치를 찾아내고, 나머지 부분을 망가뜨리지 않으면서 단순한 수학을 이용해 이를 제거하는 방법을 찾아냈습니다.
이 연구는 생물학적 기억이 어떻게 작동하는지에 대한 우리의 생각(특정하고 식별 가능한 단위로서의 기억)과 AI가 실제로 정보를 저장하는 방식 사이의 간극을 메우며, 복잡하게 얽힌 디지털 두뇌 속에서도 전체 스웨터를 풀지 않고도 단 하나의 실타래를 정교하게 뽑아낼 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.