Decomposing Prediction Mechanisms for In-Context Recall
이 논문은 트랜스포머 모델이 서로 다른 학습 역학을 가진 두 가지 구별된 메커니즘, 즉 연속적인 시퀀스를 위한 초기 출현형 레이블 불가지론적 "베이지안 스타일" 예측기와 특정 이전 상태를 회상하고 재개하기 위한 후기 출현형 레이블 의존적 메커니즘을 사용한다는 것을 입증하기 위해 연속적 인컨텍스트 러닝과 이산적 연상 회상을 결합한 새로운 토이 문제를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 모델 안의 두 가지 서로 다른 뇌
여러분에게 아주 똑똑한 로봇 비서가 있다고 상상해 보세요. 여러분은 이 로봇에게 다양한 사람들의 이야기가 담긴 공책을 줍니다 (이들을 "시스템"이라고 불러봅시다). 어떤 이야기는 앨리스에 관한 것이고, 어떤 것은 밥, 또 어떤 것은 찰리에 관한 것입니다. 이 공책은 특별한 색깔의 괄호를 사용하여 이야기가 앨리스에서 밥으로, 혹은 밥에서 찰리로 언제 바뀌는지 로봇에게 알려줍니다.
로봇의 임무는 이야기를 읽고 다음에 무슨 일이 일어날지 예측하는 것입니다. 연구진은 로봇이 이 일을 어떻게 학습하는지 알아보고 싶었습니다. 그들은 놀라운 사실을 발견했습니다. 로봇은 단 하나의 방식으로 생각하지 않습니다. 다음에 올 단어가 무엇인지에 따라 완전히 다른 두 가지 "모드" 또는 "뇌"를 사용합니다.
설정: "건초더미" 게임
이를 테스트하기 위해 연구진은 "건초더미 속 바늘 찾기(Needle in a Haystack)"라는 게임을 만들었습니다.
- 건초더미: 뒤섞인 이야기 조각들의 긴 목록입니다. 한순간에는 앨리스의 이야기였다가, 다음에는 밥의 이야기, 그다음에는 다시 앨리스, 그다음에는 찰리의 이야기로 바뀝니다.
- 라벨(Labels): 각 이야기 조각은 고유한 "열기(Open)" 라벨(예: 빨간색 괄호
[)로 시작해서 "닫기(Close)" 라벨(예: 빨간색 괄호])로 끝납니다. - 테스트: 로봇은 건초더미 전체를 읽습니다. 그 후, 연구진은 특정 "열기" 라벨(예: "밥의 괄호")을 보여주며 "밥의 이야기 다음에 올 내용은 무엇인가요?"라고 묻습니다.
두 가지 "뇌" (메커니즘)
연구 결과, 로봇은 훈련 과정 중 서로 다른 시점에 활성화되는 두 가지 뚜렷한 방법을 사용하여 이 퍼즐을 해결한다는 것을 발견했습니다.
1. "라벨 판독기" (첫 번째 뇌)
- 활성화 시점: 이 뇌는 로봇 훈련의 후반부에 깨어납니다.
- 작동 방식: 이 뇌는 "열기" 라벨(빨간색 괄호)을 보고 이렇게 말합니다. "아, 이건 밥의 이야기구나! 아까 공책에서 밥의 규칙을 기억했었지." 그러고 나서 이 특정 규칙들을 사용하여 새로운 세그먼트의 첫 번째 단어를 예측합니다.
- 비유: 파티에 있다고 상상해 보세요. 당신은 "밥"이라고 적힌 이름표를 봅니다. 당신은 즉시 "아, 밥은 항상 농담을 하지"라고 기억합니다. 당신은 이 기억을 사용해 밥의 첫 문장을 예측합니다. 이것이 **연상 회상(Associative Recall)**입니다.
2. "패턴 추종자" (두 번째 뇌)
- 활성화 시점: 이 뇌는 훈련 초반부에 깨어납니다.
- 작동 방식: 이 뇌는 이름표를 거의 무시합니다. 대신, 방금 읽은 마지막 몇 단어를 보고 이렇게 말합니다. "방금 읽은 단어들의 패턴을 보니, 다음 단어는 X가 되어야 해." 이 뇌는 최근의 이력을 바탕으로 확률을 계산하는 "베이지안(Bayesian)" 스타일의 추측을 사용합니다.
- 비유: 당신은 길을 걷고 있습니다. 다음에 무엇을 할지 예측하기 위해 굳이 그 사람의 이름을 알 필요는 없습니다. 그저 그 사람의 발걸음을 관찰하면 됩니다. 만약 그들이 빠르게 걷고 있다면, 당신은 그들이 계속 빠르게 걸을 것이라고 추측합니다. 이것이 **패턴 예측(Pattern Prediction)**입니다.
놀라운 발견: 두 뇌는 동시에 작동하지 않는다
가장 중요한 발견은 이 두 뇌가 서로 다른 속도로 발달하며, 로봇의 서로 다른 "배선"을 사용한다는 점입니다.
- 패턴 추종자 (두 번째 뇌)가 먼저 배웁니다. 로봇은 훈련 아주 초기부터 이야기의 두 번째, 세 번째, 네 번째 단어를 예측하는 데 매우 능숙해집니다. 로봇은 라벨을 무시하고 오직 직전의 단어들만 보고 이 일을 수행합니다.
- 라벨 판독기 (첫 번째 뇌)는 나중에 배웁니다. 로봇이 "열기" 라벨이 새로운 이야기의 첫 번째 단어를 여는 열쇠라는 것을 배우는 데는 오랜 시간이 걸립니다.
"상전이(Phase Transition)":
전등 스위치를 상상해 보세요. 오랫동안 로봇은 라벨 뒤의 첫 번째 단어를 예측하는 데 서툴렀습니다. 그러다 어느 순간, 훈련의 특정 지점에서 갑자기 스위치를 올리듯 완벽하게 예측하기 시작합니다. 하지만 두 번째 단어를 예측하는 능력은 이미 한참 전부터 매끄럽게 작동하고 있었습니다.
어떻게 증명했나 (실험)
연구진은 로봇이 어떤 뇌를 사용하고 있는지 알아내기 위해 로봇에게 속임수를 썼습니다.
"잘못된 라벨" 속임수: 로봇에게 "밥"의 라벨을 보여주었지만, 실제 내용은 "찰리"의 이야기였습니다.
- 결과: 로봇은 첫 번째 단어를 예측하는 데 실패했습니다 (잘못된 라벨을 믿었기 때문입니다). 하지만, 두 번째 단어를 예측하는 데는 여전히 유능했습니다 (단순히 눈앞의 단어 패턴을 따랐기 때문입니다).
- 결론: 첫 번째 단어는 라벨에 의존하고, 두 번째 단어는 패턴에 의존합니다.
"혼란스러운 라벨" 속임수: 공책에 존재하지 않는 이야기의 라벨을 보여주었습니다.
- 결과: 처음에는 로봇이 가짜 라벨을 무시하고 현재 진행 중인 이야기를 계속 예측했습니다. 하지만 훈련이 진행되어 "라벨 판독기" 뇌가 깨어나자, 로봇은 혼란에 빠져 틀린 내용임에도 불구하고 가짜 라벨을 바탕으로 새로운 이야기를 시작하려고 했습니다.
- 결론: 로봇은 라벨이 엉터리일 때조차도 라벨을 너무 과하게 신뢰하도록 학습되었습니다.
"회로 차단기" 테스트: 연구진은 로봇의 신경망 일부를 물리적으로 "가지치기(Pruning)" 했습니다.
- 결과: 첫 번째 단어를 예측하는 데 사용되는 전선과 두 번째 단어를 예측하는 데 사용되는 전선이 완전히 다르다는 것을 발견했습니다. 이들은 하나의 몸 안에서 작동하는 두 개의 별개 기계입니다.
이것이 실제 AI에서도 일어나는가?
연구진은 이 "두 가지 뇌" 현상이 실제 거대 언어 모델(번역 등에 사용되는 모델)에서도 발생하는지 확인했습니다. 그들은 동일한 현상을 발견했습니다.
- 모델은 프롬프트에 따라 번역을 시작하는 것(첫 번째 단어 예측)보다 번역을 계속 이어가는 것(두 번째 단어 예측)을 먼저 잘하게 됩니다.
- 이는 우리가 사용하는 가장 진보된 AI 모델들조차 하나의 작업을 해결하기 위해 여러 개의 분리된 전략을 조율하며 사용하고 있음을 시사합니다.
요약
이 논문은 AI가 문맥으로부터 정보를 회상할 때, 단순히 "기억"하는 것이 아니라는 점을 보여줍니다. AI는 새로운 작업을 시작하기 위한 라벨 기반 전략(학습하는 데 오랜 시간이 걸림)과 작업을 계속 이어가기 위한 패턴 기반 전략(빠르게 학습함)을 사용합니다. 이 두 전략은 너무나 달라서 AI의 뇌 속 서로 다른 부분에 살고 있으며, 서로 다른 시점에 활성화됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.