Deep Learning Models Also Recall Features
이 논문은 선형 투영이 입력 활성화에 의해 스케일링된 저장된 정보를 검색하는 딥러닝 모델의 일반적인 연산으로서 '특징 회상(feature recall)'이라는 개념을 도입하며, 이는 기존의 특징 결합 패러다임과 대조되는 기계론적 해석 가능성과 철학적 이해를 위한 새로운 프레임워크를 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 강력한 엔진인 딥러닝 모델은 종종 단순한 패턴을 쌓아 올려 복잡한 아이디어를 학습하는 거대한 네트워크로 묘사되곤 한다. 수년 동안 과학자들은 '특징 결합(feature combination)'이라는 특정한 관점을 통해 이러한 시스템을 이해해 왔다. 이 관점에서 신경망은 기초적인 구성 요소—예를 들어 이미지 속의 가장자리나 문장 속의 단순한 소리—를 가져와 얼굴이나 단어와 같은 고차원적인 개념으로 계층적으로 조립하는 건설 현장과 같은 역할을 한다. 이 프레임워크는 기계가 어떻게 패턴을 인식하는지 설명하는 데 매우 유용했는데, 마치 아이가 귀를 먼저 알아보고, 그다음 털을, 마지막으로 동물 전체를 인식하며 고양이를 식별하는 법을 배우는 것과 유사하다. 그러나 이 관점은 모델이 단순히 패턴을 인식하는 것을 넘어, 마치 허공에서 특정한 세부 사실을 끄집어내는 듯한 순간들을 설명하는 데 어려움을 겪는다. 대규모 언어 모델에게 유명 인사의 전기를 써달라고 요청할 때, 그 답은 질문 속에 조립되기를 기다리며 숨겨져 있는 것이 아니라, 모델이 저장된 기억을 검색하는 것처럼 보이기 때문이다. 피에르 베크만(Pierre-Ewen Beckmann)의 새로운 논문은 이러한 검색이 패턴 조립이라는 규칙의 예외가 아니라, 간과되어 온 근본적이고 구별되는 연산이라고 주장한다. 베크만은 '특징 회상(feature recall)'이라는 새로운 개념을 제안하며, 딥러닝 모델이 단순히 입력을 결합하는 것을 넘어, 하나의 트리거에 기반해 저장된 정보를 검색하는 도서관처럼 작동한다고 제안한다.
논문은 이러한 모델들이 사실을 어떻게 처리하는지를 조사하는 것으로 시작하는데, 이는 최근 연구에서 이미 관찰되었으나 기존의 프레임워크로는 완전히 설명되지 않은 현상이다. 이 메커니즘을 이해하려면 모델의 내부 작업 공간인 '잔차 스트림(residual stream)'을 살펴보아야 한다. 이 스트림을 문장이나 이미지에 대한 모델의 이해가 층별로 구축되는 연속적인 정보의 흐름이라고 상상해 보라. 데이터가 네트워크를 통과함에 따라, 시스템의 서로 다른 부분들이 이 흐름에 작은 조정을 더하며, 효과적으로 공유 화이트보드 위에 새로운 세부 사항을 써 내려간다. 이러한 조정은 모델의 내부 공간 내의 특정 방향, 저자가 슬라이더에 비유한 것에 의해 안내된다. 각 슬라이더는 특정 인물이나 특정 사물과 같은 특정 속성을 나타낸다. 모델이 입력을 처리할 때, 모델은 이 슬x더들을 조절하여 무엇이 존재하는지를 반영하기 위해 위아래로 움직인다.
베크만의 연구에서 핵심적인 통찰은 모델이 답을 생성하기 위해 이 슬라이더들을 사용하는 방식이다. 전통적인 특징 결합의 관점에서는 모델이 일련의 입력들을 보고 그것들을 혼합하여 새로운 출력을 만들어낸다. 하지만 사실 회상의 경우, 과정이 다르게 작동한다. 여기서는 특정 입력이 미리 저장된 정보 세트를 여는 열쇠 역할을 한다. 논문은 "마이클 조던(Michael Jordan)"이라는 이름의 예를 들어 이를 설명한다. 모델이 이 이름을 접할 때, 단순히 글자나 소리를 조합하여 새로운 아이디어를 형성하는 것이 아니다. 대신, "마이클 조던"이라는 특징의 활성화는 모델의 가중치(weights)에 저장된 연관된 사실들, 예를 들어 "농구를 한다" 또는 "시카고 불스"를 직접적으로 호출한다. 모델의 가중치는 지식을 정의하는 학습된 파라参数(parameters)로서, 저장된 정보의 저장소 역할을 한다. 적절한 특징이 활성화되면, 모델은 이러한 저장된 값들의 특정 행을 스케일링하여 관련 사실들을 현재의 문맥으로 끌어온다. 이는 특징 결합의 구성 과정과는 구별된다. 그것은 입력이 시스템 내에 이미 존재하는 정보를 위한 트리거 역할을 하는 검색 과정이다.
베크만은 이 메커니즘이 언어 모델이나 사람에 관한 사실에 국한되지 않는다고 주장한다. 그는 특징 회상이 이미지 인식을 위해 사용되는 것을 포함하여 모든 딥러닝 아키텍처에 적용되는 일반적인 연산이라고 제사한다. 이를 입증하기 위해, 그는 검색 과정을 원형을 감지하는 합성곱 신경망(CNN)의 고전적인 사례와 대조한다. 그 시나리오에서 네트워크는 곡선이나 선과 같은 저수준 특징들을 결합하여 형태를 식별한다. 이 경우 가중치는 어떤 패턴을 찾을지를 정의한다. 그러나 특징 회상에서 가중치는 패턴이 발견되었을 때 무엇을 검색할지를 정의한다. 만약 손글씨 숫자를 학습한 모델이 원형 모양을 감지한다면, 모델은 그 감지를 사용하여 해당 숫자가 0, 6, 8 또는 9일 가능성이 높다는 것을 회상할 수 있다. 입력 특징인 '원'은 이러한 구체적인 가능성들을 불러오는 트리거가 된다. 논문은 특징 결합이 모델이 어떻게 복잡성을 구축하는지를 설명하는 반면, 특징 회상은 모델이 어떻게 학습한 방대한 양의 정보에 접근하여 매우 희소한 입력으로부터 풍부하고 상세한 출력을 생성하는지를 설명한다고 상정한다.
저자는 또한 잠재적인 혼동을 다룬다. 이러한 연산의 수학적 배경이 두 가지 방식으로 해석될 수 있으므로, 이 구분이 실재하는 것인지 아니면 단지 관점의 문제인지에 대해서 말이다. 수학적으로 동일한 계산이 입력을 결 조합하거나 저장된 행을 검색하는 것으로 기술될 수 있다. 베크만은 이러한 모호함을 인정하면서도, 연결의 구조를 본다면 그 구분이 의미가 있다고 주장한다. 그는 연결이 얼마나 집중되어 있는지를 측정함으로써 두 가지를 구분할 수 있는 방법을 제안한다. 특징 결합에서는 많은 입력이 단일 출력에 기여하여 밀집된 연결망을 만든다. 반면 특징-회상에서는 단일 입력이 출력을 지배하여, 하나의 트리거가 특정 저장된 연관성을 끌어내는 희소한 연결을 만든다. 논문은 연구자들이 이러한 연결성의 차이를 사용하여 모델의 어느 부분이 검색 시스템으로 작동하고 어느 부분이 구성 시스템으로 작동하는지 식별할 수 있다고 제다. 비록 이것이 아직 모든 사례에서 완전히 증명되지는 않았지만, 저자는 이러한 테스트가 어떻게 수행될 수 있는지에 대한 개요를 제시하며, 이들이 진정으로 분리된 운영 모드인지 결정하기 위한 미래 연구의 경로를 제시한다.
기술적인 메커니즘을 넘어, 이 논문은 이러한 모델들이 무엇을 "아는지"에 대한 새로운 사고방식을 제공한다. 저자는 인간의 기억과 모델의 내부 상태 사이에 평행 이론을 제시한다. 그는 트리거될 때만 검색되는 가중치에 저장된 정보가 '성향적 신념(dispositional belief)'—현재 사용되고 있지 않을 때도 존재하는 지식—과 닮았다고 제안한다. 이는 모델의 현재 처리 중인 능동적인 정보, 즉 '현성적 신념(occurrent belief)'과 대조된다. 이 둘을 구분함으로써, 논문은 철학자와 과학자들이 인공 시스템에서의 믿음과 지식의 본질을 더 잘 이해할 수 있는 프레임워크를 제공한다. 이는 모델이 단순히 순간적인 데이터를 처리하는 것이 아니라, 언제든 불러올 수 있는 사실과 연관성의 '상태적 성향(standing disposition)'을 지니고 있음을 시사한다.
궁극적으로, 이 논문은 특징 회상이 특징 결합이라는 개념을 대체한다고 주장하는 것이 아니다. 대신, 그것을 필수적인 보완물로 제시한다. 도서관에 책(저장된 정보)과 그것을 읽는 과정(검색)이 모두 들어있는 것처럼, 딥러닝 모델은 새로운 입력을 이해하기 위해 특징을 결합하는 것과 상세한 응답을 생성하기 위해 저장된 특징을 회상하는 것 모두에 의존할 가능성이 높다. 이 연구는 연구자들이 패턴의 구성을 넘어 저장된 지식의 검색을 인식하도록 촉구한다. 그렇게 함으로써, 모델이 어떻게 정보를 저장하고 우리가 그 내부 작동 방식을 어떻게 해석할 수 있는지에 대한 새로운 질문을 던진다. 이 구분은 추가적인 경험적 테스트가 필요한 가설로 남아 있지만, 인공지능이 가장 발전된 응용 분야에서 보여주는 놀랍고 상세한 출력들을 어떻게 만들어내는지에 대해 더 명확하고 직관적인 그림을 제공한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.