← 최신 논문
💻 computer science

Infrared Universality of Collective Dynamics across Transformer and State-Space Architectures

이 논문은 근본적으로 다른 미시적 메커니즘에도 불구하고, 트랜스포머(Transformer)와 맘바(Mamba) 아키텍처 모두가 느린 모드 연속체(slow-mode continuum)로 특징지어지는 공유된 근사-한계 적외선 집단 역학(near-marginal infrared collective dynamics)을 발달시킨다는 점을 입증함으로써, 이러한 조직화의 보편성을 트랜스포머 너머로 확장하고 인지장 이론(Cognitive Field Theory)의 예측을 뒷받침한다.

원저자: Byung Gyu Chae

게시일 2026-08-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Byung Gyu Chae

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이라는 광활한 풍경 속에서, 연구자들은 기계가 어떻게 기억하는 법을 배우는지 이해하기 위해 오랫동안 노력해 왔습니다. 문장 속의 단어나 비디오의 프레임과 같은 정보의 시퀀스를 처리하기 위해 두 가지 지배적인 모델 가문이 등장했습니다. 첫 번째 가문인 트랜스포머(Transformers)는 셀프 어텐션(self-attention)이라 불리는 메커니즘에 의존하는데, 이는 모델이 모든 정보 조각을 다른 모든 정보 조각과 동시에 비교하여 그 중요도를 가늠할 수 있게 해줍니다. 두 번째 가문인 맘바(Mamba)와 같은 최신 모델들은 상태 공간 역학(state-space dynamics)에 기반한 다른 접근 방식을 사용하며, 여기서 모델은 시간이 흐름에 따라 진화하는 내부 상태를 유지하고 새로운 데이터를 처리할 때마다 자신의 기억을 업데이트합니다. 수년 동안 과학자들은 이 근본적으로 다른 두 가지 시간과 기억에 대한 사고방식이 실제로 기계 깊은 곳에서 동일한 기저 동작으로 이어질 수 있는지 궁금해해 왔습니다. 이 질문이 중요한 이유는, 서로 다른 아키텍처가 동일한 패턴으로 수렴한다면, 이는 학습하고 기억하는 능력이 설계자의 특정 공학적 선택이 아니라 보편적인 원리에 의해 지배된다는 것을 시사하기 때문입니다.

한 연구자는 훈련된 맘바 모델의 내부를 들여다보며 그들의 기억이 실제로 어떻게 작동하는지 확인함으로써 이 아이디어를 테스트하기로 했습니다. 그들은 '상태 밀도 시간 척도(time-scale density of states)'라고 불리는 특정 특성에 집중했는데, 이는 본질적으로 모델이 보유한 다양한 기억의 속도가 얼마나 되는지를 보여주는 지도와 같습니다. 책들이 주제별이 아니라 독자의 마음에서 얼마나 빨리 사라지는지에 따라 분류되는 도서관을 상상해 보십시오. 어떤 책은 몇 초 만에 잊히고, 어떤 책은 몇 분 후에, 또 어떤 책은 몇 년 동안 머릿러 남습니다. 연구자는 맘바 모델에서 이러한 '사라지는 속도'의 분포를 확인하고자 했습니다. 그들은 맘바가 레이어별로 조사할 수 있는 내장된 기억 메커니즘을 가지고 있다는 점을 알고 있었습니다. 즉, 첫째로 설계에 인코딩된 가공되지 않은 내부 기억 속도, 둘째로 특정 입력을 받을 때 그 속도가 어떻게 변하는지, 마지막으로 모든 복잡한 계산이 끝난 후 전체 블록의 집합적인 기억 속도입니다.

연구자는 이 세 가지 레이어가 서로 같지 않다는 것을 발견했습니다. 맘바 모델의 가공되지 않은 내부 기억은 넓은 범위의 속도로 시작하지만, 모델이 정보를 처리함에 따라 읽고 있는 내용에 따라 이러한 속도를 선택적으로 재조정합니다. 이러한 입력 의존적 조정은 맘바의 고유한 특징으로, 맥락에 따라 내부 시계를 늦추거나 빠르게 조절할 수 있게 해줍니다. 그러나 가장 놀라운 발견은 연구자가 모델 블록 전체의 최종적인 집합적 출력을 살펴보았을 때 나타났습니다. 내부에서 일어나는 복잡한 속도 재구성과도 불구하고, 최종 결과는 매우 구체적이고 안정적인 패턴으로 정착되었습니다. 연구자가 다양한 시퀀스 길이에 걸쳐 기억 속도를 측정했을 때, 모델은 일관되게 매우 느린 기억들의 넓고 연속적인 범위를 발달시킨다는 것을 발견했습니다. 이러한 느린 기억들은 사라지지 않았습니다. 대신, 모델이 더 긴 시퀀스의 데이터를 처리할수록 더 명확하고 뚜렷해지는 매끄럽고 예측 가능한 연속체를 형성했습니다.

이것이 맘바 설계의 특이한 현상인지 아니면 지능형 시스템의 일반적인 규칙인지를 이해하기 위해, 연구자는 자신의 발견을 트랜스포머 모델의 행동과 비교했습니다. 트랜스포머는 맘바와 같은 동일한 내부 상태 공간 메커니즘을 가지고 있지 않으며, 대신 어텐션 메커니즘에 의존합니다. 그러나 연구자가 트랜스포머의 집합적 기억 속도를 측정했을 때, 놀라울 정도로 유사한 패턴을 발견했습니다. 두 아키텍처는 정보를 처리하는 미시적 방법은 완전히 다름에도 불구하고, 가장 느리고 오래 지속되는 기억 쪽으로 약간 치우친 거의 평탄한 분포를 발달시켰습니다. 물리학의 언어로 말하자면, 이는 '근임계(near-marginal)' 상태이며, 이는 모델이 무한한 기억을 가질 수 있는 경계선에 바로 서 있어, 정보에 갇히지 않으면서도 오랜 기간 정보를 유지할 수 있음을 의미합니다.

이 연구는 이러한 느린 기억 조직화가 특정 유형의 신경망만의 특징이 아님을 확인해 줍니다. 연구자는 맘바가 트랜스포머와는 다른 수학적 구조를 사용하여 명시적으로 기억을 구축함에도 불구하고, 두 시스템 모두 집합적인 역학을 동일한 방식으로 조직한다는 것을 보여주었습니다. 그들은 맘바 모델의 기억 행동이 특정 값 주변에서 안정화된다는 것을 발견했으며, 이는 시퀀스가 전체 그림을 드러낼 만큼 충분히 길기만 하면 시퀀스 길이에 관계없이 나타나는 견고하고 재현 가능한 패턴임을 나타냅니다. 이는 장기 기억을 유지하는 능력이 학습된 시퀀스 처리의 근본적인 속성이며, 서로 다른 아키텍처 형태에서 자연스럽게 발생하는 것임을 시사합니다. 이 연구 결과는 인공지능이 어떻게 작동하는지에 대한 우리의 이해를 확장하며, 표면적인 설계의 차이 아래에, 이 강력한 모델들이 시간과 기억을 다루는 공통된 깊은 구조를 공유하고 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →