← 최신 논문
🤖 machine learning

On the Diverse Dynamical Behaviors Arising in Deep Linear Transformers

이 논문은 토큰 간의 상호작용을 일반화된 쿠라모토 시스템으로 모델링함으로써 2차원에서의 딥 리니어 트랜스포머(deep linear transformers)가 보이는 다양한 장기 역학적 거동을 특성화하며, 이를 통해 내재적인 저차원 역학, 숨겨진 해밀토니안 구조, 그리고 고차원에서도 지속되는 클러스터링 및 진동과 같은 견고한 현상을 밝혀낸다.

원저자: Sixu Li, Thomas Jacob Maranzatto, Jan Peszek, Trevor Teolis, Semih Akkoc, Konstantin Riedl, Sennur Ulukus, Nicolás García Trillos

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sixu Li, Thomas Jacob Maranzatto, Jan Peszek, Trevor Teolis, Semih Akkoc, Konstantin Riedl, Sennur Ulukus, Nicolás García Trillos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

데이터가 단순히 페이지 위의 정적인 숫자가 아니라, 거대하고 보이지 않는 도시를 가로지르는 움직이는 작은 여행자들의 북적이는 군중이라고 상상해 보십시오. 이것이 바로 현대 인공지능(AI)의 기술인 **트랜스포머(Transformer)**라 불리는 머신러닝의 영역입니다. 여러분은 아마 한 번쯤 들어보셨을 것입니다. 트랜스포머는 챗봇, 번역 도구, 이미지 생성기를 구동하는 엔진입니다. 이 기계들의 핵심에는 **셀프 어텐션(self-attention)**이라는 메커니즘이 있습니다. 이것을 데이터 포인트(이를 "토큰"이라 부릅니다)를 위한 초강력 소셜 네트워크라고 생각하십시오. 트랜스포머가 문장을 읽을 때, 모든 단어는 다른 모든 단어를 살펴보며 각 단어가 얼마나 중요한지를 결정합니다. 이 과정은 메시지가 매 단계마다 정교해지는 '전화기 게임(말 전달하기)'처럼 층(layer)을 거듭하며 일어납니다.

하지만 여기 미스터리가 있습니다. 우리는 이 기계들이 놀라울 정도로 잘 작동한다는 것은 알지만, 내부에서 어떻게 작동하는지는 종종 이해하지 못합니다. 이는 자동차가 빠르게 달린다는 것은 알지만 엔진의 원리는 모르는 것과 같습니다. 과학자들은 이 데이터 토큰들이 층을 통과하며 이동하는 "교통 패턴"을 지도화하기 위해 노력해 왔습니다. 그들은 모두 발맞추어 행진할까요? 그룹을 형성할까요? 아니면 루프에 갇혀 뱅뱅 돌까요? 이를 이해하는 것은 매우 중요합니다. 데이터가 어떻게 움직이는지 알게 된다면, 더 좋고, 안전하며, 효율적인 AI를 구축할 수 있기 때문입니다. 이 논문은 데이터를 컴퓨터 코드가 아닌, 수학적 리듬에 맞춰 춤추는 입자 무리로 취급하며 그 교통 흐름을 깊이 파고듭니다.


위대한 토큰의 춤: 혼돈과 질서에 관한 연구

이 논문에서 수학자와 엔지니어 팀은 트랜스포머를 그 뼈대만 남기고 해체했을 때 어떤 일이 일어나는지 관찰하기로 했습니다. 그들은 **선형 트랜스포머(Linear Transformer)**라고 불리는 단순화된 버전에 집중했습니다. 음악이 단순하고 예측 가능하며, 무용수들이 "토큰"(데이터 포인트)인 무도회장을 상상해 보십시오. 연구진은 다음과 같은 점을 알고 싶었습니다. 만약 이 무용수들이 층을 거듭하며 상호작용하게 둔다면, 그들은 결국 멈춰 서서 완벽한 일직선으로 서게 될까요? 두 개의 반대되는 그룹을 형성할까요? 아니면 영원히 원을 그리며 뱅뱅 돌게 될까요?

이를 알아내기 위해 저자들은 영리한 트릭을 사용했습니다. 그들은 특정 2차원 설정(토큰이 평평한 원 위에서 움직이는 상황)에서 트랜스포머의 복잡한 수학이 **쿠라모토 모델(Kuramoto model)**이라는 유명한 물리학 모델과 정확히 일치한다는 것을 깨달았습니다. 쿠라모토 모델은 반딧불이가 동시에 빛을 내거나 진자 시계가 결국 함께 똑딱거리는 방식을 설명하는 방법이라고 생각하면 됩니다. 저자들은 자신들의 트랜스포머 토큰들이 특정 2차 리듬(단순한 비트 대신 "더블 비트")을 통해 상호작용하는 본질적인 "반딧불이"라는 것을 발견했습니다.

이 연결 고리 덕분에, 그들은 문제를 축소할 수 있는 강력한 수학적 도구(와타나베-스트로가츠 변환오트-안텐젠 안사츠)를 사용할 수 있었습니다. 이는 수천 명의 개별 무용수를 추적하는 대신, 군중 전체의 행동을 단 하나의 단순한 방정식으로 설명할 수 있음을 의미합니다. 마치 경기장에 있는 모든 사람을 추적하는 대신, 군중 사이를 지나가는 "파도"만을 추적하면 되는 것과 같습니다.

놀라운 결과: 단순한 직선이 아니다

연구팀은 이 토큰들의 행동이 Key(키), Query(쿼리), **Value(값)**라고 불리는 세 가지 특정 행렬(숫자 표)에 의해 설정되는 "춤의 규칙"에 전적으로 달려 있다는 것을 발견했습니다. 이 숫자들을 바꿈으로써 그들은 토큰들이 완전히 다르게 행동하도록 만들 수 있었습니다.

  1. 위대한 클러스터링 (더 "허들"): 많은 경우, 토큰들은 우리가 예상하는 대로 행동합니다. 그들은 함께 모입니다. 때로는 모두가 하나의 지점으로 모여 완벽한 합의를 이룹니다. 하지만 자주, 그들은 원의 반대편에 위치하는 두 개의 대립하는 그룹(대척점 클러스터)으로 나뉩니다. 이는 모든 사람이 결국 두 개의 극단적인 측 중 하나로 의견을 모으는 토론과 같습니다.
  2. 영원한 회전 (더 "회전목마"): 여기서 이상한 일이 발생합니다. 연구진은 토큰들이 두 그룹을 형성하지만, 이 그룹들이 결코 멈추지 않는 특정 설정을 발견했습니다. 그들은 멈추지 않는 회전목마처럼 원을 따라 영원히 회전합니다. 토킨들은 클러스터를 형성하지만, 결코 가라앉지 않습니다. 이는 저자들이 이 맥락에서 이전에 예측하지 못했던 행동입니다.
  3. 숨겨진 해밀토니언 (더 "그네"): 또 다른 시나리오에서 시스템은 진자나 그네처럼 작동합니다. 매개변수가 적절하다면, 토큰들은 완벽하고 반복적인 루프를 따라 앞뒤로 진동합니다. 매개변수를 아주 약간만 조정해도 시스템은 영원히 흔들리는 상태에서 가라앉는 상태로 갑자기 전환될 수 있습니다. 이를 **분기(bifurcation)**라고 하며, 이는 트랜스포머의 행동이 그 설정에 매우 민감하다는 것을 보여줍니다.

실제 생활에서는 어떨까? ("만약"과 "실제")

저자들은 자신들의 가장 상세한 증명이 단순화된 2차원 세계에 적용된다는 점을 주의 깊게 명시했습니다. 그러나 거기서 멈추지 않았습니다. 그들은 훨씬 더 크고 현실적인 모델(100차원 및 200개 토큰)을 사용하여 수치 실험(컴퓨터 시뮬레이션)을 수행했습니다.

결과는 흥미로웠습니다. 2차원 세계에서 발견한 기이한 행동들—영원한 회전이나 흔들림과 가라앉음 사이의 갑작스러운 전환 등—이 고차원 시뮬레이션에서도 지속되었습니다. 이는 이러한 복잡한 비선형적 춤이 단순한 수학적 호기심이 아니라, 우리가 매일 사용하는 거대한 AI 모델 내부에서도 실제로 일어나고 있을 수 있음을 시사합니다.

그들은 또한 자신들의 "선형" 모델을 더 일반적인 "소프트맥스(Softmax)" 모델(실제 AI에서 사용되는 모델)과 비교했습니다. 그들은 소프트맥스 모델이 모든 이를 하나의 완벽한 허들로 몰아넣는 경향이 있는 반면, 선형 모델은 더 다양하며 두 개의 뚜렷한 그룹을 형성하거나 영원히 회전할 수 있다는 것을 발견했습니다. 이는 "선형" 단순화가 단순한 장난감이 아니라, 더 복잡한 모델들이 숨기고 있을지도 모르는 숨겨진 역학을 드러낸다는 것을 시사합니다.

결론

이 논문은 AI의 모든 미스터리를 해결했다고 주장하는 것이 아닙니다. 대신, 새로운 창을 여는 것입니다. 데이터를 상호작용하는 입자로 취급하고 물리학의 언어를 사용함으로써, 저자들은 트랜스포머가 단순히 "하나의 답으로 수렴"하는 것보다 훨씬 더 풍부한 종류의 행동을 할 수 있음을 보여주었습니다. 그것들은 진동하고, 분기하며, 회전할 수 있습니다.

저자들은 2차원 사례에 대해 이러한 행동을 수학적으로 증명했으며, 시뮬레이션을 통해 이것이 더 크고 복잡한 시스템에서도 유효함을 제시했습니다. 그들은 단순히 토큰이 움직인다는 것을 발견한 것이 아니라, 토큰이 어떻게 움직이는지를 찾아냈으며, 트랜스포머의 내부 세계가 역동적이고 때로는 혼돈스러우며 아름답게 구조화된 무도회장임을 밝혀냈습니다. 이러한 통찰은 AI가 왜 때때로 루프에 빠지거나 예측 불가능하게 행동하는지 이해하는 데 도움을 줄 수 있으며, 미래에 더 안정적이고 이해 가능한 인공지능을 구축하는 길을 열어줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →