← 최신 논문
🤖 machine learning

A Mechanistic Analysis of Transformers for Dynamical Systems

이 논문은 단일 계층 트랜스포머를 동역학계 관점에서 분석하여, 소프트맥스 어텐션이 오버스무딩을 통해 선형 시스템 모델링을 제한하는 한편, 비선형적이고 부분적으로 관측 가능한 시스템에서 상태를 재구성하기 위한 효과적인 적응형 지연 임베딩 메커니즘으로서 기능함을 밝혀낸다.

원저자: Gregory Duthé, Nikolaos Evangelou, Wei Liu, Ioannis G. Kevrekidis, Eleni Chatzi

게시일 2026-08-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gregory Duthé, Nikolaos Evangelou, Wei Liu, Ioannis G. Kevrekidis, Eleni Chatzi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미래를 예측하려고 노력하고 있다고 상상해 보세요. 아마도 튀어 오르는 공이 다음에 어디에 떨어질지 추측하거나, 날씨를 예보하려 하는 것일 수도 있습니다. 오랫동안 과학자들은 이 일을 위해 신뢰할 수 있는 도구들을 가져왔습니다. 예를 들어, 사물이 지난 몇 초 동안 어떻게 움직였는지를 보고 다음에 어디로 갈지 추측하는 식입니다. 이러한 도구들은 엄격한 레시피와 같습니다. 만약 당신이 물리 법칙을 알고 있다면, 어떤 일이 일어날지 정확히 알려주는 수학 방정식을 써 내려갈 수 있습니다. 하지만 최근에는 이야기를 쓰거나 주가를 예측하는 등 무언가를 예측하는 데 있어 '트랜스포머(Transformer)'라고 불리는 새로운 종류의 '슈퍼 브레인'이 유명해졌습니다. 이 트랜스포머들은 전체 역사를 한꺼번에 살펴보고 추측을 내놓는 마법 같은 블랙박스와 같습니다. 여기서 큰 의문은, 이 블랙박스가 실제로 사물이 움직이는 물리학을 이해하고 있는 것인지, 아니면 그저 아주 뛰어난 추측가일 뿐이라서 상황이 까다로워지면 실패하게 될 것인지 하는 점입니다. 이 논문은 트랜스포머가 물리적 시스템의 움직임을 예측할 때 정말 제대로 하고 있는 것인지 확인하기 위해 그 엔진룸 내부를 파헤칩니다.

그레고리 뒤테(Gregory Duthé)와 그의 팀이 이끄는 연구진은 트랜스포머를 신비로운 블랙박스로 취급하는 것을 멈추고, 대신 그것이 어떻게 작동하는지 알아보기 위해 분해해 보기로 했습니다. 그들은 이해하기 쉽게 만들기 위해 매우 얇고 단순한 형태인 단 한 개의 층(layer)으로 구성된 특정 유형의 트랜스포머에 집중했습니다. 그들은 다음과 같이 질문했습니다. "만약 이 기계에 흔들리는 진자나 흐르는 강의 데이터를 입력한다면, 이 기계는 실제로 무엇을 배우고 있는 것일까?"

연구진이 발견한 결과는 "매우 잘 작동한다"와 "단단한 벽에 부딪힌다"가 뒤섞인 모습이었습니다.

먼저, 그들은 용수철이 위아래로 튀어 오르는 것과 같은 단순한 직선 운동(선형 시스템)을 살펴보았습니다. 그들은 트랜스포머에게 이상한 사각지대가 있다는 것을 발견했습니다. 트랜스포마가 과거에 주목하는 방식은 마치 재료를 더할 수는 있지만 결코 빼낼 수는 없는 요리사와 같습니다. 그것은 과거의 순간들을 서로 혼합할 수는 있지만, 그것들을 뺄 수는 없습니다. 만약 시스템이 (앞뒤로 흔들리는 용수철처럼) 요동을 만들기 위해 과거의 순간을 빼야 한다면, 단일 헤드(single-head) 트랜스포머는 혼란에 빠집니다. 그것은 모든 것을 매끄럽게 만들려고 시도하며, 튀어 오르는 용수철을 느릿느릿 움직이는 덩어리처럼 보이게 만듭니다. 이는 오직 앞으로만 움직일 수 있는 붓을 사용하여 지그재그 선을 그리려는 것과 같습니다. 결국 당신은 직선을 그리게 될 것입니다. 논문은 만약 트랜스포머에게 두 개의 '헤드'(두 가지 서로 다른 주의 집중 방식)를 준다면, 이것을 해결하고 마침 finally 지그재그를 올바르게 그릴 수 있다고 보여줍니다.

다음으로, 그들은 혼돈스러운 진자나 원통 주위를 휘감아 도는 유체와 같은 더 복잡하고 꿈틀거리는 움직임(비선형 시스템)으로 넘어갔습니다. 여기서 트랜스포머는 빛을 발하지만, 특정 조건 하에서만 그렇습니다. 연구진이 트랜스포머에게 시스템의 전체 그림(물체의 위치와 속도를 모두 아는 것)을 주었을 때, 그것은 단순한 계산기보다 나을 것이 별로 없었습니다. 이는 마치 탐정에게 나침반만 있으면 되는데 전체 지도를 주는 것과 같았습니다.

하지만 연구진이 정보의 일부를 숨겼을 때—즉, 트랜스포머에게 위치만 주고 속도는 숨겼을 때—트랜스포머는 슈퍼히어로가 되었습니다. 그것은 마치 시간 여행을 하는 탐정처럼 행동하기 시작했습니다. 과거 위치들의 순서를 살펴봄으로써, 그것은 숨겨진 속도를 찾아내고 시스템의 전체 상태를 재구성할 수 있었습니다. 그것은 본질적으로 누락된 조각들을 채우기 위해 '지연된 기억(delayed memory)'을 구축하고 있었으며, 이는 마치 자동차가 몇 초 전에 어디에 있었는지를 보고 자동차의 속도를 추측하는 것과 같습니다. 논문은 이것이 트랜스포머가 가장 잘 작동하는 방식임을 시사합니다. 즉, 관찰 기록들을 엮어서 현재의 완전한 그림을 만들어내는 것입니다.

하지만 여기에는 함정이 있습니다. 연구진은 트랜스포머가 이 일을 하기 위해서는 뇌 속에 충분한 '공간'이 필요하다는 것을 발견했습니다. 만약 그들이 그 복잡한 역사를 아주 작은 공간에 압축하도록 강요한다면, 그림은 엉망이 되고 커다란 지도를 작은 봉투에 억지로 구겨 넣는 것처럼 안으로 접혀 들어갈 것입니다. 논문은 시스템이 복잡할 경우, 트랜스포머가 서로 다른 가능성들을 분리하여 유지하기 위해 더 큰 내부 공간을 필요로 한다는 것을 보여줍니다. 또한, 시스템이 숨겨진 설정(예: 바람의 속도)에 따라 변하는 경우, 트래스포머에게 그 설정을 명시적으로 알려주지 않으면 혼란을 겪을 수 있다는 것도 발견했습니다. 그 추가적인 단서가 없다면, 단기적으로는 비슷해 보이지만 나중에는 매우 다르게 행동하는 두 가지 시나리오를 혼동할 수 있습니다.

결론적으로, 이 논문은 트랜스포머가 고장 났다고 말하는 것이 아니라, 마법이 아니라고 말합니다. 그것들은 물리적 시스템을 예측하도록 학습될 수 있는 강력한 도구이지만, 반드시 따라야 하는 특정한 규칙들이 있습니다. 그것들은 기억 속에서의 단순한 뺄셈에 어려움을 겪고, 복잡한 모양을 펼치기 위한 충분한 공간이 필요하며, 때로는 우리가 관찰하고 있는 세상의 숨겨진 설정을 이해하기 위해 약간의 도움을 필요로 합니다. 이러한 규칙들을 이해함으로써, 과학자들은 이 모델들을 신비로운 블랙박스로 취급하는 것을 멈추고, 실제 움직이는 세상을 예측하기 위해 더 신뢰할 수 있는 방식으로 이들을 구축할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →