← 최신 논문
🤖 machine learning

The Quantum Shortcut: Complex Phase-State Dynamics Reduce the Optimization Steps of Sequence Models

이 논문은 표준적인 실수 값 은닉 상태 기질을 복소수 기반의 양자 영감을 받은 대안으로 교체하는 것이 상태 공간 모델과 어텐션 기반 시퀀스 모델 모두의 훈련 수렴을 상당히 가속화하지만, 장기적인 성능 우위는 상태 공간 구조에서만 지속된다는 것을 입증한다.

원저자: Ahmed Nebli, Hadi Saadatdoorabi, Christopher Keibel, Kevin Yam

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Ahmed Nebli, Hadi Saadatdoorabi, Christopher Keibel, Kevin Yam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능, 특히 텍스트를 쓰고, 언어를 번역하며, 문장에서 다음 단어를 예측하는 시스템들은 특정한 종류의 수학적 엔진에 의존합니다. 이 엔진들은 정보를 일련의 층(layer)을 통해 이동시키며 정보를 처리하는데, 이는 마치 신호가 긴 전선을 통과해 이동하는 것과 같습니다. 수십 년 동안 이러한 엔진을 구축하는 표준적인 방법은 우리가 일상생활에서 사용하는 친숙한 정수와 소수인 실수(real numbers)를 사용하는 것이었습니다. 이 표준 설정에서 엔진은 내부 신호의 크기를 강하게 유지함으로써 과거의 정보를 기억합니다. 그러나 정보가 시간상으로 더 멀리 이동함에 따라, 이 신호들은 긴 복도에서 메아리치는 속삭임처럼 자연스럽게 약해지는 경향이 있습니다. 신호가 너무 작아지면, 기계는 문장의 시작 부분에서 일어났던 일을 효과적으로 잊어버리게 되어, 긴 데이터 시퀀스로부터 학습하는 데 어려움을 겪습니다. 이러한 약화 현상은 현재 설계의 근본적인 한계이며, 이로 인해 연구자들은 기계가 기억하는 법을 가르치기 위해 방대한 양의 데이터와 시간을 투입해야만 합니다.

연구팀은 기계가 사고하는 방식에 사용하는 숫자 체계 자체를 바꿈으로써 이 약화 문제를 우회할 수 있는 방법을 발견했습니다. 실수에만 의존하는 대신, 그들은 복소수(complex numbers)를 사용하는 버전의 언어 모델을 구축했습니다. 실수는 단 하나의 값만을 가지지만, 복소수는 크기와 방향(각도)이라는 두 가지 뚜렷한 정보를 담고 있습니다. 연구진은 중요한 정보를 크기가 아닌 각도에 저장함으로써, 기계가 기억을 잃지 않고 훨씬 더 멀리까지 나아갈 수 있다는 것을 발견했습니다. 정보의 크기가 네트워크를 통과하며 줄어들더라도, 각도는 완벽하게 선명하고 변함없이 유지됩니다. 이를 통해 기계는 신호가 결코 침묵 속으로 사라지지 않고 문장의 시작부터 끝까지 맥락을 유지할 수 있습니다.

연구진은 이 새로운 접근 방식을 테스트하기 위해 표준 설계와 더 새롭고 효율적인 설계를 기반으로 한 두 가지 유형의 언어 모델을 구축했습니다. 그들은 실수를 복소수로 교체하여 각 모델의 '복소수' 버전을 만들었고, 100메가바이트의 작은 컬렉션부터 15기가바이트의 거대한 데이터에 이르기까지 세 가지 서로 다른 텍스트 세트로 학습시켰습니다. 결과는 놀라웠습니다. 더 새로운 설계(state-space model)의 경우, 복소수 모델은 표준 모델과 동일한 정확도에 도달하는 데 약 3분의 1의 학습 단계(training steps)만을 필요로 했습니다. 더 크고 전통적인 설계의 경우, 동일한 수준에 도달하는 데 약 절반의 단계가 걸렸습니다. 이는 새로운 모델이 훨씬 적은 데이터와 시간을 소비하면서도 동일한 양의 정보를 학습했음을 의미합니다.

이 발견이 특히 견고한 이유는 이 이점이 즉각적으로 나타났으며, 두 설계의 행동이 훈련이 진행됨에 따라 갈라졌기 때문입니다. 연구진은 복소수 모델이 훈련의 첫 100단계부터 앞서 나가기 시작했다는 점을 관찰했습니다. 결정적으로, 연구진은 이러한 속도 향상의 성격이 두 아키텍처 사이에서 서로 다르다는 것을 발견했습니다. 새로운 설계(상태 공간 모델)의 경우, 복-소수 모델과 표준 모델 사이의 격차는 훈련이 계속됨에 따라 오히려 더 넓어졌는데, 이는 이 이점이 과정의 시작 단계에서 나타나는 일시적인 현상이 아니라 새로운 설계의 영구적인 특징임을 시사합니다. 반면, 오래된 설계(어텐션 기반 모델)의 경우, 이점은 초기에 가장 강력했다가 훈련이 진행됨에 따라 서서히 감소하여 제로(0)를 향해 감쇠했습니다. 이러한 감쇠에도 불구하고, 초기의 상승 폭은 해당 아키텍처의 훈련 시간을 절반으로 줄일 만큼 충분히 컸습니다.

연구진은 이 속도 향상이 단순히 더 많은 컴퓨팅 파워를 추가하거나 모델의 크기를 키워서 발생한 것이 아님을 확실히 하기 위해 주의를 기울였습니다. 그들은 각 모델의 조정 가능한 부분(adjustable parts)의 개수가 100분의 1 퍼센트 미만으로 차이가 나도록 두 버전을 매우 정밀하게 일치시켰습니다. 또한 동일한 훈련 일정과 컴퓨터 하드웨어를 사용했습니다. 이러한 엄격한 통제를 통해 차이점이 오로지 복소수로의 전환과 기계가 이를 처리하는 방식에서 비롯되었음을 확인했습니다. 또한 연구진은 복소수 모델이 단순히 초기 조건 덕분에 운이 좋았던 것이 아니라는 점을 입증했습니다. 다양한 크기의 텍스트와 서로 다른 모델 아키텍처 전반에서 나타난 일관된 이점은 기계가 학습하는 방식의 근본적인 개선을 가리켰습니다.

이 연구의 가장 흥러운 측면 중 하나는 기계가 상충하는 정보를 처리하는 방식을 어떻게 바꾸느냐 하는 것입니다. 표준 모델에서 만약 기계가 일련의 숫자가 연도를 나타내는지 혹은 가격을 나타내는지 확신하지 못한다면, 기계는 내부 신호를 사라질 때까지 줄임으로써 한 가지 가능성을 능동적으로 억제해야 합니다. 하지만 복소수 모델에서 기계는 대신 신호의 각도를 회전시킬 수 있습니다. 두 가지 가능성이 충돌할 때, 기계는 노이즈 캔슬링 헤드폰이 소음의 정확히 반대되는 파동을 만들어 소음을 상쇄하는 것과 유사한 '간섭(interference)' 과정을 통해 두 가능성을 서로 상쇄하도록 회전시킬 수 있습니다. 이를 통해 기계는 올바른 정보의 강도는 유지하면서 잘못된 아이디어를 폐기할 수 있으며, 이는 표준 모델은 수행할 수 없는 능력입니다.

연구진은 복소수 모델이 더 빠르게 학습하는 반면, 몇 가지 실질적인 트레이드오프(trade-offs)가 있다는 점에 주목했습니다. 현재 이 작업에 사용되는 컴퓨터 칩들은 실수에 최적화되어 있기 때문에, 복소수 모델을 실행하는 데는 단계당 약간 더 많은 처리 능력이 필요했습니다. 새로운 모델 설계의 경우, 이 추가 비용으로 인해 모델을 훈련하는 총 시간은 표준 버전과 거의 비슷했지만, 적은 단계만으로도 목표에 도달했습니다. 그러나 복소수 모델은 여전히 훨씬 적은 데이터를 소비하여 동일한 품질에 도달했으므로, 데이터가 부족한 특수 작업에서 큰 장점이 됩니다. 오래된 모델 설계의 경우, 연구진은 비교할 수 있는 최적화된 버전의 표준 모델을 가지고 있지 않았기에, 복소수 버전이 실제 작동 시간(clock time) 측면에서 더 빠를지는 아직 단정 지을 수 없으나, 데이터 효율성 측면에서의 이득은 명확했습니다.

이 연구는 모델의 아키텍처 자체만큼이나 선택한 숫자 체계가 중요하다는 것을 시사합니다. 수년 동안 연구자들은 기계가 정보를 전달하는 경로를 바꾸는 데 집중해 왔지만, 본 연구는 기계가 생각하는 언어를 바꾸는 것이 훨씬 더 큰 이점을 가져다줄 수 있음을 보여주었습니다. 복소수 모델은 단순히 조금 더 빨리 학습한 것이 아니라, 학습 과정의 효율성을 근본적으로 변화시켜 아주 적은 양의 데이터만으로도 높은 수준의 성능에 도달했습니다. 연구진은 현재의 버전이 이론의 엄격한 수학적 규칙을 완화한 실용적인 적응 형태이지만, 복소수 접근 방식이 대규모에서도 작동한다는 것을 증명하기에는 충분하다고 결론지었습니다. 그들은 모든 코드와 훈련 로그를 공개하여 다른 이들이 결과를 검증하고, 이 새로운 사고 방식이 차세대 인공지능을 어떻게 개선할 수 있는지 탐구할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →