← 최신 논문
🤖 machine learning

On the Expressiveness of State Space Models via Temporal Logics

이 논문은 시계열 논리(temporal logics)를 사용하여 상태 공간 모델(SSM)의 표현력을 분석하며, 게이팅 메커니즘과 산술 정밀도에 따라 이들의 능력이 정규 언어에서 비정규 언어까지 범위가 달라짐을 밝히고, 이러한 발견을 트랜스포머 아키텍처와 체계적으로 비교한다.

원저자: Eric Alsmann, Lowejatan Noori, Martin Lange

게시일 2026-01-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eric Alsmann, Lowejatan Noori, Martin Lange

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 읽고 사건의 순서를 이해하는 법을 가르치려 한다고 상상해 보세요. 인공지능의 세계에는 이 일을 맡기기 위해 경쟁 중인 두 가지 주요 유형의 "독자"(아키텍처)가 있습니다. 바로 유명한 트랜스포머(Transformers)(현재 챗봇들을 움직이는 기술)와 떠오르는 신성인 **상태 공간 모델(State Space Models, SSMs)**입니다.

이 논문은 SSM의 "두뇌 능력"에 대한 이론적 조사입니다. 저자들은 이 모델들이 특정 테스트에서 얼마나 잘 수행하는지를 묻는 것이 아니라, **"얼마나 많이 훈련시키더라도 이 모델들이 이해할 수 있는 절대적인 한계는 어디까지인가?"**를 묻고 있습니다.

이 질문에 답하기 위해, 그들은 특별한 "논리 언어"(시제 논리, Temporal Logic)를 측정 기준으로 사용합니다. 다음은 간단한 비유를 사용한 연구 결과의 요약입니다.

1. SSM의 두 가지 주요 유형

논문은 정보를 처리하는 방식에 따라 SSM을 두 가지 맛으로 나눕니다.

  • 대각 게이트 SSM (Diagonal-Gated SSMs - "엄격한 회계사"): 이 모델들은 현재 읽고 있는 단어에 따라 내부 "게이트"(정보 흐름을 제어하는 스위치)를 변경할 수 있지만, 반드시 "대각선" 형태를 유지해야 한다는 규칙이 있습니다. 이것은 숫자를 더할 때 숫자는 바꿀 수 있지만, 열(column)끼리 서로 섞을 수는 없는 계산기와 같습니다.
  • 시변 불변 SSM (Time-Invariant SSMs - "일정한 시계"): 이 모델들은 어떤 단어를 읽든 상관없이 변하지 않는 게이트를 가지고 있습니다. 이들은 메트로놈이나 시계와 같습니다. 이야기의 내용과 상관없이 일정한 속도로 똑딱거립니다.

2. 정밀도의 문제: 자 vs 줄자

저자들은 또한 이 모델들 내부의 수학적 "정밀도"를 살펴보았습니다.

  • 고정 정밀도 (Fixed-Precision): 눈금이 10개뿐인 자를 사용하는 것을 상상해 보세요. 이야기가 아무리 길어져도, 그 눈금보다 작은 것은 측정할 수 없습니다. 이것은 표준적인 컴퓨터 연산(부동 소수점)과 같습니다.
  • 로그 정밀도 (Log-Precision): 이야기가 길어짐에 따라 자동으로 더 길어지고 더 세밀해지는 줄자를 사용하는 것을 상상해 보세요. 이야기가 100단어라면 자에 100개의 눈금이 있고, 1,000단어라면 1,000개의 눈금이 있습니다. 이를 통해 훨씬 더 미세한 측정이 가능합니다.

3. 이들은 실제로 무엇을 이해할 수 있는가?

"엄격한 회계사" (대각 SSM)

  • 단순한 자를 사용할 때 (고정 정밀도): 이들은 사건의 순서를 이해하는 데 능숙합니다. "A가 B보다 먼저 일어났다"거나 "A가 일어났고, 그다음 B가 일민, 그다음 C가 일어났다"는 것을 말할 수 있습니다. 하지만 결정적인 약점이 있습니다: 순환(cycle)을 셀 수 없습니다.
    • 비유: 만약 이들에게 "짝수 개의 'a'가 나타나는 패턴"(예: aa, aaaa, aaaaaa)을 인식하라고 요구하면 실패합니다. 그들의 수학은 단조 증가(monotonic)하기 때문에(계속 올라가거나 유지됨), 결국 "막혀버려서" 2개의 'a'와 4개의 'a'를 구분하지 못하게 됩니다.
  • 성장하는 줄자를 사용할 때 (로그 정밀도): 만약 이들에게 정밀하게 셀 수 있는 능력을 부여한다면, 이들은 훨씬 더 똑똑해집니다. 이제 과거에 어떤 일이 정확히 몇 번 일어났는지 셀 수 있습니다. 이들은 "a의 개수가 b의 개수와 c의 개수와 같다"와 같은 복잡한 패턴도 이해할 수 있습니다.

"일정한 시계" (시변 불변 SSM)

  • 단순한 자를 사용할 때: 이 모델들은 복잡한 "그 이후(since)" 관계(예: "마지막으로 'b'가 나타난 이후로 'a'가 나타났는가?")를 추적하는 데 서툽니다. 하지만 초능력이 있습니다: 원형으로 셀 수 있습니다.
    • 비유: 내부 메커니즘이 일정한 순환 구조이기 때문에, 이들은 "지금이 2번째, 4번째, 혹은 6번째 단어인가?"를 아는 데 탁월합니다. 이들은 엄격한 회계사가 실패했던 "짝수 개의 'a's" 패턴을 쉽게 인식할 수 있습니다.
  • 성장하는 줄자를 사용할 때: 이들은 원형으로 세는 것과 전체 숫자를 세는 것 둘 다 할 수 있습니다.

"하이브리드" (혼합 SSM)

두 유형의 레이어(엄격한 회계사와 일정한 시계)를 결 모두 결합하면, 두 세계의 장점을 모두 얻게 됩니다. 이들은 순서, 순환, 그리고 숫자를 세는 법을 모두 이해할 수 있습니다. 논문은 이러한 하이브리드 모델이 특정 복잡도 한계 내에서 생각할 수 있는 거의 모든 "정규(regular)" 패턴을 인식할 수 있음을 보여줍니다.

4. 트랜스포머와 어떻게 비교되는가?

저자들은 자신들의 발견을 우리가 이미 알고 있는 트랜스포머와 비교했습니다.

  • **대각 SSM (고정 정밀도)**은 대략 위치 정보가 없는 트랜스포머(단어의 순서는 알지만 정확한 위치는 모르는 모델)와 유사합니다.
  • 시변 불변 SSM위치 인코딩(Positional Encodings)이 있는 트랜스포머와 유사합니다.
  • 결정적인 차이점: "전역 주의(global attention)"를 가진 트랜스포머(Average Hard-Attention 유형 등)는 이야기 전체를 한꺼번에 훑어보며 앞뒤로 숫자를 셀 수 있습니다. 반면, SSM은 본질적으로 과거(이미 읽은 것)만을 바라봅니다. 따라서 SSM은 무언가가 나중에 일어날 것을 세는 능력에 있어서 가장 발전된 트랜스포머보다 엄격하게 열등합니다.

5. "불가능한" 과업들

가장 중요한 핵심은 이 모델들이 아무리 많이 훈련하더라도 할 수 없는 일들의 목록입니다.

  • 고정 정밀도 대각 SSM은 반복되는 항목의 짝수와 홀수를 구별하는 법(예: aaaaa)을 절대로 배울 수 없습니다. 이것은 훈련의 실패가 아니라, 아키텍처 자체의 근본적인 한계입니다.
  • 이 한계를 깨려면, 반드시 아키텍처를 변경하거나(시변 불변 레이어 추가), 수학적 정밀도를 높여야 합니다(성장하는 줄자 사용).

요약

이 모델들을 서로 다른 유형의 사서라고 생각해 보세요:

  • 대각 (고정형): 책을 순서대로 읽는 데는 능숙하지만, 특정 패턴을 세라고 하면 혼란에 빠집니다.
  • 시변 불변: 페이지 수(짝수/홀수)를 세는 데는 능숙하지만, "그 이후"의 복잡한 이야기에는 서툽니다.
  • 하이브리드: 두 가지를 모두 할 수 있는 궁극의 사서이지만, 여전히 다음 장을 미리 엿보고 뒤에서 일어날 일을 세는 것은 불가능합니다.

이 논문은 이러한 한계가 아키텍처의 DNA에 새겨져 있음을 증명합니다. "고정 정밀도 대각" 사서에게 "숫자 세기" 전문 사서가 되도록 훈련시킬 수는 없습니다. 그 능력을 갖추려면 더 좋은 도구(로그 정밀도)를 주거나 다른 뇌 구조(혼합 레이어)를 제공해야만 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →