← 최신 논문
🤖 machine learning

From Markov to Laplace: How Mamba In-Context Learns Markov Chains

이 논문은 단일 계층 Mamba 모델이 마르코프 체인의 최적 라플라스 평활 추정량(Laplacian smoothing estimator)을 인컨텍스트(in-context)로 효율적으로 학습할 수 있음을 입증하며, 이를 통해 Mamba의 컨볼루션 기반 아키텍처와 베이즈/미니맥스 최적 통계적 추정 사이의 첫 번째 공식적인 연결 고리를 이론적으로 확립한다.

원저자: Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 새로운 종류의 AI 두뇌

현재 인공지능의 슈퍼스타인 트랜스포머(Transformer)(대부분의 챗봇을 움직이는 엔진)를 아주 똑똑하지만 몸집이 큰 사서라고 상상해 보세요. 이 사서는 책 한 권을 통째로 읽고 즉각적으로 연결 고리를 찾아낼 수 있지만, 모든 단어를 한꺼번에 기억하려고 하기 때문에 책이 너무 길어지면 지치고 느려집니다.

여기에 **맘바(Mamba)**라는 더 새로운 유형의 AI 모델이 등장합니다. 맘바는 민첩하고 빠르게 달리는 전령과 같습니다. 정보를 훨씬 더 빠르게 처리하고 메모리도 적게 사용하여, 무거운 사서를 대체할 유망한 대안이 됩니다. 하지만 과학자들은 이 전령이 어떻게 그렇게 똑똑한지 그 비결을 완전히 이해하지 못했습니다. 그들은 맘다가 잘 작동한다는 것은 알았지만, 그 '비법 소스'가 무엇인지는 몰랐습니다.

이 논문은 탐정 이야기처럼, 맘다가 **마르코프 체인(Markov Chains)**이라는 특정 유형의 퍼즐을 정확히 어떻게 해결하는지 밝혀내는 과정을 다룹니다.

퍼즐: 다음 단계 예측하기

연구진은 맘다에게 "다음 토큰 예측(Next Token Prediction)"이라는 게임을 주어 테스트했습니다.

  • 설정: 색깔 구슬의 배열(빨강, 파랑, 빨강, 빨강, 파랑...)과 같은 일련의 사건들을 상상해 보세요.
  • 규칙: 다음 구슬의 색깔은 바로 직전의 구슬 색깔들에 의해 결정됩니다. 이것이 바로 "마르코프 체인"입니다.
  • 도전 과제: 모델은 무작위 구슬 문자열을 보고 다음 구슬을 맞춰야 합니다. 결정적인 점은, 게임의 규칙(파랑 다음에 빨강이 나올 확률 등)이 새로운 문자열마다 바뀐다는 것입니다. 모델은 현재의 문자열을 보는 것만으로 실시간으로 규칙을 파악해야 합니다. 이를 **인컨텍스트 러닝(In-Context Learning, ICL)**이라고 부릅니다.

발견: 맘다는 완벽한 통계학자이다

연구진은 놀라운 사실을 발견했습니다. 단 한 개의 층(single-layer)만 가진 매우 단순한 버전의 맘다조차도 이 게임을 위한 완벽한 통계학자가 되는 법을 배웠다는 것입니다.

통계학의 세계에는 규칙을 완벽히 모를 때 다음 구슬을 추측하는 "골드 스탠다드(표준 방식)"가 있습니다. 이를 라플라스 평활화(Laplacian Smoothing) 또는 "Add-β\beta 추정량"이라고 합니다.

  • 비유: 여러분이 카드 덱에서 다음 카드를 맞추고 있다고 상상해 보세요. 만약 지금까지 에이스(Ace)를 10번 봤고 킹(King)을 한 번도 못 봤다면, 여러분은 다음 카드도 에이스일 것이라고 추측할 것입니다. 하지만 똑똑한 통계학자는 "잠깐, 아직 킹을 본 적이 없으니, 단지 운이 나빴던 것일 수도 있어"라고 생각합니다. 그래서 그들은 너무 확신에 빠지지 않기 위해 카운트에 아주 작은 "유령" 킹을 추가합니다. 이는 아직 보지 못한 것에 대해 "확률 0%!"라고 말하는 것을 방지합니다 именно 합니다.

논문의 주장: 맘다는 단순히 추측하는 것이 아니라, 수학적으로 이 정확한 "유령 카운팅"을 완벽하게 수행하도록 학습됩니다. 맘다는 이전 패턴들의 횟수를 계산하고, 마치 최적의 통계 공식이 요구하는 것처럼 자동으로 그 미세한 "평활화(smoothing)"를 적용합니다.

비밀 재료: 컨볼루션 "손전등"

연구진은 질문했습니다. 맘다는 어떻게 이 일을 해내는가? 그것이 복잡한 게이팅 메커니즘 때문인가? 아니면 비선형 활성화 함수 때문인가?

그들은 어떤 부분이 망가지는지 확인하기 위해 맘다의 부품들을 제거하며 실험을 진행했습니다.

  • 발견: 가장 중요한 부분은 **컨볼루션(Convolution)**이었습니다.
  • 비유: 컨볼루션을 맘다가 최근의 과거를 비추는 손전등이라고 생각해 보세요.
    • 다음 구슬을 예측하기 위해 맘다는 다음과 같은 것을 알아야 합니다: "최근 몇 단계 동안 '파랑' 다음에 '빨강'이 몇 번 나왔는가?"
    • 컨볼루션은 과거의 기록 위를 미끄러지듯 움직이며 이러한 패턴들을 즉각적으로 세어주는 창문 역할을 합니다.
    • 연구진은 만약 손전등(컨볼루션)을 없애면 맘다가 눈이 멀어 임무에 실패한다는 것을 발견했습니다. 반대로, 손전등만 남기고 복잡한 게이팅(gating)을 제거하더라도 맘다는 여전히 퍼즐을 완벽하게 풀어냈습니다.

핵심 요점: "손전등"(컨볼루션)이 바로 주인공입니다. 이것 덕분에 맘다는 과거를 돌아보고, 패턴의 발생 횟수를 세며, 복잡하고 깊은 뇌 없이도 최적의 통계적 평활화를 적용할 수 있습니다.

한계: 손전등은 얼마나 커야 하는가?

논문은 이 퍼즐이 얼마나 어려워지는지도 살펴보았습니다.

  • 만약 게임이 마지막 1개의 구슬에 의존한다면(1차 마르코프 체인), 작은 손전등으로도 충분합니다.
  • 만약 게임이 마지막 5개의 구슬에 의존한다면(5차 마르코프 체인), 5개의 구슬을 한꺼번에 볼 수 있도록 손전등이 더 넓어져야 합니다.
  • 정리(Theorem): 논문은 kk개의 이전 단계를 다루는 게임을 처리하기 위해, 모델의 "메모리 크기"(숨겨진 차원)가 kk에 따라 기하급수적으로 커져야 함을 증명합니다. 이는 마치 비밀번호를 외우는 것과 같습니다. 비밀번호가 길어질수록, 그것을 한꺼번에 머릿속에 담아두는 것은 기하급수적으로 어려워집니다.

트랜스포머와의 비교

이 논문은 맘다와 트랜스포머(무거운 사서)를 비교합니다.

  • 트랜스포머: 이 "카운팅" 퍼즐을 풀기 위해, 트랜스포머는 보통 패턴을 세는 "유도 헤드(induction head)"라는 메커니즘을 구축하기 위해 두 개의 층(함께 작동하는 두 개의 뇌)이 필요합니다. 단일 층 트랜스포머는 실패합니다.
  • 맘다: 맘다는 컨볼루션 메커니즘이 내장되어 있고 카운팅에 효율적이기 때문에, 단 한 개의 층만으로도 즉시 문제를 해결합니다.

요약

이 논문은 맘다의 맥락 학습(In-Context Learning) 능력이 갖는 초능력이 특정 구조적 특징인 **컨볼루션(Convolution)**에서 온다는 것을 밝혀냈습니다.

  1. 맘다는 **라플라스 평활화(Laplacian Smoothing)**라는 방법을 사용하여 완벽한 통계학자처럼 행동하도록 학습됩니다.
  2. 맘다는 과거의 패턴을 세고 올바른 통계적 조정을 적용하기 위해 **컨볼루션 "손전등"**을 사용합니다.
  3. 이는 트랜스포머가 동일한 작업을 수행하기 위해 더 많은 복잡성을 필요로 하는 것과 달리, 매우 단순한 단일 층 모델에서도 일어납니다.

저자들은 이것이 맘다를 최적의 통계적 추정치와 공식적으로 연결한 첫 번째 사례이며, 맘다가 단순히 빠른 모델일 뿐만 아니라 데이터를 효율적으로 세고 평활화하는 법을 근본적으로 이해하고 있음을 증명했다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →