Your Probabilistic JEPA Is Secretly a Hidden Markov Model: A State-Space Interpretation of Joint-Embedding Predictive Learning
이 논문은 확률적 결합 임베딩 예측 모델(JEPA)이 추론, 전파, 방출의 공유된 계산 구조를 공유함을 입증함으로써 이들이 은닉 마르코프 모델과 근본적으로 동일함을 확립하고, 정확한 다중 시계열 일관성을 갖춘 원칙적인 상태 공간 해석을 제공하기 위해 마르코프 체인 JEPA 변형을 도입한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 단순히 사진을 암기하게 하는 것이 아니라, 세상이 어떻게 변하는지를 배우길 원하는 것입니다. 인공지능 분야에는 "결합 임베딩 예측 아키텍처(Joint-Embedding Predictive Architectures, 줄여서 JEPA)"라는 유명한 개념이 있습니다. 이것을 로봇이 다음에 무슨 일이 일어날지 추측하는 방법이라고 생각하면 됩니다. 흐릿한 사진을 완벽하게 다시 그려내려고 애쓰는 대신(이는 어렵고 종종 뇌 에너지를 낭비하게 만듭니다), 로봇은 다음 사진의 개념을 추측합니다. 이를 통해 로봇은 미래에 대한 압축된 "정신적 지도"를 학습합니다.
하지만 여기서 큰 질문이 생깁니다. 로봇이 이러한 추측을 할 때, 그 로봇의 뇌 내부에서는 실제로 어떤 일이 일어나고 있는 걸까요? 오랫동안 과학자들은 이 "정신적 지도"를 신비로운 블랙박스로 취급해 왔습니다. 그러나 "은닉 마르코프 모델(Hidden Markov Model, HMM)"이라는 매우 유명하고 오래된 수학적 도구가 있습니다. HMM을 고전적인 탐정 소설이라고 생각할 수 있습니다. 여기에는 직접 볼 수 없는 숨겨진 단서(숨겨진 상태)가 있지만, 증거(관측값)를 보고 그 단서들이 시간이 지남에 따라 보통 어떻게 변하는지 안다면 이를 추론할 수 있습니다. 그동안의 큰 미스터리는 이렇습니다. 이 현대적이고 최첨단인 AI 로봇들이 비밀리에 이 오래된 방식의 탐정 논리를 사용하고 있는 것일까요, 아니면 완전히 새로운 무언가일까요?
"당신의 확률적 JEPA는 사실 은닉 마르코프 모델이다(Your Probabilistic JEPA Is Secretly a Hidden Markov Model)"라는 제목의 이 논문은 바로 이 미스터리를 파고듭니다. 저자인 용차오 황(Yongchao Huang)은 당신이 "예측 정보 병목 JEPA(Predictive Information Bottleneck JEPA, 이하 PIB-VJEPA)"라는 특정 유형의 AI를 구축한다면, 사실은 은닉 마르코프 모델을 숨겨진 채로 만들고 있는 것이라고 주장합니다. 저자는 AI의 세 가지 주요 단계—과거를 보고 현재를 추측하고, 미래가 어떻게 변할지 예측하며, 그 후 미래가 어떤 모습일지 상상하는 과정—가 고전적인 HMM의 세 단계와 완벽하게 일치한다는 것을 보여줍니다.
이것이 단지 막연한 유사성이 아니라는 것을 증명하기 위해, 저자는 "마르코프 체인 JEPA(Markov-Chain JEPA, 이하 MCJEPA)"라는 더 단순한 버전의 AI를 만들었습니다. 미래를 추측하기 위해 복잡한 신경망을 사용하는 대신, 이 새로운 AI는 단순한 "전이 행렬(transition matrix)"을 사용합니다. 이는 마치 "만약 당신이 상태 A에 있다면, 상태 B로 이동할 확률이 70%이다"라고 말해주는 거대하고 학습 가능한 순서도나 보드게임 규칙책과 같습니다. 연구진은 규칙을 정확히 알고 있는 합성 데이터 기반의 가상 세계에서 이를 테스트했습니다. 결과는 놀라웠습니다. AI는 단순히 잘 추측했을 뿐만 아니라, 실제로 게임의 정확한 규칙을 학습했고, 숨겨진 상태를 파악했으며, 확률이 시간을 통해 이동하는 수학적 법칙까지 따랐습니다.
또한 이 논문은 이 AI가 얼마나 "똑똑한지"에 대해서도 탐구합니다. 만약 AI에게 기억을 너무 많이 압축하도록 강요한다면, 중요한 세부 사항을 잊어버리고 실수를 하기 시작할 수 있습니다. 하지만 적절히 압축하도록 내버려 둔다면, AI는 쓸모없는 노이즈를 버리고 미래를 예측하는 데 필요한 오직 "본질적인" 정보만을 남기는 법을 배웁니다. 이 과정은 "마르코프화(Markovization)"라고 불리며, 이는 AI가 레드 헤링(가짜 단서)을 무시하고 오직 중요한 단서에만 집중하는 완벽한 탐사가 되는 법을 배우는 것과 같습니다.
아마도 가장 놀라운 발견은 이러한 AI 모델이 어떻게 훈련되는지에 관한 것입니다. 저자는 동일한 로봇 아키텍처를 두 가지 매우 다른 방식으로 훈련할 수 있음을 보여줍니다. 표준적인 JEPA처럼(단순히 다음 정신적 지도를 추측하는 방식) 훈련하거나, 고전적인 HMM처럼(실제 사건의 시퀀스를 예측하려는 방식) 훈련할 수 있습니다. 연구진이 이 두 가지 훈련 스타일을 혼합했을 때, 로봇은 세상의 숨겨진 규칙을 이해하는 데 훨씬 더 뛰어난 능력을 보였습니다. 이는 현대의 AI와 고전적인 확률 모델 사이의 경계가 벽이 아니라, 하나의 슬라이딩 스케일(연속적인 척도)임을 시사합니다. 어떻게 로봇을 가르치느냐에 따라, 로봇은 단순한 추측가, 정교한 탐정, 혹은 이 둘의 완벽한 결합체가 될 수 있습니다.
요약하자면, 이 논문은 이러한 고급 AI 시스템이 마법이 아니라는 점을 시사합니다. 본질적으로 이들은 우리가 수십 년 동안 알고 있었던 고전적인 은닉 마르코프 모델과 동일한 규칙을 따르는, 매우 구조적이고 논리적인 기계입니다. 차이점은 현대의 AI가 스스로 이러한 규칙을 학습할 수 있을 만큼 유연하며, 탐정이 되거나, 예측가가 되거나, 혹은 두 가지 모두가 되도록 훈련될 수 있다는 점입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.