← 최신 논문
🧬 biology

A Hierarchical Energy-Based Model for Multimodal Cognition

이 논문은 시각과 언어를 허브 앤 스포크(hub-and-spoke) 구조를 통해 통합하는 계층적 에너지 기반 모델인 IM-LEPP를 제안하며, 이는 주의 집중 현상을 설명하고 심리언어학적 발견과 일치하며 트랜스포머 기반 모델들과 구별되는 예측을 제공하는 다중 모달 인지의 기계론적이고 효과적인 이론을 제공한다.

원저자: Subir Varma

게시일 2026-08-14
📖 5 분 읽기🧠 심층 분석

원저자: Subir Varma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

뇌의 비밀 기상도

도시가 어떻게 작동하는지 이해하려고 노력한다고 상상해 보십시오. 모든 건물의 벽돌 하나하나를 연구할 수도 있겠지만, 도시가 어떻게 '느껴지고' '움직이는지' 이해하기 위해 교통 패턴, 날씨, 그리고 사람들의 흐름을 살펴볼 수도 있습니다. 뇌 과학의 세계에서도 어떤 접근 방식이 더 나은지에 대한 큰 논쟁이 있습니다. 어떤 과학자들은 모든 뉴런을 벽돌 하나하나를 그리는 청사진처럼 매핑하고 싶어 합니다. 반면, 이 논문의 저자와 같은 이들은 우리가 마음의 '날씨'를 바라봐야 한다고 제안합니다. 그들은 우리의 생각과 지각이 단순히 불꽃을 튀기는 전선들의 집합이 아니라, 마치 공이 언덕 아래로 굴러가거나 강이 바다를 향해 길을 찾아가는 것처럼, 에너지의 풍경 위를 움직이는 상태의 흐름이라고 제안합니다.

이 아이디어는 **예측 처리(predictive processing)**라는 개념에 기반합니다. 당신의 뇌를 단순히 보는 것을 기록하는 카메라가 아니라, 매우 똑똑한 추측가라고 생각해 보십시오. 매 초마다 당신의 뇌는 다음에 무슨 일이 일어날지—어떤 소리가 들릴지, 어떤 모양이 보일지, 혹은 문장에서 다음에 어떤 단어가 올지—에 대해 끊임없이 예측을 합니다. 당신의 감각이 그 추측과 일치할 때, 모든 것은 매끄럽게 느껴집니다. 하지만 현실이 당신을 놀라게 할 때(예를 들어, 조용할 것이라 예상했는데 개가 짖는 경우), 당신의 뇌는 그 추측을 업데이트하기 위해 더 열심히 노력해야 합니다. 이 논문은 뇌가 자신의 내부 모델을 지속적으로 조정함으로써 이러한 '놀라움' 또는 '오차'를 최소화한다는 아이디어를 구축합니다. 이는 마치 방의 온도를 완벽하게 유지하려고 노력하는 온도 조절기와 같으며, 다만 열 대신 당신의 세계에 대한 이해를 정확하게 유지하려 한다는 점이 다릅니다.

거대한 뇌의 허브: IM-LEPP

IM-LEPP(통합 다중 양식 잠재 에너지 기반 예측 처리, Integrated Multimodal Latent Energy-based Predictive Processing)의 등장을 주목하십시오. 수비르 바르마(Subir Varma)가 제안한 이 새로운 모델은 당신의 뇌를 거대하고 북적이는 공항이라고 상상하게 합니다. 이 공항에서 서로 다른 터미널은 서로 다른 유형의 정보를 처리합니다. 시각(세상을 보는 것)을 위한 터미널, 언어(단어를 듣고 읽는 것)를 위한 터미널, 그리고 감정과 소리를 위한 다른 터미널들이 있습니다. 오랫동안 과학자들은 이 분리된 터미널들이 어떻게 서로 대화하는지 궁금해했습니다. 어떻게 빨간 사과를 보는 것이 즉각적으로 '사과'라는 단어와 배고픔이라는 느낌과 연결될 수 있을까요?

바르마의 논문은 이 모든 터미널이 **전측두엽(Anterior Temporal Lobe, ATL)**이라 불리는 뇌의 특정 부위에 위치한 중앙 '관제탑'으로 보고를 보낸다고 제안합니다. 이 타워는 모든 서로 다른 정보의 흐름이 하나의 통일된 현실의 모습으로 합쳐지는 거대한 허브 역할을 합니다. 이 모델이 '허브 앤 스포크(Hub-and-Spoke)'라고 불리는 이유는 터미널(스포크)들이 중앙 허브로 정보를 공급하고, 허브가 다시 터미널로 명령을 보내기 때문입니다.

여기 마술 같은 트릭이 있습니다. 이 모델은 뇌가 지금까지 들었던 모든 단어나 보았던 모든 이미지를 거대한 목록으로 저장하는 것이 아니라고 제안합니다. 대신, 뇌는 '확산(diffusion)' 과정을 사용하는데, 이는 마치 가능성들의 느리고 신중한 춤과 같습니다. 당신이 어떤 장면을 볼 때, 뇌는 단순히 사진을 찍는 것이 아니라 다음 순간이 어떻게 보일지 예측을 생성합니다. 만약 공이 튀어 오르는 것을 보고 있다면, 뇌는 공이 다음에 어디에 있을지 예측합니다. 문장을 읽고 있다면, 다음 단어를 예측합니다.

IM-LEPP가 특별한 점은 시각과 언어의 차이를 처리하는 방식에 있습니다. 당신의 눈은 비디오처럼 연속적인 흐름 속에서 세상을 봅니다. 하지만 언어는 디딤돌의 연속처럼 덩어리(단어)로 들어옵니다. 모델은 시각 터미널은 계속 업데이트되는 반면, 언어 터미널은 폭발적으로 업데이트되도록 함으로써 이 문제를 해결합니다. 중앙 허브는 번역가 역할을 하여, 빠르게 움직이는 시각적 흐름과 느리게 움직이는 단어의 흐름을 가져와 하나의 매끄러운 경험으로 혼합합니다. 이것은 왜 당신이 자동차가 지나가는 것을 보면서도 뇌가 두 감각의 서로 다른 속도 때문에 혼란을 겪지 않고 즉시 "저 차는 빨간색이다"라는 문장을 이해할 수 있는지를 설명해 줍니다.

이것이 중요한 이유: '맹점'과 '정원 길(Garden Path)' 문제 해결

이 논문은 이 모델을 사용하여 우리가 생각하는 방식에 관한 매우 기묘한 현상들을 설명합니다.

첫째, **부주의에 의한 맹시(Inattentional Blindness)**를 고려해 보십시오. 사람들이 농구공을 패스하는 동안 고릴라 옷을 입은 사람이 장면을 가로질러 지나가는데, 관찰자의 절반은 고릴라를 보지 못하는 유명한 영상을 알고 계실 것입니다. 논문은 이것이 당신의 뇌가 당신이 능동적으로 주의를 기울이고 있는 것들에 대해서만 상세한 '파이프라인'을 구축하기 때문에 발생한다고 제안합니다. 만약 당신이 공에 집중하고 있다면, 당신의 뇌는 공을 위한 강력한 예측 모델을 구축합니다. 당신의 초점 밖에 있는 고릴라는 전용 파이프라인을 할당받지 못합니다. 고릴라는 당신의 예측을 깨뜨릴 만큼 놀라운 행동을 하기 전까지는 그저 배경 '소음'의 일부일 뿐입니다. 모델은 당신의 뇌가 추적하기로 결정하지 않은 것들에 대해 본질적으로 '눈이 멀어 있음'을 보여줍니다.

둘-째, 모델은 **정원 길 문장(Garden-Path Sentences)**을 설명합니다. 이는 "The horse raced past the barn fell(헛간을 지나 달려간 말이 쓰러졌다)"처럼 당신을 속이는 문장들입니다. 이 문장을 읽을 때, 당신의 뇌는 'raced'가 주요 동작이라고 예측합니다. 하지만 'fell'에 도달하면, 당신의 뇌는 말이 경주를 하는 주체가 아니라 경주를 당하는 대상이었다는 것을 깨닫기 위해 갑작스럽고 격렬한 유턴을 해야 합니다. 논문은 이것이 단순한 실수가 아니라 물리적인 '에너지 점프'라고 제안합니다. 당신의 뇌는 낮은 에너지의 골짜기(잘못된 의미)에 갇혔다가, 올바른 골짜기(올바른 의미)로 넘어가기 위해 커다란 놀라움의 에너지가 필요합니다.

인간의 뇌와 AI의 차이점

논문은 인간이 언어를 배우는 방식과 현대 AI(당신이 알 법한 챗봇들)가 언어를 배우는 방식 사이에 명확한 선을 긋습니다. AI 모델은 인터넷 전체를 읽었지만 실제 사과를 보거나 태양을 느껴본 적은 없는 학생들과 같습니다. 그들은 순수하게 어떤 단어들이 서로 옆에 나타나는지를 보고 언어를 학습합니다. 그들은 '사과'가 어떤 '느낌'인지 모릅니다.

IM-LEPP는 인간 어린이가 다르게 학습한다고 제안합니다. 우리의 언어 허브가 시각 및 감각 허브와 연결되어 있기 때문에, 아이는 '사과'라는 단어를 실제 사과의 시각적, 촉각적 경험과 연결하며 배웁니다. 이를 **접지(grounding)**라고 합니다. 논문은 이것이 왜 아이들이 AI가 필요로 하는 것보다 훨씬 적은 데이터로도 말을 배울 수 있는지를 설명한다고 제안합니다. 아이들은 단순히 단어 패턴을 암기하는 것이 아니라, 단어를 현실 세계의 풍부하고 기존에 존재하는 지도에 부착하고 있는 것입니다.

이 논문이 아직 말하지 못한 것 (미지의 영역)

이 논문은 하나의 제안이며, 뇌가 어떻게 작동할 수도 있는지에 대한 청사진이라는 점을 명시하는 것이 중요합니다. 저자는 아직 인간처럼 보고 말할 수 있는 완전히 기능하는 로봇 뇌를 구축하지 못했습니다. 그들은 자신들의 수학적 모델이 왜 우리가 까다로운 문장에서 혼란을 느끼는지, 혹은 왜 영상 속의 고릴라를 놓치는지와 같은 현상들을 설명할 수 있음을 보여주었습니다. 그들은 만약 이 정확한 규칙들을 사용하여 컴퓨터 프로그램을 만든다면, 그것이 특정 방식에서 인간의 뇌처럼 행동할 것이라고 제안합니다.

또한 논문은 여전히 미스터리가 남아 있음을 인정합니다. 예를 들어, 이 모델은 뇌가 특정 사건(예: 당신의 생일 파티)에 대한 장기 기억과 일반적인 사실(예: 개가 무엇인지)을 어떻게 구분하여 저장하는지를 완전히 설명하지 못합니다. 논문은 무언가 놀랍거나 감정적인 일이 일어날 때만 뇌가 기억을 기록한다고 제안하지만, 이 '기억 파일 시스템'의 정확한 세부 사항은 향후 연구 과제로 남겨두었습니다.

요약하자면, IM-LEPP는 마음을 바라보는 유쾌하고 에너지 넘치는 방식을 제공합니다. 마음은 정적인 컴퓨터가 아니라, 우리의 주의, 감각, 그리고 단어들이 끊임없이 충돌하고 섞이며 현실의 이야기를 만들어내는 역동적이고 구르는 풍경입니다. 이는 인간 지능의 비밀이 단순히 거대한 데이터베이스를 갖는 것이 아니라, 다음에 올 것을 예측하는 똑똑하고 접지된(grounded) 방식을 갖는 데 있다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →