Toward a mechanistic understanding of inference in visual cortex and diffusion models
본 논문은 V1 수평 연결을 모방하여 고성능 이미지 노이즈 제거를 달성하는 동시에 생물학적 지각 추론과 블랙박스 확산 아키텍처의 내부 작동 방식 모두에 대한 기계론적 통찰을 제공하는, 쌍별 상호작용을 포함한 희소 코딩 기반의 최소한의 해석 가능한 확산 모델을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
뇌의 탐정 놀이와 AI의 꿈 생성기
당신이 미스터리를 풀려고 노력 중인데, 단서들이 여기저기 흩어져 있고, 흐릿하며, 그중 절반은 사라진 상태라고 상상해 보십시오. 이것은 당신이 세상을 볼 때마다 일어나는 바로 그 현상입니다. 당신의 눈은 단순히 완벽한 사진을 찍는 것이 아니라, 빛과 그림자가 뒤섞인 혼란스러운 덩어리를 받아들입니다. 이를 이해하기 위해 뇌는 탐정처럼 행동하여, 빈틈을 채우고 전체 그림이 어떤 모습일지 추측해야 합니다. 이 과정을 "지각적 추론(perceptual inference)"이라고 부릅니다. 수십 년 동안 과학자들은 뇌가 어떻게 이 일을 이토록 손쉽게 해내는지 궁금해해 왔습니다. 그들은 시각 피질(시각 정보를 처리하는 뇌의 부분)의 뉴런들이 마치 무엇을 보고 있는지 합의하기 위해 서로 대화하는 친구들의 네트워크처럼 특정한 방식으로 연결되어 있다는 것을 알고 있습니다.
동시에, "확산 모델(diffusion model)"이라 불리는 새로운 종류의 인공지능이 멋진 이미지를 만들어내는 것으로 유명해졌습니다. 이 AI 시스템들은 오래된 TV 화면의 노이즈 같은 순수한 정적 노이즈에서 시작하여, 선명한 이미지가 나타날 때까지 천천히 깨끗하게 다듬는 방식으로 작동합니다. 이들은 매우 뛰어나지만, 동시에 "블랙박스"이기도 합니다. 우리는 그것들이 작동한다는 것은 알지만, 그 안의 수백만 개의 작은 디지털 뉴런들이 어떻게 개나 얼굴의 형태를 결정하는지는 실제로 알지 못합니다. 여기서 큰 질문이 생깁니다. 인간의 뇌와 이 AI 모델들은 퍼즐을 풀기 위해 동일한 비밀스러운 기술을 사용하고 있는 것일까요? 만약 우리가 AI가 따르고 있는 규칙을 파악할 수 있다면, 어쩌면 우리 자신의 뇌가 어떻게 작동하는지도 마침내 이해할 수 있을지 모릅니다.
논문의 핵심 아이디어: 거대한 뇌를 가진 단순한 모델
이 논문은 인간의 뇌가 보는 방식과 AI가 이미지를 생성하는 방식 사이의 간극을 메우려는 새로운, 단순화된 모델을 소개합니다. 저자들(UC 버클리 및 기타 기관의 연구진)은 뇌에서 시각 정보가 처음 도착하는 지점인 일차 시각 피질(V1)을 모방한 컴퓨터 프로그램을 구축했습니다. 읽어내기 불가능할 정도로 거대하고 복잡한 딥러닝 네트워크를 사용하는 대신, 그들은 **희소 코딩(sparse coding)**이라는 개념에 기반한 "최소한의" 모델을 만들었습니다.
희소 코딩을 그림을 만들기 위해 몇 가지 특정 조각만을 사용하는 퍼즐이라고 생각해 보십시오. 뇌에서 이것은 이미지를 표현하기 위해 특정 시점에 오직 소수의 뉴런만이 활성화된다는 것을 의미합니다. 저자들은 이 아이디어에 한 가지 변형을 가했습니다. 그들은 뉴런들이 특정한 방식으로 서로 영향을 주고받을 수 있도록 허용했습니다. 표준 모델에서 뉴런들은 종종 독립적인 작업자처럼 취급됩니다. 하지만 이 새로운 모델에서 저자들은 뉴런들에게 "사회적 네트워크(상호작용 행렬)"를 부여하여, 서로에게 영향을 미칠 수 있게 했습니다. 이를 통해 모델은 이미지의 한 부분이 위로 향하는 선을 가지고 있다면, 다음 부분도 그 선을 이어갈 가능성이 높다는 것을 학습할 수 있습니다. 설령 이미지가 노이즈가 많거나 끊겨 있더라도 말입니다.
그들이 발견한 것: 뇌의 "사회적 네트워크"
연구진이 자연스러운 이미지(풍경이나 사물 사진 등)로 이 모델을 훈련시켰을 때, 놀라운 일이 일어났습니다. 모델이 학습한 "사회적 네트워크"는 실제 인간의 뇌에서 발견되는 물리적 연결과 똑같이 보였습니다. 구체적으로, 모델은 유사한 각도에 맞춰져 있고 한 줄로 늘어선 뉴로들 사이에 강한 연결을 발달시켰습니다. 이것은 **공선성 촉진(collinear facilitation)**이라고 알려져 있습니다.
현실 세계에서 이것은 왜 당신이 풀숲 사이로 기어가는 뱀의 일부가 가려져 있더라도 쉽게 알아볼 수 있는지를 설명해 줍니다. 당신의 뇌는 점들을 연결합니다. 논문은 이 모델 역시 동일한 일을 할 수 있음을 보여줍니다. 연구진이 끊어지거나 숨겨진 윤곽선(예를 들어 구름 뒤로 사라지는 선)이 있는 사진을 보여주었을 때, 모델은 단순히 무작위로 추측하지 않았습니다. 모델은 학습된 연결을 사용하여 빈 공간을 "채워 넣었고", 매끄럽고 연속적인 곡선을 만들어냈습니다. 이 성능은 거대하고 복잡한 AI 모델들과 거의 맞먹을 정도로 뛰어났지만, 엄청난 장점이 있었습니다. 모델이 단순하기 때문에 연구자들이 내부를 들여다보고 그것이 어떻게 작동하는지 실제로 볼 수 있었다는 점입니다.
비밀 레시피: AI가 "생각하는" 방식
이 논문에서 가장 흥고한 발견 중 하나는 모델이 "채우기" 과정을 어떻게 처리하는가 하는 점입니다. 저자들은 수학적 분석을 통해 모델이 단순히 추측하는 것이 아니라, 연못에 퍼지는 파동처럼 활동을 퍼뜨린다는 것을 보여주었습니다. 어떤 뉴런이 선의 일부를 감지하면, 그것은 이웃 뉴런들에게 신호를 보냅니다. 만약 그 이웃들도 활성화되어 있고 정렬되어 있다면, 신호는 더 강해지며 그곳에 선이 존재한다는 생각을 강화합니다. 만약 이웃들이 정렬되지 않았거나 비활성 상태라면, 신호는 차단됩니다.
논문은 이 과정이 모델이 단 하나의 층(layer)만을 가지고 있음에도 불구하고 "계층 구조"를 만든다고 제안합니다. 모델의 뉴런 중 약 30%는 직접적인 시각 입력으로부터 완전히 단절되는 법을 배웠습니다. 이 "분리된 뉴런들"은 모델이 전체적인 그림을 이해하도록 돕는 두 번째의 숨겨진 층처럼 작동합니다. 이들은 픽셀을 보는 것이 아니라, 얼굴의 양쪽 눈이 서로의 상대적 위치에 적절히 배치되도록 하는 것과 같은 전역적인 규칙을 집행하는 데 도움을 줍니다. 이는 모델이 이전에 본 적 없는 정확한 얼굴이라 할지라도, 어떻게 실감 나는 전체 얼굴을 생성할 수 있는지를 설명해 줍니다. 그것은 암기하는 것이 아니라, 얼굴의 기하학적 구조를 이해하는 것입니다.
이것이 중요한 이유: AI에서 생물학으로
이 논문은 현대의 복잡하고 신비로운 AI 확산 모델의 행동이 사실 우리의 시각 피질에서 발견되는 동일하고 단순한 생물학적 원리에 의해 구동될 수 있음을 시사합니다. 딥러닝의 "블랙박스"는 어쩌면 저자들이 구축한 단순한 재귀 회로의 매우 복잡한 버전일 뿐일지도 모릅니다.
단순하고 해석 가능한 모델이 거대한 AI 시스템의 성능과 일치할 수 있음을 증명함으로써, 저자들은 뇌를 연구하는 새로운 방법을 제시합니다. 그들은 시각 체계가 이러한 특정한 연결을 사용하여 모호함을 해결하고, 노이즈가 많고 혼란스러운 세상을 명확하고 일관된 그림으로 바꾼다고 제안합니다. 이것은 단순한 이론이 아닙니다. 다양한 유형의 노이즈에 대해 뉴런이 어떻게 반응해야 하는지에 대한 모델의 예측은 실제 생물학적 뇌에서의 최근 실험 결과들과 일치합니다.
요약하자면, 이 논문은 보는 것과 예술을 창조하는 것 모두의 비밀이 동일할 수 있음을 시사합니다. 즉, 국소적인 단서들이 서로 연결되어 전역적인 이야기를 형성할 수 있게 해주는 단순한 규칙의 집합입니다. 당신의 뇌 속 뉴런이든 AI의 디지털 가중치든, 목표는 혼돈 속에서 패턴을 찾아내는 것입니다. 그리고 이제, 이 모델 덕분에 우리는 그 패턴이 어떻게 출현하는지에 대한 훨씬 더 명확한 지도를 갖게 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.