← 최신 논문
🧬 biology

Task-guided cross-subject latent alignment: a multi-encoder-decoder VAE

본 논문은 사전 학습된 인공 신경망이 제공하는 공통의 스캐폴드에 신경 표현을 고정함으로써, 공유된 자극을 요구하지 않고도 우수한 피험자 간 신경 정렬과 일반화 가능한 디코딩을 달弦하는 다중 인코더-디코더 변이형 오토인코더(MED-VAE) 프레임워크를 소개한다.

원저자: Angeliki Papathanasiou, Jascha Achterberg, Thomas E. Nichols, Rui Ponte Costa

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Angeliki Papathanasiou, Jascha Achterberg, Thomas E. Nichols, Rui Ponte Costa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신은 비밀 코드로 쓰인 책을 번역하려고 노력 중이라고 상상해 보세요. 문제는 8명의 서로 다른 사람들이 있고, 각자 자신만의 독특한 버전의 코드를 가지고 있다는 점입니다. 비록 그들은 모두 똑같은 이야기를 읽고 있지만, 사람 A는 "사과"를 "빨간-과일-원"이라고 쓰고, 사람 B는 "아삭하고-달콤한"이라고 쓰며, 사람 C는 "과수원-1"이라고 씁니다.

이들이 무엇을 생각하고 있는지 이해하고 싶지만, 단어들이 서로 일치하지 않기 때문에 단순히 그들의 노트를 직접 비교할 수는 없습니다. 전통적으로 과학자들은 이 문제를 해결하기 위해 모든 사람이 동일한 872페이지의 책을 읽게 하여 공유된 페이지를 기반으로 사전을 구축하려 했습니다. 하지만 만약 사람들이 서로 다른 책을 읽고 있거나, 페이지가 겹치지 않는다면 어떻게 될까요? 기존의 방식은 실패합니다.

이 논문은 모든 사람이 같은 페이지를 읽을 필요 없이 이 문제를 해결하는 MED-VAE라는 새로운 도구를 소개합니다. 이 도구가 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. "만능 번역기" (ANN 스캐폴드)

사람들이 서로 직접 대화하도록 강요하는 대신, 연구진은 만능 번역기(인공 신경망, 구체적으로는 ResNet-50)를 도입합니다. 이 번역기는 이미 수백만 개의 이미지를 읽었으며, 표준적이고 완벽한 방식으로 "사과", "자동차", 또는 "사람"이 어떻게 생겼는지 정확히 알고 있습니다.

  • 기존 방식: 사람 A와 사람 B에게 똑같은 사과를 묘사하게 한 뒤, 그 묘사를 서로 맞추려고 시도합니다.
  • 새로운 방식: 사람 A에게 사과를 묘사하게 하고, 사람 B에게도 사과를 묘able하게 합니다. 그런 다음, 두 사람 모두에게 자신의 묘사를 만능 번역기의 언어로 번역하도록 요청합니다.

만능 번역기는 사과가 무엇인지에 대한 완벽하고 공유된 정의를 가지고 있기 때문에, 사람 A와 사람 B가 서로 대화한 적이 없더라도 번역기를 통해 대화할 때는 강제로 "같은 언어"를 사용하게 됩니다.

2. "양방향 도로" (아키텍처)

연구진은 두 개의 측면을 가진 기계를 만들었습니다:

  • 입력 측: 각 개인은 자신의 뇌 스캔(fMRI)을 만능 번역기의 언어로 바꾸는 개인용 번역기를 가집니다.
  • 출력 측: 공유된 디코더가 존재하며, 이는 만능 언어를 다시 만능 번역기의 원래 "완벽한" 이미지 특징으로 바꾸려고 시도합니다.

마법은 기계가 두 가지 일을 동시에 수행하도록 훈련될 때 일어납니다:

  1. 만능 언어가 완벽한 이미지로 다시 바뀔 수 있도록 합니다.
  2. 만능 언어가 다시 그 특정 사람의 뇌 스캔으로 바뀔 수 있도록 합니다.

이것은 모든 사람의 뇌 스캔에 "압박"을 가합니다. 기계를 만족시키기 위해서, 사람 A의 뇌 스캔과 사람 B의 뇌 스캔은 유사한 것(예: 고양이)을 볼 때마다 만능 언어 내의 정확히 같은 지점에 위치해야 합니다.

3. 결과: 더 나은 지도

연구진이 이를 테스트했을 때, 세 가지 주요한 사실을 발견했습니다:

  • 깔끔하게 정리된 도서관: 새로운 공유 공간에서 "책"(이미지)들은 카테고리별로 완벽하게 분류됩니다. 데이터의 지도를 보면, 모든 "동물"은 한 클러스터에 모여 있고, 모든 "탈것"은 다른 클러스터에 모여 있습니다. 기존 방식은 동물과 자동차가 뒤섞인 엉망진창인 더미와 같았습니다.
  • "공유 페이지" 불필요: SRM이나 프로크러스테스(Procrustes) 같은 기존 방식은 정렬을 배우기 위해 모든 사람이 동일한 872개의 이미지를 봐야 했습니다. MED-VAE는 이를 필요로 하지 않았습니다. 만능 번역기를 가이드로 사용하여 정렬을 학습했습니다.
  • 더 나은 예측: 정렬이 매우 잘 되어 있기 때문에, 사람 A의 뇌 활동을 가져와 만능 언어로 번역한 뒤, 다시 사람 B의 뇌 언어로 번역하면 사람 B의 뇌가 어떠했을지에 대해 매우 정확한 예측을 할 수 있습니다. 이는 마치 사람 B의 데이터를 한 번도 본 적이 없음에도 불구하고, 사람 A의 데이터를 통해 사람 B의 마음을 읽을 수 있는 것과 같습니다.

4. "노이즈" 필터

한 가지 흥-미로운 발견은 "노이즈"에 관한 것이었습니다. 기존 방식은 실험 도중에는 정확한 뇌 스캔을 재구성하는 데 더 뛰어난 성능을 보이는 것처럼 보였습니다. 그러나 연구진은 이것이 기존 방식이 데이터에 우연히 포함된 "정적"이나 "노이즈"(예: 사람의 심박수나 호흡)를 실수로 암기했기 때문이라는 것을 깨달았습니다.

새로운 시행(시그널이 실제인지 아니면 노이즈인지 확인하는 과정)에서 테스트했을 때, 기존 방식은 실패했습니다. 반면 MED-VAE는 노이즈를 무시하고 실제 신호만을 유지했습니다. 이는 기존 방식이 말소리와 함께 배경 소음까지 함께 녹음했다면, MED-VAE는 소음을 걸러내고 명확한 목소리만을 남긴 것과 같습니다.

요약

이 논문은 사람들이 같은 사진을 볼 필요 없이 서로 다른 사람들의 뇌 활동을 정렬하는 방법을 제시합니다. 이는 사전 훈련된 AI를 "공통의 토대" 또는 스캐폴드로 사용하여 이를 수행합니다. 이는 서로 다른 뇌를 비교할 수 있는 공유된 정신적 지도를 만들어내며, 우리가 세상을 어떻게 보는지에 대한 더 깊은 이해를 가능하게 하고, 한 사람의 뇌 활동을 바탕으로 다른 사람의 뇌 활동을 예측할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →