← 최신 논문
💻 computer science

Current Injection Spiking Neural Network for Infrared and Visible Image Fusion

본 논문은 새로운 전류 주입 연산자를 통해 막전위 수준에서 교차 모달 통합을 수행함으로써 적외선 및 가시광선 이미지 융합 시 이진 스파이크의 정보 손실 문제를 해결하고, 기존 ANN 기반 방식보다 현저히 낮은 추론 에너지로 최첨단 융합 품질을 달성하는 에너지 효율적인 스파이킹 신경망인 CIS-Fuse를 제안한다.

원저자: Rui Zhao, Zhuoyuan Li, Wenrui Li, Yanchen Dong, Yajing Zheng, Giuseppe Valenzise, Weisi Lin

게시일 2026-07-23
📖 7 분 읽기🧠 심층 분석

원저자: Rui Zhao, Zhuoyuan Li, Wenrui Li, Yanchen Dong, Yajing Zheng, Giuseppe Valenzise, Weisi Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어떤 상황에서도 완벽하게 볼 수 있는 로봇을 위한 궁극의 카메라를 만들려고 한다고 상상해 보세요. 당신에게는 두 개의 서로 다른 눈이 있습니다. 하나는 인간처럼 놀라운 색상과 질감을 보는 "가시광선" 눈이지만, 어둠 속이나 연기 속에서는 앞을 보지 못합니다. 다른 하나는 열을 감지하는 "적외선" 눈으로, 완전한 어둠이나 안개 속에서도 사람을 찾아낼 수 있지만, 흐릿하고 회색빛인 열 화상 덩어리처럼 보입니다. 목표는 이 두 눈을 하나로 합쳐서 두 세계의 장점만을 가진 슈퍼 비전 시스템을 만드는 것, 즉 **이미지 퓨전(Image Fusion)**입니다.

오랫동안 과학자들은 **인공 신경망(ANN)**을 사용하여 이를 수행하려고 노력해 왔습니다. 이것은 마치 모든 숫자가 얼마나 작거나 중요하지 않더라도 일일이 다 더하는, 매우 빠르지만 매우 피곤한 회계사와 같습니다. 이것은 잘 작동하지만, 우편물을 확인하기 위해 마라톤을 뛰는 것처럼 많은 에너지를 사용합니다.

이제 **스파이킹 신경망(SNN)**이 등장했습니다. 이것은 우리의 실제 뇌가 작동하는 방식에서 영감을 받았습니다. 숫자를 계속 더하는 대신, 이들은 무언가 흥미로운 일이 생길 때까지 기다리는 사람들이 가득 찬 방과 같습니다. 이들은 무언가 흥미로운 일이 발생할 때만 신호(스파이크)를 "발사"합니다. 이 덕분에 매우 에너지 효율적이며, 마치 누군가 방에 들어올 때만 켜지는 전구와 같습니다. 하지만 여기에는 함정이 있습니다. 뉴런이 소리를 지를 만큼 충분히 커질 때만 반응하기 때문에, 중요한 정보의 미세한 속삭임을 놓칠 수도 있다는 것입니다. 만약 열 신호가 너무 약해서 뉴런을 소리 지르게 만들지 못한다면, 그것은 무시될 것이고 로봇은 그 중요한 세부 정보를 잃게 됩니다.

여기서 이 문제를 해결하기 위해 등장한 새로운 논문이 있습니다. 연구진은 CIS-Fuse라고 불리는 영리한 트릭을 제안합니다. 이 방식은 뉴런이 소리를 지르기(스파이크를 발사하기) 전에 두 종류의 시각을 섞는 대신, 소리를 지르기 전에 신호를 섞습니다. 그들은 **전류 주입(Current Injection)**이라는 메커니즘을 사용하는데, 한쪽 눈에서 오는 조용하고 약한 신호를 다른 쪽 눈의 뉴런의 "배터리"(막 전위)에 부드럽게 주입하는 방식입니다. 이렇게 하면, 설령 적외선 신호가 단독으로는 소리를 지를 만큼 강하지 않더라도, 다른 눈의 신호와 결합되었을 때 뉴лу온을 한계점까지 밀어 올려 소리를 지르게 할 수 있습니다.

그 결과, 이 시스템은 "소리 지르는" 뇌의 초저에너지 절감 효과를 유지하면서도 미세한 디테일을 놓치지 않습니다. 연구팀은 네 가지 데이터셋에서 테스트를 진행했으며, CIS-Fuse가 에너지 소모가 큰 무거운 회계사들(ANN)만큼이나 좋은 융합 이미지를 생성하면서도, 실행하는 데 약 10배 적은 에너지를 사용한다는 것을 발견했습니다. 또한 이 융합된 이미지를 사용하는 로봇이 어둠 속에서 자동차와 사람을 더 잘 포착한다는 것을 보여주었으며, 이는 명확하게 보기 위해 많은 전력을 태울 필요가 없음을 증명합니다.

문제점: "너무 조용해서 소리 지를 수 없는" 딜레마

이 논문이 왜 중요한지 이해하려면, 정보를 처리하는 두 가지 매우 다른 방식 사이의 긴장 관계를 살펴봐야 합니다.

한쪽에는 현대 AI를 구동하는 **인공 신경망(ANN)**이 있습니다. 이것은 거대한, 연속적인 물줄기와 같습니다. 모든 물방울(모든 데이터)이 측정되고 함께 섞입니다. 이는 밝은 빛이든 희미한 그림자든 아주 작은 디테일까지 포착하는 데는 훌륭합니다. 하지만 비용이 많이 듭니다. 많은 컴퓨팅 파워를 요구하며, 이는 배터리를 빠르게 소모합니다. 이는 드론이나 자율주행차처럼 제한된 전력으로 하루 종일 작동해야 하는 기기들에게 문제가 됩니다.

다른 한쪽에는 **스파이킹 신경망(SNN)**이 있습니다. 이것은 디지털 버전의 신경계와 같습니다. SNN의 뉴런은 입력이 임계값을 넘을 만큼 충분히 들어올 때까지 조용히 앉아 있습니다. 일단 선을 넘으면, 단일한 이진 스파이크(1)를 발사합니다. 시스템이 흥미로운 일이 일 생길 때만 작동하기 때문에 이는 매우 효율적입니다.

문제는 SNN을 이미지 퓨전에 사용하려고 할 때 발생합니다. 퓨전은 적외선 카메라의 약한 신호(예: 사람의 희미한 열 신호)와 가시광선 카메라의 강한 신호(예: 나무의 질감)를 가져와 완벽하게 혼합해야 합니다. 표준적인 SNN에서는, 만약 적외선 신호가 뉴런을 발사시키기에 너무 약하다면, 그 신호는 버려집니다. 이는 마치 속삭임과 외침을 섞으려는 것과 같습니다. 만약 당신이 외침에만 귀를 기울인다면, 속삭임은 놓치게 됩니다. 이 논문은 이러한 "이진적" 특성이 퓨전의 핵심인 상호 보완적인 정보를 버리게 만든다고 주장합니다.

해결책: 소리 지르기 전에 섞기

이 논문의 저자들은 해결책이 **막 전위(membrane potential)**에 있다는 것을 깨달았습니다. 생물학적 뉴런(그리고 S SNN)에서, 뉴런이 발사되기 전에는 "배터리"(막 전위)에 전하를 축적합니다. 이 배터리는 입력이 아직 소리를 지를 만큼 강하지 않더라도 그 신호를 붙잡고 있습니다.

논문은 **전류 주입 스파이킹(Current Injection Spiking, CIS)**이라고 불리는 새로운 연산자를 제안합니다. 이것이 어떻게 작동하는지 쉬운 용어로 설명하면 다음과 같습니다:

  1. 설정: 두 개의 데이터 스트림을 상상해 보세요. 하나는 적외선 카메라에서, 다른 하나는 가시광선 카메라에서 옵니다.
  2. 주입: 두 스트림이 누가 먼저 소리를 지를지 싸우게 두는 대신, 시스템은 "보조" 스트림(예: 적외선)을 가져와서 메인 스트림(예: 가시광선)의 "배터리"에 "게이트 전류"로 주입합니다.
  3. 게이트(Gate): 스마트한 문지기(학습 가능한 게이트)가 보조 신호를 얼마나 들여보낼지 결정합니다. 또한 모든 정보 채널마다 특별한 다이얼(학습 가능한 스케일 계수)을 가지고 있어, 시스템이 "이 특정 디테일은 중요하니 높이자" 또는 "이것은 필요 없으니 낮게 유지하자"라고 말할 수 있게 합니다.
  4. 퓨션: 두 신호는 뉴런이 발사하기 에 배터리 내부에서 섞입니다. 이는 가시광선 신호만으로는 충분하지 않았더라도, 약한 적외선 신호가 뉴런을 한계점까지 밀어 올려 발사하도록 도울 수 있음을 의미합니다.

이 접근 방식은 일반적인 SNN에서 손실될 수 있는 "세밀한(fine-grained)" 반응을 보존합니다. 이는 마치 팀원 중 한 명이 목소리가 작더라도, 옆에 있는 사람이 크게 말하고 있다면 그 사람의 의견도 최종 결정에 기여할 수 있는 것과 같습니다. 단순히 목소리가 작다는 이유로 무시당하지 않는 것입니다.

아키텍처: 전문화된 운전자가 있는 2차선 고속도로

이것을 효과적으로 만들기 위해 연구진은 특정 네트워크 아키텍처를 구축했습니다. 단순히 아이디어를 무작에 섞은 것이 아니라, 독특한 반전이 있는 **이중 브랜치 시스템(dual-branch system)**을 설계했습니다.

그들은 이미지를 처리하는 두 개의 평행한 경로(브랜치)를 만들었습니다:

  • 얕은 브랜치(The Shallow Branch): 이 경로는 층이 적습니다(특별한 퓨전 모듈 한 블록만 있음).
  • 깊은 브랜치(The Deep Branch): 이 경로는 더 길며, 세 개의 퓨전 모듈 블록을 쌓아 올렸습니다.

처음에는 "왜 서로 다른 길이의 브랜치를 두 개나 두는가?"라는 의문이 들 수 있습니다. 논문은 이러한 비대칭성이 네트워크가 자연스럽게 전문화되도록 돕는다고 제안합니다. 훈련 후, "얕은" 브랜치와 "깊은" 브랜치는 서로 다르게 행동하기 시작했습니다. 얕은 브랜치는 가벼운 혼합을 학습한 반면, 깊은 브랜치는 강렬하고 헤비한 혼합을 학습했습니다. 이는 마치 주방에 두 명의 요리사가 있는 것과 같습니다. 한 명은 빠르고 가볍게 섞는 사람이고, 다른 한 명은 강력한 블렌더를 사용하는 사람입니다. 이들이 함께하여 모든 상황을 커버합니다.

또한 논문은 **재매개변수화된 출력 헤드(Reparameterized Output Head)**를 도입합니다. 이것은 훈련 중에는 시스템을 더 똑똑하게 만들지만, 실제 사용 시에는 더 단순하게 만드는 기술적 트릭입니다. 훈련 중에 시스템은 이미지들을 결합하는 최선의 방법을 배우기 위해 복잡한 다중 브랜치 구조를 사용합니다. 하지만 훈련이 끝나면, 시스템은 그 모든 브랜치를 하나의 단순한 컨볼루션 레이어로 "붕괴(collapse)"시킵니다. 이는 최종 결과물이 훈련의 복잡성이라는 짐 없이, 표준 레이어만큼 빠르고 단순하게 작동함을 의미합니다.

결과: 고품질, 저에너지

연구진은 네 가지 벤치마크(적외선 및 가시광선 이미지 데이터셋)에서 CIS-Fuse를 테스트하여 Text-IF, DCEvo, S4Fusion과 같은 강력한 모델들을 포함한 15가지의 최첨단 방법들과 비교했습니다.

시각적 품질:
결과는 CIS-Fuse가 최고의 ANN 기반 방법들만큼 좋은 융합 이미지를 생성한다는 것을 보여주었습니다. 실제로 모든 지표에서 평균 성능이 가장 높은 순위를 차지했습니다.

  • 어둠 속에서 사람과 자동차의 날카로운 열 윤곽을 보존했습니다.
  • 가시광선 이미지로부터 나무와 도로 표식의 미세한 질감을 유지했습니다.
  • 이미지를 흐릿하게 만들거나 디테일을 뭉개뜨리는 흔한 문제들도 발생시키지 않았습니다.

다운스트림 작업(Downstream Tasks):
논문은 단순히 예쁜 그림을 만드는 데 그치지 않았습니다. 이 융합된 이미지가 로봇이 실제로 더 잘 보는 데 도움이 되는지 테스트했습니다.

  • 객체 탐지(Object Detection): 이들은 융합된 이미지를 사용하여 YOLOv8s 탐지기(객체를 찾는 시스템)를 훈련했습니다. CIS-Fuse는 다른 모든 방법보다 높은 정확도(mAP 59.8)를 달-성하는 데 도움을 주었습니다. 특히 어려운 조건에서 사람과 자동차를 포착하는 데 뛰어났습니다.
  • 시맨틱 세그멘테이션(Semantic Segmentation): 또한 픽셀 단위로 라벨을 붙이는 시스템(색칠 공부와 유사)을 테스트했습니다. CIS-Fuse는 최고의 전체 점수(mIoU 74.3)를 기록했는데, 이는 자동차, 가드레일, 보행자와 같은 객체의 윤곽을 경쟁 모델들보다 더 정확하게 그려낼 수 있음을 의미합니다.

에너지 효율성:
이것이 이 논문의 "필살기"입니다. CIS-Fuse는 스파이킹 뉴런을 사용하기 때문에 스파이크가 발생할 때만 작동합니다.

  • 연구진은 뉴런의 "발사율(firing rate)"을 측정했고, 평균적으로 뉴런의 약 **14.48%**만이 특정 시간에 발사된다는 것을 발견했습니다.
  • 표준 에너지 모델을 사용하여, CIS-Fuse가 유사한 크기의 ANN 기반 방법(특히 DCEvo)보다 약 한 자릿수(10배) 적은 에너지를 사용한다는 것을 추정했습니다.
  • 이미지 해상도가 높아질수록 에너지 절감 효과는 더욱 커집니다.

이 논문이 부정하는 것들 (Rule Out)

이 논문은 무엇이 자신들의 방식만큼 잘 작동하지 않는지 명확히 밝히고 있습니다:

  • 단순 덧셈: 두 이미지를 단순히 더하거나(요소별 덧셈), 쌓아서 단순 필터를 통과시키는 방식(결합)은 현저히 낮은 성능을 보였습니다. 이는 신호가 어떻게 상호작용해야 하는지에 대한 미묘함을 놓쳤기 때문입니다.
  • 단방향 퓨전: 한 방향으로만 신호를 섞는 것(예: 적외선을 가시광선으로만 섞는 것)은 양방향으로 섞는 것보다 성능이 떨어졌습니다. 논문은 두 방식 모두가 서로를 정교하게 다듬어야 한다고 주장합니다.
  • 대칭형 브랜치: 동일한 길이의 두 브랜치를 사용하는 대칭형 구조는 이들의 비대칭형(얕은 브랜치 vs 깊은 브랜치) 설계보다 효과가 낮았습니다. 논문은 비대칭성이 네트워크가 역할을 분담하고 전문화하는 데 핵심이라고 제안합니다.
  • 단순한 뉴런: 더 오래되고 단순한 뉴런 모델(학습 가능한 파라미터가 없는 표준 Integrate-and-Fire 또는 Leaky Integrate-and-Fire)을 사용하는 것은 더 낮은 성능을 보였습니다. 논문은 "시간 상수(뉴런이 신호를 기억하는 시간)"를 학습할 수 있는 능력이 매우 중요하다는 점을 강조합니다 합니다.

결론

CIS-Fuse 논문은 에너지 효율성과 고품질 이미지 퓨전 사이에서 하나를 선택할 필요가 없다는 것을 시사합니다. 믹싱 과정을 "소리 지르기 전"의 단계인 "막 전위" 단계로 옮김으로써, 연구진은 매우 효율적이면서도 매우 효과적인 시스템을 만들어냈습니다.

그들은 가장 진보된, 에너지를 많이 쓰는 AI 모델들과 대등한 시각적 품질을 보여주면서도 훨씬 적은 전력을 사용한다는 것을 입증했습니다. 이는 드론, 로봇, 자율주행차와 같이 모든 줄(Joule)의 에너지가 소중한 배터리 구동 기기에 스마트한 비전 시스템을 배치하는 데 있어 중요한 진전입니다. 저자들은 다양한 데이터셋과 작업에 걸친 테스트를 통해 결과를 검증했으며, 다른 이들이 이를 검증하고 발전시킬 수 있도록 코드를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →