← 최신 논문
💻 computer science

SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks

본 논문은 안정적인 학습 메커니즘과 스파이크 구동 어텐션을 활용하여 기존의 ANN 베이스라인과 비교해 경쟁력 있는 정확도를 달성하는 동시에 계산 에너지 소비를 크게 줄이는 새로운 멀티모달 프레임워크인 SMM Transformer를 소개한다.

원저자: Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 끝없이 배고픈 계산기처럼 숫자만 두드리는 것이 아니라, 인간의 뇌 속 뉴런처럼 작은 전기 스파크를 쏘아 올리는 세상을 상상해 보십시오. 이것이 바로 스파이킹 신경망(Spiking Neural Networks, SNN)의 영역입니다. 새로운 정보가 없을 때도 끊임없이 데이터를 처리하는 기존의 AI와 달리, SNN은 "이벤트 기반(event-driven)"입니다. 이들은 무언가 흥미로운 일이 일어날 때만 깨어나 신호를 보내며, 덕분에 놀라울 정도로 에너지 효율적입니다. 이는 24시간 내내 켜져 있는 전구가 아니라, 방에 들어설 때만 켜지는 조명 스위치와 같습니다.

하지만 문제가 하나 있습니다. 이 스파크 기반의 두뇌는 에너지를 아끼는 데는 탁м 뛰어나지만, 사진을 보고 그에 대한 이야기를 쓰는 것과 같은 복잡한 다감각적 과업을 수행할 때는 어려움을 겪습니다. 이러한 과업을 위한 현재의 "골드 표준"은 "어텐션(attention)"이라는 무겁고 에너지를 많이 소비하는 방식을 사용하는데, 이는 컴퓨터가 모든 단어를 다른 모든 단어와 비교하고, 모든 픽셀을 다른 모든 픽셀과 비교하도록 강요합니다. 이는 마치 거대한 파티에 있는 모든 사람을 대화를 시작하기도 전에 한 명씩 일일이 소개하려는 것과 같습니다. 이 논문은 다음과 같이 질문합니다. 우리는 이 복잡한 다감각적 작업들을 에너지를 낭비하지 않고도 처리할 수 있는 스파크 기반의 두뇌를 만들 수 있을까요?

여기, 시우보 리앙(Xiubo Liang)과 그 팀이 제안한 새로운 프레임워크인 **SMM 트랜스포머(SMM Transformer)**가 등장했습니다. 그들은 단순히 기존의 스파크 기반 시스템을 조금 더 개선하려고 노력한 것이 아니라, 이미지와 텍스트의 혼합이라는 혼돈을 다룰 수 있도록 엔진을 밑바닥부터 다시 구축했습니다.

첫째, 그들은 깊고 복잡한 네트워크 문제를 해결했습니다. 표준적인 스파크 뉴런은 층을 높게 쌓을 경우 다루기가 까다롭고 학습시키기 어렵습니다. 연구팀은 PLMP라는 새로운 유형의 뉴런을 발명했습니다. 표준 뉴런을 정보(물)가 흐르는 단일하고 딱딱한 파이프라고 상상해 보십시오. PLMP는 각자 조절 가능한 밸브를 가진 다양한 크기의 파이프들이 병렬로 달리는 다발과 같습니다. 이를 통해 시스템은 다양한 속도와 정보 패턴을 훨씬 더 안정적으로 학습할 수 있습니다. 또한, 이 새로운 뉴런이 혼란 없이 학습할 수 있도록 가르치는 특수한 훈련 방법인 P-STBP를 만들었습니다.

다음으로, 그들은 "어텐션" 문제를 해결해야 했습니다. 기존의 어텐션 방식은 모든 사람이 동시에 서로에게 자신의 이름을 외치는 북적이는 방과 같습니다. 시끄럽고 무질서하며 엄청난 에너지를 사용합니다. 연구팀은 이를 SMSA(Spiking MLP Self-Attention)로 교체했습니다. SMSA는 혼란스러운 소리 지르기 대신, 어두운 방 안의 일련의 손전등처럼 작동합니다. 이미지의 한 부분에서 발생하는 "번쩍임(스파이크)"이 텍스트의 "번쩍임"과 일치하는지 확인합니다. 만약 함께 빛을 낸다면 연결되는 것이고, 그렇지 않다면 어둠 속에 머무는 것입니다. 이는 모든 것을 일일이 비교하는 무거운 수학 연산을 건너뜁니다. 또한, 이렇게 희소하게(sparse) 처리함으로써 중요한 세부 사항을 놓치지 않도록, 빠져나가는 정보를 잡아내는 안전망 역할을 하는 "자기 보정(self-compensation)" 브랜치를 추가했습니다.

마지막으로, 사진과 단어의 혼합을 처리하기 위해 SMoE(Spiking Mixture-of-Experts)를 도입했습니다. 이것을 바쁜 교차로의 스마트한 교통 통제관이라고 생각하십시오. 모든 차량(데이터)이 똑같은 길을 가도록 강요하는 대신, 통제관은 이미지 중심의 데이터를 "비전 전문가" 차선으로, 텍스트 중심의 데이터를 "언어 전문가" 차선으로, 그리고 혼합된 데이터는 특별한 "비전-언어" 차선으로 안내합니다. 이를 통해 서로 다른 유형의 정보가 충돌하지 않으면서도 서로 상호작용할 수 있게 합니다.

결과는 어떠했을까요? SMM 트랜스포머는 강력한 경쟁자입니다. 이미지 캡셔닝(이미지 설명)과 같은 과업을 테스트했을 때, 이 모델은 무겁고 에너지를 많이 쓰는 전통적인 모델들과 대등한 정확도를 달로했습니다. 실제로 이미지 캡셔닝 과업에서 SMM 트랜스포머-라지(SMM Transformer-Large) 모델은 BLEU-4 45.33CIDEr 128.72를 기록하며 매우 경쟁력 있는 수치를 보여주었습니다. 하지만 진짜 마법은 에너지 절감에 있습니다. 연구진은 새로운 어텐션 방식을 사용함으로써 모델의 어텐션 부분에 드는 에너지 비용이 표준 방식에 비해 최대 97% 감소했다고 추정했습니다. 모델 전체를 보더라도 에너지 절감 효과는 견고한 **21.6%**였으며, 모델은 약 13.6% 더 빠르게 실행되었습니다.

이 논문은 이것이 모든 가능한 미래의 용도에 대한 완벽하고 완성된 제품이라고 주장하는 것이 아니라, 명확한 진로를 제시하고 있습니다. 이들은 "전류의 홍수"가 아닌 "스파크"를 사용하여 깊고 복잡한 다감각 AI 시스템을 구축할 수 있음을 증ло합니다. 무겁고 밀집된 수학 연산을 희소하고 이벤트 기반인 스파이크로 교체함으로써, SMM 트랜스포머는 우리가 높은 정확도(cake)를 얻으면서도 낮은 에너지 소비(eat it too)라는 두 마리 토끼를 모두 잡을 수 있음을 보여줍니다. 이는 언젠가 스마트워치나 안경만큼 작은 기기에서도 구동될 수 있는, 더 똑똑하고 친환경적인 AI를 향한 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →