← 최신 논문
🤖 AI

SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging

본 논문은 가중치 분산을 방지하기 위한 토큰 국소화와 전역적 문맥을 포착하기 위한 산술 평균을 결합하여, 이미지 분류 작업에서 기존의 선형 어텐션 및 비전 맘바(Vision Mamba) 모델들을 능가하는 확장 가능하고 효율적인 어텐션 메커니즘인 SEMA를 소개한다.

원저자: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 사진 속 고양이를 인식하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 "어텐션(attention)"이라는 특별한 도구를 사용하는데, 이는 마치 스포트라이트와 같습니다. 이 스포트라이트는 이미지 전체를 훑으며 어떤 픽셀이 중요한지(예: 고양이의 귀), 그리고 어떤 것이 단순한 배경 소음인지(예: 흐릿한 나무)를 결정합니다. 문제는 사진이 커질수록 스포트라이트가 모든 픽셀을 다른 모든 픽셀과 대조하며 확인해야 한다는 점입니다. 사진이 작으면 빠르지만, 사진이 거대해지면 로봇은 연결 관계를 확인하는 데 너무 많은 시간을 소비하여, "고양이"라고 말하기도 전에 배터리가 다 떨어져 버립니다.

과학자들은 이를 해결하기 위해 스포트 much 더 단순하고 빠른 선형 방식으로 스포트라이트를 만드는 방법을 시도해 왔습니다. 하지만 여기에는 함정이 있습니다. 이러한 빠른 스포트라이트들은 종종 초점을 잃는다는 것입니다. 이미지가 커질수록 이들은 모든 픽셀을 똑같이 중요하게 취급하기 시작하는데, 이는 마치 빛을 너무 낮게 조절하여 방 전체를 균일하게 밝히는 손전등처럼 변하는 것과 같습니다. 로봇은 고양이를 보는 대신 회색 형체만을 보게 됩니다. 캘리포니아 대학교 어바인 캠퍼스와 퀄컴 AI 리서치(Qualcomm AI Research)의 연구진이 작성한 이 논문은 바로 이 문제를 다룹니다. 그들은 거대한 이미지를 처리할 수 있을 만큼 충분히 빠르면서도, 여전히 세부 사항을 볼 수 있을 만큼 날카로운 스포트라이트를 만들고자 합니다.

Nhat Thanh Tran과 동료들이 이끄는 연구진은 왜 이러한 빠른 스포트라이트들이 실패하는지를 설명하는 수학적 진실을 발견했습니다. 픽셀(또는 "토큰")의 수가 무한대로 증가함에 따라, 어텐션 메커니즘은 자연스럽게 퍼져나가 쓸모없게 된다는 것입니다. 그들은 이를 "분산(dispersion)" 현상이라고 부릅니다. 이는 마치 경기장에서 속삭임을 들으려고 노력하는 것과 같습니다. 한꺼번에 모든 사람의 말을 들으려고 하면 결국 소음만 들릴 뿐입니다. 이 논문은 이러한 빠른 어텐션 도구들의 수학적 구조를 어떻게 수정하더라도, 이미지가 너무 커지면 결국 초점을 잃게 될 것임을 증명합니다.

이 문제를 해결하기 위해 연구진은 SEMA(Scalable and Efficient Mamba-like Attention)라는 새로운 방법을 발명했습니다. 그들은 수학과 싸우는 대신, 수학을 활용하기로 했습니다. 그들은 스포트라이트가 특정 세부 사항에 집중해야 하는 동시에, 길을 잃지 않으면서도 "전체적인 그림"을 이해할 방법도 필요하다는 것을 깨달았습니다. 그래서 그들은 두 부분으로 구성된 시스템을 설계했습니다. 첫째, 그들은 **토큰 로컬라이제이션(Token Localization)**을 사용하는데, 이는 스포트라이트에 작은 창을 달아주는 것과 같습니다. 스포트라이트는 한 번에 아주 작은 이웃 픽셀 영역에만 집중하여, 압도되거나 주의가 분산되지 않도록 합니다. 이를 통해 초점을 날카롭게 유지합니다.

하지만 작은 창을 통해 보는 것에는 단점이 있습니다. 로봇이 발 하나만 보고 있다면 고양이 전체를 놓칠 수도 있기 때문입니다. 이를 해결하기 위해 SEMA는 두 번째 단계인 **어베리징(Averaging, 평균화)**을 추가합니다. 이것은 방 전체를 빠르게 찍은 흐릿한 스냅샷을 상세한 뷰에 더하는 것과 같습니다. 연구진은 이미지가 거대해질 때, 이미지의 "글로벌(global)"한 느낌을 포착하는 가장 좋은 방법은 단순히 모든 것을 평균 내는 것임을 수학적으로 증명했습니다. 이처럼 날카로운 국소 창 뷰와 단순한 글로벌 평균을 결합함으로써, SEMA는 두 세계의 장점을 모두 갖추게 됩니다.

논문은 이 접근 방식이 놀라울 정도로 잘 작동함을 보여줍니다. 연구진이 ImageNet-1K와 같은 표준 이미지 데이터셋에서 SEMA를 테스트했을 때, SEMA는 최근의 "Mamba" 모델들을 포함한 다른 인기 있는 모델들보다 뛰어난 성능을 보였으며, 특히 이미지가 매우 클 때 더욱 그러했습니다. 예를 들어, 이미지 크기가 1024x1024 픽셀로 커졌을 때 다른 모델들은 정확도가 크게 떨어지며 어려움을 겪었지만, SEMA는 강력하게 유지되었을 뿐만 아니라 오히려 향상되었습니다. 또한 연구진은 SEMA가 경쟁 모델들보다 빨라 큰 이미지를 처리하는 데 시간이 적게 걸린다는 점도 발견했습니다.

이 논문에서 가장 흥ре로운 부분 중 하나는 "분산" 문제를 다룬 방식입니다. 수학적 원리를 깨뜨리면서 억지로 어텐션을 날카롭게 유지하려 하는 대신, 그들은 이미지가 거대해지면 어텐션이 퍼지는 것이 당연하다는 점을 받아들였습니다. 그들은 이 퍼지는 성질을 역이용하여, 단순한 평균을 통해 글로벌 정보를 표현했습니다. 이는 만약 당신에게 백만 명의 친구가 있다면, 그들 한 명 한 명의 모든 세부 사항을 기억할 수는 없지만, 그 집단의 전반적인 분위기는 기억할 수 있는 것과 비슷합니다. SEMA는 즉각적인 이웃의 세부 사항을 기억하는 동시에 전체 집단의 전반적인 분위기를 기억함으로써, 사진의 크기에 상관없이 고양이를 완벽하게 인식할 수 있게 해줍니다.

저자들은 사물을 인식하는 것부터 이미지의 특정 부분을 찾는 것(세그멘테이션)까지 다양한 작업에 대해 자신들의 아이디어를 테스트했습니다. 모든 경우에서 SEMA는 정신을 잃지 않고 더 큰 이미지로 확장될 수 있음을 보여주었습니다. 그들은 심지어 이미지가 커질수록 그들의 시스템 중 "평균화" 부분이 더 중요해진다는 것을 보여주었으며, 이는 단순한 평균화 단계가 방대한 양의 데이터를 처리하는 데 필수적이라는 그들의 이론을 입증했습니다. 이 논문은 컴퓨터 비전에 초점을 맞추고 있지만, 연구진은 이 아이디어가 거대한 의료 스캔 영상을 분석하는 것과 같이 긴 시퀀스의 데이터를 다루는 다른 문제에도 도움이 될 수 있다고 제안합니다.

요약하자면, SEMA는 스포트라이트가 너무 넓어져서 쓸모없어질 때 이를 인정하고 다른 전략으로 전환하는 영리한 기술입니다. 즉, 주변의 세부 사항을 면밀히 관찰하고, 나머지는 빠르고 단순하게 평균을 내는 것입니다. 이는 세상이 매우 커지더라도 컴퓨터가 세상을 명확하게 볼 수 있도록 돕는, 확장 가능하고 효율적이며 수학적으로 타당한 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →