← 최신 논문
💻 computer science

Partial Ring Scan: Revisiting Scan Order in Vision State Space Models

이 논문은 고정된 선형 스캔 순서를 동심원 기반의 횡단 및 부분 채널 필터링으로 대체함으로써 정확도, 효율성 및 기하학적 안정성을 향상시킨 회전 강건 비전 상태 공간 모델인 PRISMamba를 소개한다.

원저자: Yi-Kuan Hsieh, Kuan-Chuan Peng, Xin li, Ming-Ching Chang, Yu-Chee Tseng, Jun-Wei Hsieh

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yi-Kuan Hsieh, Kuan-Chuan Peng, Xin li, Ming-Ching Chang, Yu-Chee Tseng, Jun-Wei Hsieh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구에게 전화로 복잡한 사진, 예를 들어 강아지가 토끼를 쫓고 있는 사진을 설명하려고 한다고 상상해 보세요. 당신은 한 번에 한 단어씩만 보낼 수 있습니다. 사진을 설명하는 순서가 매우 중요합니다.

만약 당신이 사진을 행 단위로(왼쪽에서 오른쪽으로, 위에서 아래로) 설명한다면, "강아지의 귀... 강아지의 코... 토끼의 귀... 강아지의 꼬리..."라고 말하게 될 것입니다. 만약 사진을 90도 회전시킨다면, 당신의 행 단위 설명은 갑자기 엉망이 됩니다. "강아지의 귀"는 이제 당신의 목록에서 "강아지의 코"와 멀리 떨어지게 되고, 토끼의 귀는 강아지의 꼬리와 배경 사이에 끼어버릴 수도 있습니다. 당신의 친구(컴퓨터 모델)는 혼란에 빠집니다. 왜냐하면 사진 속에서 함께 속해 있어야 할 것들이 당신의 이야기 속에서는 서로 멀리 떨어지게 되었기 때문입니다.

**"Partial Ring Scan: Revisiting Scan Order in Vision State Space Models"**라는 제목의 이 논문은 현대 AI가 이미지를 "읽는" 방식이 너무 경직되어 있다고 주장합니다. 저자들은 사진이 회전하더라도 평정심을 유지할 수 있는 더 똑똑한 방식으로 이미지를 읽는 새로운 방법을 제안합니다.

이 논문의 아이디어를 쉬운 비유를 통해 정리해 드립니다:

1. 문제점: "뱀" vs "과녁"

현재의 AI 모델들(VMamba 등)은 종종 이미지를 격자 위를 기어가는 뱀처럼 읽습니다. 왼쪽에서 오른쪽으로 갔다가, 아래로 내려간 뒤, 다시 오른쪽에서 왼쪽으로 이동하는 식입니다.

  • 문제점: 이미지를 회전시키면 "뱀"의 경로가 끊어집니다. AI는 빈 공간(패딩)을 가로질러 점프하거나 엉뚱한 부분으로 점프해야 합니다. 이는 마치 누군가 페이지를 돌려놓은 책을 읽는 것과 같습니다. 단어들의 순서가 잘못되었기 때문에 문장이 더 이상 말이 되지 않는 상황과 같습니다.
  • 결과: 이미지가 회전할 때, AI는 사물 간의 연결성을 놓치게 되어 성능이 떨어집니다.

2. 해결책: "양파" 전략 (Ring Scan)

저자인 Yi-Kuan Hsieh과 동료들은 이미지를 읽는 다른 방법인 **"링 스캔(Ring Scan)"**을 제안합니다.

이미지가 양파나 과녁판이라고 상상해 보세요.

  • 1단계: 행 단위로 읽는 대신, AI는 정중앙에서 시작하여 바깥쪽으로 나가는 동심원 형태의 링(concentric rings) 단위로 이미지를 벗겨냅니다.
  • 2단계: 각 링 내부에서 AI는 특정 순서(시계 방향인지 반시계 방향인지)를 따지지 않습니다. 그저 해당 링에 있는 모든 정보를 한데 모읍니다.
  • 3단계 그 후, 안쪽 링에서 다음 링으로 이동하며 이 과정을 반복합니다.

이것이 왜 혁신적인가:
사진을 회전시켜도 "양파"는 변하지 않습니다. 중심은 여전히 중심이고, 바깥쪽 링은 여전히 바깥쪽 링입니다. AI는 순서를 새로 배울 필요가 없습니다. 그저 약간 회전된 동일한 링들을 볼 뿐입니다. 이 덕분에 AI는 회전에 대해 매우 강력한 내성을 갖게 됩니다.

3. 효율성을 위한 해킹: "VIP 통로" (Partial Channel Filtering)

이미지의 모든 조각(정보)을 처리하는 것은 비용이 많이 들고 느립니다. 저자들은 모든 "채널"(이것을 서로 다른 색상 필터나 데이터 유형이라고 생각하세요)이 똑같이 중요한 것은 아니라는 점에 주목했습니다. 어떤 채널은 노이즈가 심하거나 중복된 정보일 수 있습니다.

  • 기존 방식: AI는 모든 정보를 복잡한 "링(Ring)" 경로를 통해 처리하려고 시도합니다.
  • 새로운 방식 (Partial Channel Filtering): AI는 클럽의 가드(bouncer)처럼 행동합니다. 어떤 채널이 "VIP"인지(가장 정보 가치가 높은 것) 빠르게 확인합니다.
    • VIP는 메인 고속 "링" 경로를 통해 전달됩니다.
    • 일반 고객(덜 중요한 데이터)은 단순하고 가벼운 "뒷문" 경로(잔차 분기, residual branch)를 통해 전달됩니다.

비유: 붐비는 고속도로를 상상해 보세요. 모든 자동차를 길고 구불구불한 경치 좋은 길로 가게 하는 대신, 스마트한 시스템은 빠른 스포츠카만 경치 좋은 길을 택하게 하고, 느린 트럭들은 직진하는 단순한 우회로를 이용하게 합니다. 그 결과, 고속도로는 더 빠르게 움직이며, 중요한 차들은 상세한 풍경을 충분히 즐길 수 있습니다.

4. 결과: 더 빠르고, 더 똑똑하고, 더 강력하게

연구팀은 자신들의 새로운 모델인 PRISMamba를 기존의 선두 모델(VMamba 등)과 비교 테스트했습니다.

  • 정확도: 표준 테스트(ImageNet)에서 PRISMamba는 **84.5%**의 정확도를 기록하며, 이전 최고 기록인 VMamba의 82.6%를 앞질렀습니다.
  • 속도: PRISMamba는 초당 3,054장의 이미지를 처리한 반면, VMamba는 1,686장을 처리했습니다. 즉, 훨씬 더 빨랐습니다.
  • 효율성: PRISMamba는 더 적은 컴퓨팅 파워(3.9G FLOPs)를 사용했습니다 (VMamba는 5.6G).
  • 회전: 이미지를 60도 회전시켰을 때, 기존 모델들은 성능이 약 2% 하락했습니다. 하지만 PRISMamba는 거의 영향을 받지 않았으며, 점수가 거의 일정하게 유지되었습니다.

요약

이 논문은 AI가 이미지를 읽는 방법(뱀 같은 경로에서 링 기반 경로로)을 바꾸고, 불필요한 데이터를 걸러냄(Partial Channel Filtering)으로써, 다음과 같은 모델을 만들었다고 주장합니다:

  1. 더 정확하고 (더 잘 봅니다).
  2. 더 빠르며 (더 빨리 생각합니다).
  3. 더 견고합니다 (사진이 돌아가도 혼란스러워하지 않습니다).

그들은 이것을 "저비용의 원칙적인 접근법(low-cost, principled approach)"이라고 부릅니다. 즉, 거대하고 비싼 새로운 뇌를 만든 것이 아니라, 가구 배치를 바꾸고 VIP 통로를 열었을 뿐이라는 의미입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →