← 최신 논문
💻 computer science

Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

이 논문은 이벤트 카메라의 고유한 특성을 보존하면서도 다양한 비전 작업에서 기존의 프레임 및 복셀 기반 방식과 대등하거나 더 우수한 정확도를 달성하는 동시에 더 빠른 추론을 실현하는 비동기적이고 희소한 토큰화 방법인 "Spiking Patches"를 소개한다.

원저자: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

게시일 2026-09-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇과 자율주행 자동차는 오랫동안 영화 카메라처럼 세상의 완전한 장면을 매 분초마다 포착하는 표준 카메라에 의존해 왔습니다. 이 방식은 많은 일에 효과적이지만, 상당 부분이 빈 공간이거나 변하지 않은 배경인 방대한 양의 데이터를 생성한다는 부담을 줍니다. 이벤트 카메라라고 알려진 새로운 유형의 센서는 이와 다른 원리로 작동합니다. 전체 사진을 찍는 대신, 변화만을 기록합니다. 센서의 픽셀이 밝기 변화를 감지하면, 그 즉시 단일 신호, 즉 '이벤트'를 보냅니다. 이는 카메라가 고정된 리듬에 따라 움직이는 것이 아니라, 무언가 변할 때마다 발생하는 비동기적인 개별 신호의 흐름을 생성함을 의미합니다. 또한 데이터가 희소하여, 움직임이나 변화가 일어난 위치에 대한 정보만을 포함하고 나머지 장면은 정적으로 남겨둡니다. 이러한 접근 방식은 믿을 수 없을 정도로 효율적이고 빠르지만, 로봇이 주변 환경을 이해하는 데 사용하는 인공지능 모델에 이 독특한 데이터 흐름을 입력하는 데 어려움이 있었습니다.

수년간 연구자들은 이러한 비동기적 신호를 익숙한 기존의 이미지 형식으로 강제 변환함으로써 이 문제를 해결하려 노력해 왔습니다. 그들은 이벤트를 고정된 시간 창(time window) 안에 그룹화하여, 마치 일련의 스냅샷을 꿰매어 붙이는 것처럼 프레임을 만들었습니다. 그러나 이 과정은 이벤트 카메라를 특별하게 만드는 바로 그 특성들을 파괴합니다. 고정된 시간이 흐를 때까지 기다려 이미지를 생성함으로써 시스템은 갑작스러운 변화에 즉각 반응하는 능력을 상실하며, 빈 공간을 채움으로써 오직 관련 데이터만을 보유하는 효율성을 잃게 됩니다. 덴마크 기술대학교(Technical University of Denmark)의 연구팀은 이제 다른 방향을 제시했습니다. 그들은 '스파이킹 패치(Spiking Patches)'라는 새로운 방법을 개발했는데, 이는 변화하는 신호들의 집합을 경직된 시간 기반 격자에 강제로 맞추지 않고 하나의 정보 단위로 취급합니다. 이 접근 방식은 데이터가 비동기적이고 희소한 상태를 유지하게 하여, 원래 센서의 속도와 효율성을 보존하면서도 강력한 현대 AI 모델들과 호환되도록 만듭니다.

연구진은 생물학적 뉴런이 어떻게 작동하는지를 관찰하여 시스템을 설계했습니다. 뇌에서 뉴런은 일정 수준의 신호를 받아 임계값(threshold)에 도달할 때까지 기다렸다가 스파이크를 발생시킵니다. 연구팀은 이와 동일한 논리를 이벤트 카메라 데이터에 적용했습니다. 그들은 카메라의 시야를 작은 정사각형, 즉 '패치(patch)'들로 나누었습니다. 이벤트가 도착함에 따라 각 패치 내에 축적되며 가상의 전위를 높입니다. 패치 내의 이벤트 수가 특정 한계치에 도달하면, 패치는 '발화(fire)'하여 해당 이벤트 그룹을 나타내는 '토큰(token)'을 생성합니다. 이 토큰은 처리를 위해 AI 모델로 전송됩니다. 결정적으로, 이 발화는 시계가 작동하기를 기다리는 것이 아니라 각 패치에서 독립적으로, 그리고 임계값에 도한 바로 그 순간에 일어납니다. 이는 시스템이 전체 프레임이 구축되기를 기다리지 않고, 충분한 이벤트가 축적되는 즉시 빠르게 움직이는 물체에 반응할 수 있음을 의미합니다.

이 아이디어가 실제로 작동하는지 테스트하기 위해, 연구팀은 스파이킹 패치를 두 가지 가장 일반적인 이벤트 데이터 처리 방식인 표준 프레임 및 '복셀(voxel)'이라 불리는 3D 데이터 블록과 비교했습니다. 그들은 그래프, 포인트 클云(point clouds), 트랜스포머를 위한 네트워크를 포함한 세 가지 다른 유형의 AI 아키텍처를 사용하여 손동작 인식 및 주행 영상 내 자동차 탐지와 같은 과제를 수행했습니다. 결과는 놀라웠습니다. 속도 측면에서 새로운 방법은 대안들보다 현저히 빨랐습니다. 손동작을 인식할 때, 스파이킹 패치 시스템은 복셀 방식보다 최대 3.4배, 프레임 기반 방식보다 최대 10.4배 더 빨랐습니다. 이러한 속도 향상은 정확도를 희생하지 않으면서 이루어졌으며, 많은 경우에서 새로운 방법은 기존 방식만큼 정확했거나, 어떤 경우에는 손동작 인식을 최대 3.8%포인트, 객체 탐지를 최대 1.4%포인트트 개선하는 등 오히려 더 높은 정확도를 보였습니다.

또한 이 연구는 해당 방식이 데이터의 희소성과 비동기성을 성공적으로 유지함을 확인했습니다. 연구진은 장면의 반응을 위해 정보를 모으는 속도를 가공되지 않은 이벤트 스트림과 비교하여 측정했습니다. 그 결과, 스파이킹 패치 시스템은 단 몇 밀리초의 아주 미세한 지연만을 보이며 가공되지 않은 이벤트 자체만큼이나 빠르게 반응할 수 있는 반면, 프레-기반 방식은 고정된 시간 간격을 기다려야 하므로 훨씬 긴 지연이 발생한다는 것을 발견했습니다. 더욱이, 이 새로운 방법은 컴퓨터가 처리해야 할 데이터 양을 프레임 및 복셀 대비 최소 1.5배, 경우에 따라서는 가공되지 않은 이벤트 스트림 대비 수백 배까지 줄였습니다. 이 데이터 크기의 감소가 바로 컴퓨터가 분석해야 할 항목을 줄여주어 시스템을 훨씬 더 빠르게 실행할 수 있게 만드는 핵심입니다.

이 발견의 가장 실용적인 측면 중 하나는 시스템이 실시간 애플리케이션을 처리할 만큼 빠르다는 점입니다. 연구진은 속도가 빠른 것으로 알려진 프로그래밍 언어로 토큰화 과정을 구현했으며, 시스템이 카메라에 새로운 이벤트가 도착하는 속도보다 더 빠르게 토큰을 생성할 수 있음을 발견했습니다. 이는 고속도로를 달리는 자동차와 같은 실제 상황에서 정보의 흐름을 따라잡지 못하고 뒤처지는 일 없이 시스템이 흐름을 유지할 수 있음을 의미합니다. 연구팀은 또한 다양한 설정이 성능에 미치는 영향을 탐구하여, 토큰 생성 수와 결과의 정밀도 사이의 절충안을 위해 시스템의 민감도를 조절할 수 있음을 찾아냈습니다. 예를 들어, 패치가 발화한 후 짧은 휴지기를 도입함으로써 정확도를 거의 유지하면서도 생성되는 토큰의 수를 4배로 줄일 수 있었습니다.

결과는 유망하지만, 연구진은 이 방법이 토큰을 트리거하는 임계값을 세심하게 조정해야 한다고 언급합니다. 임계값이 너무 낮으면 시스템이 너무 자주 발화하여 너무 많은 데이터를 생성할 수 있습니다. 반대로 임계값이 너무 높으면 중요한 세부 사항을 놓칠 수 있습니다. 연구팀은 향ما 작업이 이 임계값을 장면에 따라 자동으로 적응하도록 만드는 데 집중할 수 있다고 제안했습니다. 또한 움직이는 물체를 추적하거나 장면의 움직임 흐름을 계산하는 것과 같은 다른 유형의 과제에도 이 방법을 테스트할 계획입니다. 하지만 현재로서는, 이 연구가 이벤트 카메라의 독특하고 비동기적인 특성과 현대 로보틱스를 구동하는 강력한 AI 모델 사이의 간극을 메울 수 있음을 입증하고 있습니다. 이벤트 그룹을 하나의 의미 있는 단위로 취급함으로써, 연구진은 가장 진보된 인공지능 도구들을 사용할 수 있는 능력을 잃지 않으면서도 이벤트 카메라의 속도와 효율성을 유지할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →