← 최신 논문
💻 computer science

MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers

MicroViTv2는 재매개변수화된 구성 요소와 단일 심층 가중치 전치 어텐션(Single Depth-Wise Transposed Attention)을 활용하여 엣지 디바이스에서 탁월한 정확도와 에너지 효율성을 달성하는 경량 하드웨어 인식 비전 트랜스포머로, 실세계 성능을 최적화하는 것이 FLOPs를 최소화하는 것보다 더 중요하다는 것을 입증한다.

원저자: Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu, Wen-Kai Kuo, Jun-Wei Hsieh

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu, Wen-Kai Kuo, Jun-Wei Hsieh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 기술의 세계에서 컴퓨터는 이미지를 보고 그것이 무엇인지 이해하는 데 매우 뛰어난 능력을 갖추게 되었습니다. 컴퓨터는 고양이 식별, 자동차 포착, 혹은 표지판 읽기 등을 인간의 시각에 필적하는 정확도로 수행할 수 있습니다. 이러한 능력은 비전 트랜스포머(Vision Transformer)라고 불리는 일종의 인공지능에 기반합니다. 이 시스템들을 이미지를 스캔하여 조각으로 나누고 그 조각들이 서로 어떻게 연관되는지 이해하는 매우 정밀한 지도 제작자로 생각해보십시오. 이 지도 제작자들은 매우 강력하지만, 동시에 무겁고 많은 자원을 요구합니다. 이들은 실행을 위해 방대한 양의 컴퓨가 연산 능력과 전력을 필요로 하며, 이는 스마트폰, 드론, 또는 배터리로 구동되는 자율 주행 로봇과 같은 소형 기기에서 사용하기 어렵게 만듭니다. 이러한 엣지 기기들의 목표는 단순히 똑똑해지는 것이 아니라, 배터리 충전 없이도 몇 시간 동안 작동할 수 있도록 높은 성능과 낮은 에너지 소비 사이의 균형을 맞추어 효율성을 확보하는 것입니다.

연구자들은 오랫동안 이러한 시스템을 효율적으로 만드는 가장 좋은 방법이 수행하는 수학적 계산의 수를 단순히 줄이는 것이라고 믿어 왔습니다. 업계에서는 이 계산 횟수를 컴퓨터가 수행해야 하는 작업량을 추정하는 표준 지표인 FLOPs라고 부릅니다. 기존의 가정은 계산 횟수가 적을수록 자동으로 더 빠르고 에너지 효율적인 장치가 된다는 것이었습니다. 그러나 새로운 연구는 이러한 오랜 믿음에 도전합니다. 대만 과학기술위원회와 협력하여 연구를 진행한 연구팀은 계산 횟수를 세는 것이 실제 성능을 판단하는 불완전한 방법이라고 주장합니다. 그들은 모델의 내부 구조가 실행되는 물리적 하드웨어와 더 잘 작동하도록 설계된다면, 계산량이 약간 더 많은 모델이 실제로 더 빠르고 에너지를 적게 사용할 수 있다는 것을 발견했습니다.

이 아이디어를 테스트하기 위해 연구진은 MicroViTv2라는 새로운 모델을 개발했습니다. 이는 로보틱스 및 자율 시스템에 자주 사용되는 강력한 컴퓨터인 Jetson AG고 AGX Orin과 같은 엣지 기기에서 실행되도록 특별히 설계된 경량화된 버전의 비전 트랜스포머입니다. 연구팀은 단순히 수학 계산을 줄이는 대신, 기기의 메모리와 프로세서에 가해지는 물리적 부담을 줄이기 위해 모델의 아키텍처를 재설계했습니다. 그들은 구조적 재매개변수화(structural re-parameterization)라는 방법을 도입했습니다. 훈련 단계 동안 모델은 여러 경로가 있는 복잡한 구조(마치 많은 복도가 있는 건물과 유사함)를 사용하여 학습합니다. 하지만 모델이 실제 환경에 배치되기 전, 이 경로들은 수학적으로 하나의 간결한 경로로 융합됩니다. 즉, 장치가 실제로 모델을 실행할 때 복잡한 훈련 구조를 통과할 필요 없이, 훨씬 빠르게 통과하고 메모리 접근을 적게 요구하는 단순화되고 직접적인 경로를 통해 이동하게 됩니다.

또한 연구진은 이미지의 서로 다른 부분들이 연결되는 방식을 개선했습니다. 그들은 기존의 어텐션 메커니즘을 Single Depth-Wise Transposed Attention이라는 새로운 구성 요소로 교체했습니다. 이를 통해 모델은 불필요한 데이터에 발목 잡히지 않고 전체 이미지를 바라보며 멀리 떨어진 부분들이 서로 어떻게 연관되는지 이해할 수 있습니다. 연구팀은 단순히 얼마나 많은 수학 문제를 푸느냐가 아니라, 하드웨어를 통해 모델이 데이터를 어떻게 이동시키는지에 집중함으로써, 실제 장치의 물리적 한계에 더 친화적인 시스템을 만들었습니다.

표준 이미지 데이터셋과 객체 탐지 작업에서 실시된 실험 결과는 효율성을 측정하는 방식에 명확한 변화를 보여줍니다. Jetson AGX Orin에서 테스트했을 때, 새로운 MicroViTv2 모델은 이전 모델과 여러 선도적인 경량 모델들을 능가했습니다. 이 모델은 이미지를 처리하는 속도가 더 빠르고 이미지당 에너지 소비가 적으면서도 객체 식별에서 더 높은 정확도를 달enc성했습니다. 예를 들어, 이 모델의 한 버전은 초당 1,883개의 이미지를 처리하면서 이미지당 단 14.9 밀리줄의 에너지만 소비했습니다. 그에 비해 이론적 계산량이 더 적은 다른 모델들은 더 느리고 더 많은 전력을 사용했습니다. 이 연구는 새로운 모델이 이전 버전보다 정확도를 최대 0.5% 향상시켰으며, 속도와 에너지 효율성 모두에서 MobileViTv2 및 EdgeNeXt와 같은 경쟁 모델들을 앞질렀음을 입증했습니다.

결정적으로, 이 논문은 낮은 계산 횟수가 항상 더 나은 성능을 의미한다는 생각을 명시적으로 부정합니다. 연구진은 자신들의 모델이 일부 구형 모델보다 더 많은 수학적 연산을 수행했음에도 불구하고, 여전히 더 빠르게 실행되고 전기를 더 적게 사용했다는 점을 보여주었습니다. 이러한 발견은 실제 하드웨어에 적용될 때 계산 횟수를 줄이는 것에 대한 전통적인 집중이 오해의 소지가 있음을 시사합니다. 진정한 병목 현상은 종종 컴퓨터가 메모리에 접근하는 방식과 칩 위에서 소프트웨어가 어떻게 스케줄링되는지에 달려 있습니다. 하드웨어에 맞춰 구조를 최적화함으로써, 연구진은 모델이 더 많은 수학 연산을 수행하더라도 더 효율적일 수 있음을 증명했습니다.

연구팀은 이미지 분류 및 복잡한 장면에서의 객체 탐지를 포함한 다양한 시나리오를 통해 이러한 발견을 검증했습니다. 모든 테스트에서 구조적 개선은 더 나은 결과를 가져왔습니다. 이 연구는 장치의 물리적 현실에 맞춰 설계하는 것이 단순히 이론적인 작업량을 최소화하는 것보다 더 중요하다는 결론을 내립니다. 이러한 접근 방식은 똑똑할 뿐만 아니라 우리 일상생활에서 점점 더 흔해지고 있는 배터리 구동 장치들에 실용적인 인공지능을 만들기 위한 새로운 길을 제시합니다. 이 연구는 진정으로 효율적인 시스템을 구축하려면 엔지니어들이 종이 위의 숫자를 넘어 모델이 기계 내부에서 실제로 어떻게 작동하는지를 고려해야 함을 확인시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →