MergeOver: Post-Training Token Merging for Recursive Vision Transformers
MergeOver는 비용이 많이 드는 재학습 과정 없이도 높은 정확도를 유지하면서 엣지 디바이스에서의 메모리 사용량과 지연 시간을 크게 줄이기 위해, 토큰 병합(Token Merging)을 재귀적 가중치 공유 비전 트랜스포머(recursively weight-shared Vision Transformers)에 통합하는 사후 학습(post-training) 방법입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 사진을 보는 것만으로 고양이, 개, 자동차를 인식하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 '비전 트랜스포머(Vision Transformer)'라는 특별한 종류의 뇌를 사용합니다. 이 뇌는 아주 작은 탐정들의 팀이라고 생각하면 됩니다. 사진 속의 모든 픽셀 하나하나가 자신만의 탐정을 갖게 되는 것이죠. 픽셀이 많아질수록 더 많은 탐정이 필요하며, 그들은 무엇을 보고 있는지 알아내기 위해 서로 더 많이 대화해야 합니다. 이것은 정확도 측면에서는 훌륭하지만, 스마트워치나 라즈베리 파이처럼 작은 컴퓨터들에게는 큰 문제입니다. 왜냐하면 수천 명의 탐정이 동시에 수다를 떠는 것을 감당할 만큼의 메모리나 배터리 전력이 없기 때문입니다.
이를 해결하기 위해 과학자들은 두 가지 주요 기술을 시도했습니다. 첫 번째는 '재귀적 가중치 공유(recursive weight-sharing)'로, 이는 마치 한 명의 슈퍼 탐정이 매 단계마다 새로운 팀을 고용하는 대신 자신의 노트를 재사용하며 같은 일을 반복해서 수행하는 것과 같습니다. 이는 공간은 절약하지만 탐정 업무를 더 느리고 무겁게 만듭니다. 두 번째 기술은 '토큰 병합(token merging)'으로, 일부 탐정들이 같은 것을 보고 있다는 사실을 깨닫고 시간을 아끼기 위해 그들을 하나의 큰 탐정으로 합치는 것입니다. 이 논문이 다루는 핵심 질문은 다음과 같습니다: 이 두 가지 기술을 모두 사용하면서, 전체 로봇을 처음부터 다시 학습시킬 필요 없이 동시에 적용하려면 어떻게 해야 할까요? 이는 마치 단일 탐정에게 자신이 따라가던 지도를 망가뜨리지 않으면서, 작업 도중에 자신의 복제본들과 합쳐지는 법을 가르치는 것과 같습니다.
트웬테 대학교의 준서 김(Junseo Kim)과 그의 팀은 이 두 가지 방법을 함께 사용하려고 하면 보통 규칙이 깨지기 때문에 재앙이 된다고 말합니다. 그들은 이 퍼즐을 풀기 위해 MergeOver라고 불리는 새로운 방법을 제안합니다. 로봇의 뇌를 탐정들이 층을 옮겨 다니는 다층 건물이라고 상상해 보세요. 탐정들이 새로운 층으로 이동할 때마다, 건물의 구조상 그들은 완벽한 정사각형 격자 모양으로 서 있어야 합니다. 하지만 탐정들을 병합하는 것은 보통 이 정사각형 격자를 망가뜨려 엘리베이터를 고장 내는 빈 공간을 남깁니다. MergeOver는 영리한 '언머지(Unmerge, 병합 해제)' 기술을 도입합니다. 이는 병합된 탐정들을 원래의 격자 위치로 잠시 다시 나누어 놓아 엘리베이터를 통과할 수 있게 한 뒤, 다음 층에 안전하게 도착하면 다시 병합하는 방식입니다. 이를 통해 로봇은 재학습 없이도 낮은 메모리 사용량을 유지할 수 있습니다.
팀은 이 방법을 유명한 이미지 데이터셋인 ImageNet-1K를 통해 강력한 그래픽 카드부터 아주 작은 라즈베리 파이 5에 이르기까지 다양한 컴퓨터에서 테스트했습니다. 그들은 MergeOver가 효과가 있지만, 그 결과는 로봇이 한 번에 얼마나 많은 사진을 보느냐(배치 크기)에 따라 크게 달라진다는 것을 발견했습니다. 로봇이 한 번에 한 장의 사진만 볼 때, 병합하고 해제하는 추가 작업은 실제로 속도를 약간 늦춥니다. 하지만 로봇이 한 번에 16장의 사진을 볼 때 마법이 일어납니다. 강력한 GPU에서 이 설정은 메모리 사용량을 38.4% 줄였고, 실제로 로봇을 21.7% 더 빠르게 만들었습니다. 작은 라즈베리 파이에서도 배치 크기가 16일 때 로봇을 17.6% 더 빠르게 만들었습니다. 가장 좋은 점은 로봇이 크게 멍청해지지 않았다는 것입니다. 정확도는 단 1.47 퍼센트 포인트만 떨어졌으며, 저자들은 이를 엄청난 속도 향상에 비하면 작은 대가라고 말합니다.
하지만 이 논문은 이것이 모든 것을 즉시 해결하는 마법 지팡이가 아니라는 점을 주의 깊게 언급합니다. 저자들은 이 기술을 어떤 모델에든 그냥 갖다 붙인다고 해서 어디서나 완벽하게 작동할 것이라는 생각에 명시적으로 반대합니다. 그들은 단일 사진 작업(배치 크기 1)의 경우, "언머지" 기술의 오버헤드가 하나의 이미지를 처리하기에는 그만한 가치가 없기 때문에 강력한 컴퓨터에서 오히려 속도를 늦춘다는 것을 발견했습니다. 또한 그들의 방법이 메모리를 절약하고 배치 처리를 빠르게 하지만, 처음부터 빠르도록 설계된 다른 유형의 효율적인 AI 모델들을 반드시 능가하는 것은 아니라는 점도 지적합니다. 결과는 측정되었고 실재하지만, 저자들은 이것이 이 기술들을 결합하는 데 있어 최종적이고 완벽한 해결책이라기보다는 유망한 시작점인 '베이스라인(baseline)'임을 시사합니다. 저자들은 향arian 연구가 특히 작은 기기에서의 단일 사진 작업을 위해 MergeOver를 더 나은 소프트웨어 최적화와 같은 다른 기술들과 결합해야 할 수도 있다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.