A Comparative Study of Faster R-CNN, Mask R-CNN, and YOLOv8 for Object Detection and Instance Segmentation, with a Custom-Class Transfer-Learning Case Study
본 논문은 객체 탐지 및 인스턴스 분할을 위한 Faster R-CNN, Mask R-CNN, 그리고 YOLOv8에 대한 이론적 및 질적 비교 분석을 제공하며, 맞춤형 군용 차량 사례 연구를 통해 경량 단일 단계 검출기가 일반 데이터셋만으로 학습된 2단계 모델보다 우수한 성능을 보이면서도 전이 학습을 통해 새로운 클래스에 효과적으로 적응할 수 있음을 진화하는 실시간 탐지 아키텍처의 맥락 안에서 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터 비전의 세계에서 기계는 세상을 단순히 색상과 모양의 집합이 아니라, 뚜렷한 객체들로 가득 찬 장면으로 인식하는 법을 배우고 있습니다. 객체 탐지(object detection)라고 알려진 이 분야는 자율주행 자동차가 보행자를 인식하고, 보안 카메라가 침입자를 포착하며, 의료 스캐너가 종양을 식별할 수 있게 해주는 기술입니다. 기계가 이 작업을 수행하기 위해서는 두 가지 어려운 과제를 동시에 수행해야 합니다. 즉, 이미지 내에서 객체가 어디에 위치하는지 찾아내야 함과 동시에, 그 객체가 정확히 무엇인지 결정해야 합니다. 수년 동안 연구자들은 컴퓨터에게 이를 가르치는 최선의 방법에 대해 논쟁해 왔습니다. 어떤 방식은 모든 세부 사항이 정확한지 확인하기 위해 이미지를 느리고 체계적으로 훑어보는 세심한 검사관처럼 작동하는 반면, 다른 방식은 속도를 우선시하기 위해 단 한 번의 통과(single pass)로 전체 장면을 처리하는 빠른 훑어보기처럼 작동합니다. 엔지니어들의 핵심 질문은 완벽한 정확성과 실시간으로 작동할 수 있는 충분한 속도 사이의 이 절충안을 어떻게 균와를 맞출 것인가 하는 것입니다.
웨스트 플로리다 대학교의 무함마드 우스만 아슬람(Muhammad-Usman Aslam)이 진행한 최근 연구는 세 가지 서로 다른 컴퓨터 시스템을 테스트함으로써 이 균형을 탐구합니다. 이 연구는 단계별로 작동하며 그중 하나는 객체의 정밀한 윤곽선까지 그릴 수 있는 두 가지 기존 방식과, 한 번에 이미지를 처리하는 더 빠르고 새로운 방식을 비교합니다. 이 연구는 표준 테스트 이미지뿐만 아니라, 표준 테스트가 흔히 놓치는 실질적인 문제, 즉 기계가 한 번도 학습해 본 적 없는 객체를 마주했을 때 어떤 일이 발생하는지를 다룹니다. 이를 위해 연구자는 빠르고 현대적인 시스템이 대부분의 컴퓨터 비전 모델 학습에 사용되는 표준 이미지 라이브러리에 존재하지 않는 범주인 군용 장갑차를 식별하도록 훈련시켰습니다.
조사는 Faster R-CNN, Mask R-CNN, YOLOv8로 알려진 이 세 가지 시스템이 어떻게 구축되었는지 살펴보는 것으로 시작되었습니다. 첫 두 시스템은 2단계 과정을 거쳐 작동합니다. 먼저 이미지를 스캔하여 객체가 포함되어 있을 법한 영역을 찾은 다음, 해당 특정 영역을 분석하여 객체가 무엇인지, 그리고 그 가장자리가 어디인지를 결정합니다. Mask R-CNN은 세 번째 단계를 추가하여, 각 객체의 픽셀 단위로 정밀한 윤곽선을 그려 배경 및 다른 겹쳐진 객체로부터 분리할 수 있게 해줍니다. 이러한 방식들은 높은 정확도로 알려져 있지만, 더 많은 컴퓨팅 자원과 시간을 필요로 합니다. 세 번째 시스템인 YOLOv8은 다른 접근 방식을 취합니다. 이 시스템은 전체 이미지를 단 한 번의 통과로 살펴보고, 모든 객체의 위치와 유형을 동시에 예측합니다. 이 설계는 속도를 위해 만들어졌으며, 비디오 감시와 같은 실시간 응용 분야에 이상적이지만, 역사적으로 매우 작거나 밀집된 객체에 대해서는 약간 덜 정밀하다는 평가를 받아왔습니다.
이 시스템들을 실제 환경에서 테스트하기 위해, 연구자는 일반적인 사람, 자동차, 동물 등이 포함된 표준 이미지 세트를 사용하여 사전 훈련된 시스템들이 얼마나 잘 수행되는지 확인했습니다. Faster R-CNN 시스템에 딱정벌레 이미지를 보여주었을 때, 시스템은 이를 올바르게 식별했지만 동시에 동일한 위치에서 '곤충'이라는 낮은 신뢰도의 추측을 추가로 내놓기도 했습니다. 이는 시스템이 서로 다른 카테고리의 객체가 겹치거나 매우 유사해 보일 때 때때로 어려움을 겪는다는 것을 보여줍니다. 새 사진을 보여주었을 때, 시스템은 이를 '새'라고 부를지, '동물'이라고 할지, 혹은 특정 종류의 새라고 할지 망설였는데, 이는 시스템의 어휘가 원래 학습된 80개의 특정 카테고리로 제한되어 있음을 드러냅니다. Mask R-CNN 시스템은 표준 이미지에서 인상적인 성능을 보였으며, 겹쳐 있는 얼룩말과 군중 속의 사람들을 정밀한 윤곽선으로 성공적으로 분리해 냈지만, 이를 수행하는 데 훨씬 더 많은 컴퓨팅 자원을 필요로 했습니다.
그러나 이 연구의 가장 중요한 부분은 이 시스템들에게 이전에 본 적 없는 것, 즉 탱크를 보는 법을 가르치려는 시도였습니다. 표준 컴퓨터 비전 모델은 '폐쇄형 어휘(closed-vocabulary)' 시스템입니다. 즉, 학습된 특정 객체 목록만을 인식할 수 있다는 뜻입니다. 연구자가 표준 Faster R-CNN 및 Mask R-CNN 모델에 군용 장갑차 사진을 보여주었을 때, 기계들은 이를 탱크로 식별하는 데 실패했습니다. 대신, 그들은 이미지를 자신들이 알고 있는 가장 가까운 카테고리로 강제로 끼워 맞추어, 탱크를 '트럭'이나 '자동차'로 분류했습니다. 이것은 기계의 형태를 보는 능력의 실패가 아니라 어휘의 한계였습니다. 즉, 기계의 사전에 '탱크'라는 단어가 없었던 것입니다.
이를 해결하기 위해 연구자는 YOLOv8 시스템을 활용하고 전이 학습(transfer learning)이라는 기법을 사용했습니다. 처음부터 다시 시작하는 대신, 시스템에 인간이 직접 라벨링한 단 20장의 탱크 이미지가 담긴 작은 맞춤형 데이터셋을 제공했습니다. 그런 다음 이 작은 이미지 세트에 대해 시스템을 미세 조정(fine-tuning)했습니다. 결과는 놀라웠습니다. 이 새로운 클래스에 적응된 YOLOv8 시스템은 박물관 전시물과 야외 사진 속의 탱크를 높은 신뢰도로 성공적으로 식별해 냈습니다. 심지어 흐릿함과 거리에도 불구하고 들판에서 움직이는 장갑차를 인식해 냄으로써, 가볍고 빠른 시스템이 아주 적은 데이터만으로도 새로운 특정 작업에 빠르게 적응할 수 있음을 증명했습니다.
연구는 결론적으로, 오래된 2단계 시스템들이 알려진 객체에 대해 높은 정밀도가 필요한 일반 목적의 작업에는 여전히 탁월하지만, 새로운 카테거리에 대해서는 경직되어 있다고 밝힙니다. 그들은 명시적으로 가르치지 않은 것은 인식할 수 없습니다. 반면, 단일 단계 YOLOv8 시스템은 실질적인 응용 분야에서 매우 가치 있는 유연성을 보여주었습니다. 이는 몇 장의 새로운 이미지를 라벨링하는 약간의 인간적 노력만 있다면, 빠른 탐지기를 완전히 새로운 유형의 객체를 인식하도록 확장할 수 있음을 보여주었습니다. 이는 일반적인 카테고리가 아닌 특정하고 맞춤화된 항목을 탐지하는 것이 목표인 많은 현실 세계의 문제에서, 오래된 느린 방식의 원시적인 정확도보다 새로운 단일 단계 방식의 속도와 적응성이 더 유용할 수 있음을 시사합니다. 또한 연구는 이 분야가 빠르게 변화하고 있으며, 단일 단계 시스템의 속도와 기존 시스템의 정확도를 결합하려는 새로운 모델들이 등장하고 있다고 언급하지만, 핵심 교훈은 명확합니다. 최고의 도구는 당신이 세상의 모든 것을 아는 기계를 원하는지, 아니면 새로운 것을 보는 법을 빠르게 배울 수 있는 기계를 원하는지에 따라 달라진다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.