← 최신 논문
💻 computer science

Cross-Generation Optimization of YOLOv26, YOLOv11, and YOLOv8 for Fine-Grained Small-Object Detection and Instance Segmentation in Complex Orchards

본 연구는 다양한 스케일과 해상도에 걸쳐 Ultralytics YOLOv8, YOLOv11, YOLOv26을 벤치마킹하여, 고해상도 입력(특히 YOLOv11s-960 및 YOLOv26s-960)으로 학습된 소형 모델이 복잡한 과수원 환경에서의 미세한 소형 객체 탐지 및 인스턴스 분할을 위해 가장 효과적인 정확도-효율성 트레이드오프를 제공한다는 점을 확인하였다.

원저자: Ranjan Sapkota, Manoj Karkee

게시일 2026-08-26
📖 5 분 읽기🧠 심층 분석

원저자: Ranjan Sapkota, Manoj Karkee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상업용 사과 과수원의 조용하고 햇살이 내리쬐는 줄 사이에는 미래의 기계들을 기다리는 미묘하지만 어려운 과제가 놓여 있습니다. 수십 년 동안 컴퓨터 비전은 자동차를 교통 흐름 속에서 찾아내거나 군중 속에서 사람을 찾는 등 놀라운 속도로 사물을 인식하는 법을 배워왔습니다. 하지만 똑같은 기계가 초여름의 어린 사과나무를 바라볼 때, 그 작업은 놀라울 정도로 어려워집니다. 과실은 아주 작아서 흔히 엄지손톱보다도 크지 않으며, 과실 자체와 거의 구별되지 않는 녹색 잎, 줄기, 가지들이 엉켜 있는 조밀하고 혼란스러운 녹색 덩굴 속에 숨겨져 있습니다. 이 "녹색 대 녹색(green-on-green)" 환경은 목표물이 배경 속으로 매끄럽게 녹아들어 버리는 시각적 퍼즐을 만들어냅니다. 이 나무들을 돌볼 수 있는 로봇(예를 들어, 남은 과실이 크고 달콤하게 자랄 수 있도록 과도한 과실을 솎아내는 작업 등)을 만들기 위해, 엔지니어들은 단순히 과실을 보는 카메라 이상의 것이 필요합니다. 그들은 과실을 붙들고 있는 섬세하고 실 같은 줄기, 과실 밑부분의 작은 컵 모양, 그리고 과실 본체 자체를, 설령 그것들이 부분적으로 가려져 있거나 화면상에서 불과 몇 픽셀 너비에 불과할 때라도 구분해낼 수 있는 시스템이 필요합니다.

이것이 코넬 대학교 연구진이 다룬 구체적인 문제로, 그들은 현대 인공지능이 이러한 작고 숨겨진 세부 사항들을 얼마나 잘 처리하는지 테스트하기 위해 연구를 시작했습니다. 그들은 실시간으로 사물을 포착하는 능력으로 유명한 YOLO 계열의 AI 모델들에 집중했습니다. 연구팀은 새로운 유형의 AI를 발명한 것이 아니라, 대신 신중한 실험자로서 역할을 수행하며 세 가지 서로 다른 세대의 모델인 기존의 YOLOv8, 더 새로운 YOLOv11, 그리고 매우 최근의 YOLOv26을 가져와 다양한 조건 하에서 테스트했습니다. 그들은 두 가지를 알고 싶었습니다. 더 크고 복잡한 AI 모델이 항상 이러한 작은 목표물에 더 효과적인가, 그리고 AI에게 더 선명하고 높은 해상도의 이미지를 제공하는 것이 놓칠 뻔한 것을 보게 하는 데 도움이 되는가 하는 점입니다. 이를 알아내기 위해, 그들은 과실이 가장 작고 찾기 어려운 상태인 워싱턴주의 실제 사과 과수원에서 촬영한 600장의 이미지 데이터셋을 사용하여 이 모델들의 30가지 서로 다른 버전을 학습시켰습니다.

이 광범한 테스트 결과는 이러한 기계가 보는 법을 배우는 방식에 대한 직관에 반하는 진실을 드러냈습니다. 오랫동안 이 분야의 가정은 더 나은 성능을 원한다면 단순히 더 큰 '두뇌'가 필요하다는 것이었습니다. AI의 세계에서 이는 모델에 더 많은 레이어와 더 많은 파라미터를 사용하여, 본질적으로 컴퓨터가 이미지를 분석하기 위한 더 많은 메모리와 처리 능력을 부여하는 것을 의미합니다. 연구진은 이 점을 확인하기 위해 "나노(nano)"라고 불리는 가장 작은 버전의 모델들과 거대한 "엑스트라 라지(extra-large)" 버전들을 비교했습니다. 그들은 단순히 모델을 크게 만드는 것이 반드시 더 나은 결과를 보장하지 않는다는 것을 발견했습니다. 사실, 가장 크고 계산량이 많은 모델들이 훨씬 작고 효율적인 모델들보다 더 나은 성능을 낼 것이라는 기대에 미치지 못하는 경우가 많았습니다. 가장 큰 모델들은 훨씬 더 많은 컴퓨팅 능력을 사용할 수 있음에도 불구하고, 때때로 아주 작은 줄기를 완전히 놓치거나 과실의 정밀한 경계를 그리는 데 어려움을 겪었습니다.

대신, 이러한 작은 사물을 명확하게 보는 핵심은 학습 과정에서 이미지가 AI에게 어떻게 제시되느냐에 있었습니다. 연구진은 두 가지 접근 방식을 비교했습니다. 하나는 이미지를 640x640 픽셀의 표준 크기로 축소하는 방식이었고, 다른 하나는 이미지를 960x960 픽셀의 높은 해상도로 유지하는 방식이었습니다. 이미지가 축소되었을 때, 작은 줄기와 작은 과실 본체는 세부 사항을 잃고 흐릿해지거나 배경 잎들의 노이즈 속으로 사라져 버렸습니다. 해상도를 높게 유지함으로써, 연구진은 AI가 장면을 이해하는 데 필요한 미세한 공간적 세부 사항을 보존할 수 있었습니다. 이 고해상도 접근 방식은 지속적으로 모델들에게 도움이 되었지만, 모든 모델에게 똑같이 도움이 된 것은 아니었습니다. 가장 유의미한 개선은 소형에서 중형 크기의 모델들에서 나타났습니다. 이 압축된 모델들은 더 선명한 이미지로 학습되었을 때, 거대한 모델들이 동일한 고해상도 사진을 받았을 때조차 따라잡지 못하는 수준의 정확도로 작은 과실 부위들을 탐지하고 윤곽을 그려낼 수 있었습니다.

연구는 로봇이 과실의 어느 부분을 보아야 하는지에 따라 작업의 난이도가 달라진다는 점을 강조했습니다. 상대적으로 둥글고 더 큰 주된 과실 본체는 AI가 찾기에 비교적 쉬웠습니다. 과실 밑부분의 꽃받침(flower cup)은 더 어려웠지만 여전히 감당할 만한 수준이었습니다. 가장 어려운 목표물은 과실을 가지에 연결하는 가늘고 바늘 같은 줄기인 과경(peduncle)이었습니다. 이 구조는 매우 가늘고 종종 잎에 의해 가려져 있기 때문에, 이미지를 크기 조정하거나 AI 모델이 제대로 튜닝되지 않으면 쉽게 사라져 버립니다. 연구진은 고해상도 이미지로 학습된 작은 모델들이 이러한 줄기를 찾는 데 가장 성공적이라는 것을 발견했습니다. 예를 들어, 960 픽셀 이미지를 사용해 학습된 한 소형 모델은 가장 큰 모델들이 요구하는 컴퓨팅 능력의 극히 일부만을 사용하면서도, 과실과 그 부위들을 식별하는 데 있어 높은 수준의 정확도를 달anim했습니다. 반면, 가장 큰 모델들은 각 이미지를 처리하는 데 훨씬 더 많은 시간이 걸리고 훨씬 더 많은 에너지를 소비했음에도 불구하고 더 나은 결과를 만들어내지 못했습니다. 어떤 경우에는 가장 큰 모델들이 실제로 더 낮은 성능을 보이기도 했는데, 이는 더 많은 복잡성을 더하는 것이 AI를 돕기보다 오히려 혼란스럽게 만들 수 있음을 시사합니다.

이 연구는 농업용 로봇을 구축하는 엔지니어들에게 명확한 가이드를 제공합니다. 이는 더 나은 인지 능력을 향상시키는 길이 반드시 더 크고 비싼 컴퓨터를 만드는 것이 아니라, 데이터를 준비하는 방식에 대해 더 똑똑해지는 것에 있다는 것을 시사합니다. 이미지의 미세한 세부 사항을 보존하는 데 집중하고, 이를 적절한 크기의 모델과 결합함으로써, 막대한 계산 비용 없이도 높은 정확도를 달성하는 것이 가능합니다. 연구진은 고해상도 이미지로 학습된 작은 모델이 가장 강력한 시스템들과 대등하거나 이를 능가하는 정확도로 과실과 그 섬세한 부위들을 식별할 수 있다는 것을 발견했습니다. 이는 로봇이 현장에서 빠르고 효율적으로, 종종 제한된 전력과 컴퓨팅 자원을 가지고 작동해야 하는 미래의 농업형 로봇에 있어 매우 중요한 발견입니다. 연구는 복잡한 녹색 환경 속에서 작고 숨겨진 사물을 보는 특정한 과제에 있어서는, 압축된 모델과 선명한 시야를 결격하는 것이 단순히 더 많은 컴퓨팅 파워를 쏟아붓는 것보다 훨씬 더 효과적이라는 결론을 내립니다. 이 모델들의 구현 방식과 사용된 데이터는 이제 다른 이들이 사용할 수 있도록 공개되어, 과수원을 단순한 녹색 덩어리가 아니라 돌봐야 할 개별적이고 섬세한 구조물들의 집합체로 볼 수 있는 차세대 농업 로봇의 실질적인 토대를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →