← 최신 논문
💻 computer science

UAD-YOLO: An Efficient Context-Aware and Shape-Aware Framework Based on YOLOv11 for Urban Anomaly Detection in Complex Scenes

본 논문은 새로운 데이터셋을 통해 검증되었으며 베이스라인 모델들보다 우수한 성능 지표를 보이는, 복잡한 장면에서 고정밀 실시간 도시 이상 탐지를 달성하기 위해 대형 분리 가능 커널 어텐션(Large Separable Kernel Attention), 재매개변수화 컨볼루션(Reparameterised Convolution) 및 Shape-IoU 손실로 강화된 효율적인 YOLOv11 기반 프레임워크인 UAD-YOLO를 제시한다.

원저자: Chen Shiying

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chen Shiying

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

도시는 끊임없이 움직이고 변화하는 살아있는 시스템이지만, 안전을 유지하기 위해서는 일정한 유지보수의 리듬에 의존합니다. 도로에 균열이 생기거나, 나무가 쓰러지거나, 표지판이 파손되면 그 결과는 사소한 불편함에서부터 심각한 위험에 이르기까지 다양할 수 있습니다. 수십 년 동안 이러한 도시의 위험 요소를 감시하는 것은 인간 검사관들이 동네를 걷거나 차를 타고 다니며 문제를 찾는 일이었습니다. 이 방식은 느리고 비용이 많이 들며, 작거나 숨겨진 문제를 놓치는 경우가 많습니다. 최근 몇 년 사이, 과학자들은 컴퓨터가 카메라를 통해 이러한 문제들을 "볼" 수 있도록 가르치며 도움을 받기 위해 컴퓨터로 눈을 돌렸습니다. 객체 탐지(object detection)라고 알려진 이 분야는 기계가 이미지를 스캔하여 자동차에서부터 포트홀에 이르기까지 특정 항목을 식별할 수 있게 해줍니다. 그러나 컴퓨터에게 번잡한 거리의 들쭉날쭉한 균열을 찾아내도록 가르치는 것은 빈 주차장에서 자동차를 찾는 것보다 훨씬 더 어렵습니다. 배경은 복잡하고, 조명은 변하며, 대상 자체도 종종 불규칙하거나 부서지거나 일부가 가려져 있기 때문입니다.

쓰촨 교통직업기술대학교(Sichuan Vocational and Technical University of Communications) 연구진의 새로운 연구는 컴퓨터가 우리 도시를 관찰하는 더 스마트한 방법을 개발함으로써 이러한 어려움을 해결합니다. 연구팀은 다양한 유형의 도시 문제를 실시간으로 찾아내도록 설계된 UAD-YOLO라는 시스템을 개발했습니다. 이 시스템은 단순히 표준적인 상자 모양의 형태만을 찾는 대신, 도시 거리의 무질서하고 복잡한 현실을 이해하도록 구축되었습니다. 이 시스템은 도로 균열, 포트홀, 파손된 표지판, 쓰러진 나무, 쓰레기, 낙서, 부서진 전신주를 포함한 일곱 가지 유형의 이상 징후를 포착할 수 있습니다. 연구진은 단순히 기존 데이터에만 의존하지 않고, 컴퓨터가 무엇을 찾아야 하는지 가르치기 위해 이러한 특정 문제들을 담은 수천 개의 사례가 포함된 새롭고 방대한 이미지 컬렉션을 직접 구축했습니다. 여러 고급 기술을 결합함으로써, 그들은 높은 정확도를 갖추면서도 표준 장비에서 실행될 수 있을 만큼 빠른, 지속적인 도시 모니터링을 위한 실용적인 솔루션을 만들어냈습니다.

연구진이 직면한 핵심 과제는 도시의 이상 징후들이 깔끔하고 완벽한 물체처럼 보이지 않는다는 점이었습니다. 도로 균열은 몇 미터에 걸쳐 가늘고 구불구불한 선으로 이어질 수 있고, 쓰레기 더미는 형태가 불분명한 덩어리일 수 있습니다. 전통적인 컴퓨터 비전 도구들은 이러한 불규칙한 모양, 특히 그림자, 다른 차량 또는 복잡한 질감과 같은 다른 방해 요소들에 둘러싸인 상황에서 종종 어려움을 겪습니다. 이를 해결하기 위해 연구팀은 속도로 유명한 강력한 기존 탐지 프레임워크인 YOLOv11을 수정했습니다. 그들은 컴퓨터가 인간 관찰자처럼 "생각"하도록 돕기 위해 세 가지 구체적인 개선 사항을 추가했습니다. 첫째, 그들은 시스템이 큰 그림을 보는 더 나은 방법을 제공했습니다. 이미지를 통해 컴퓨터가 장거리 연결성을 볼 수 있게 하는 기술을 사용함으로써, 시스템은 단순히 무작위 선을 보는 것이 아니라 작은 균열이 전체 도로 표면과 어떻게 연관되는지를 이해할 수 있습니다. 이는 시스템이 배경 소음을 무시하고 실제로 중요한 것에 집중할 수 있도록 돕습니다.

둘째, 연구진은 컴퓨터가 미세한 세부 사항을 보는 방식을 개선했습니다. 그들은 시스템이 훈련 단계에서는 복잡한 질감을 학습하지만, 실제 작동 시에는 구조를 단순화할 수 있는 방법을 도입했습니다. 이는 마치 학생이 많은 노트와 도표를 가지고 공부한 뒤, 시험을 볼 때는 간결한 정신적 지도를 사용하여 시험을 치르는 것과 비슷합니다. 이 접근 방식은 컴퓨터가 프로세스를 늦추지 않으면서도 아주 작은 포트홀이나 희미한 흠집 같은 세밀한 부분을 포착할 수 있도록 보장합니다. 셋째, 그들은 컴퓨터가 탐지된 물체 주변에 상자를 그리는 방식을 변경했습니다. 표준적인 방법은 종종 이러한 상자들을 경직된 모양으로 강제하여 부정확할 수 있습니다. 새로운 시스템은 물체의 실제 모양이 길고 얇든 짧고 넓든 상관없이 실제 모양을 존중하는 더 유연한 접근 방식을 사용하여 위치를 정밀하게 표시합니다.

이러-러한 변화가 효과가 있는지 테스트하기 위해 연구진은 도시 장면의 이미지를 17,000장 이상 포함한 새로운 데이터셋을 사용하여 시스템을 훈련시켰습니다. 그들은 시스템을 다른 인기 있는 탐지 방법들과 비교 테스트했으며, 그들의 새로운 접근 방식이 적절한 물체를 찾는 데 훨씬 더 뛰어나고 놓치는 경우가 적다는 것을 발견했습니다. 테스트에서 시스템은 이상 징후를 찾아야 하는 경우의 83.1%를 정확히 식별했는데, 이는 표준 모델보다 눈에 띄는 향상입니다. 또한 실제 존재하는 문제의 77.1%를 찾아냈는데, 이는 위험을 놓치는 것이 위험한 안전 응용 분야에서 핵심적인 지표입니다. 실생활 사용을 위해 가장 중요한 점은, 시스템이 믿기 힘들 정도로 빨랐다는 것입니다. 시스템은 이미지를 처리하고 답변을 내놓는 데 단 2.31밀리초밖에 걸리지 않았으며, 이는 이론적으로 초당 수백 장의 이미지를 분석할 수 있음을 의미합니다. 이 속도는 이 기술이 이동하는 차량이나 드론에 설치되어 지연 없이 도시 거리를 지속적으로 모니터링할 수 있음을 시사합니다.

연구는 또한 다양한 설정이 시스템 성능에 어떤 영향을 미치는지 탐구하여, 그들이 선택한 특정 기술의 조합이 가장 효과적임을 확인했습니다. 그들은 "장거리 뷰"를 적절한 크기로 사용하는 것이 매우 중요하다는 것을 발견했습니다. 너무 좁게 보면 맥락을 놓치고, 너무 넓게 보면 혼란이 가중되었습니다. 마찬가지로, 가장 유연한 형태 탐지 설정이 도시의 손상된 불규칙한 특성에 가장 잘 작동한다는 것을 발견했습니다. 시스템이 완벽하지는 않으며 극단적인 조명이나 심한 장애물에 의해 여전히 혼동될 수 있지만, 결과는 명확한 진전 방향을 보여줍니다. 연구진은 다양한 날씨 조건과 장소에서의 추가적인 테스트가 필요하다는 점을 인정하지만, 현재의 결과는 컴퓨터가 이전에는 도달할 수 없었던 정확도와 속도로 도시 생활의 미묘하고, 부서지고, 무질서한 세부 사항들을 볼 수 있도록 훈련될 수 있음을 입증합니다. 이 연구는 도시가 사후 대응적 수리에서 사전 예방적 안전으로 나아갈 수 있는 유망한 도구를 제공하며, 우리가 의지하는 인프라가 끊임없이 깜빡이지 않는 눈으로 감시되도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →