← 최신 논문
⚡ electrical engineering

An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers

본 논문은 자전거 이용자 안전과 관련된 6가지 미세한 차량 차종을 정확하게 분류하기 위해 RT-DETR과 비전 트랜스포머를 결합한 오픈 소스 기반의 2단계 컴퓨터 비전 파이프라인을 소개하며, 이는 서로 다른 녹화 현장에서도 높은 강건성을 유지하면서 침묵적 오분류를 방지하는 신뢰도 기반의 기권 메커니즘을 특징으로 한다.

원저자: Gandhimathi Padmanaban, Fred Feng

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gandhimathi Padmanaban, Fred Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 우편물 더미를 분류하려고 한다고 상상해 보세요. 어떤 편지들은 명확하게 "신문"이라고 적혀 있고, 어떤 것은 "잡지", 또 어떤 것은 "정크 메일(광고지)"이라고 적혀 있습니다. 하지만 수천 통의 봉투들은 생일 카드인지, 고지서인지, 전단지인지, 아니면 변호사로부터 온 편지인지 무엇이든 될 수 있는 모습으로 놓여 있습니다. 만약 당신이 그냥 추측만 한다면, 실수를 할 수도 있을 것입니다.

이 논문은 거리의 영상 데이터를 보고 차량을 일반적인 범주가 아닌 매우 구체적인 카테고리로 분류하도록 설계된 새로운 오픈 소스 "로봇 분류기"에 대해 설명합니다.

이 시스템이 어떻게 작동하는지 간단한 단계별로 나누어 설명하겠습니다:

1. 문제점: 왜 더 나은 분류기가 필요한가

현재 대부분의 교통 카메라와 안전 연구는 단순히 "자동차", "트럭", 또는 "버스"의 차이만 구분할 수 있습니다. 하지만 자전거 이용자의 안전을 위해서는 이것만으로는 충분하지 않습니다.

  • 비유: 자전거 이용자가 사고를 당하는 상황을 상상해 보세요. 작은 세단이 부딪힌다면 좋지 않은 일입니다. 하지만 키가 큰 SUV나 거대한 상용 트럭이 부딪힌다면, 차량의 앞부분이 더 높고 자전거 이용자를 다르게 타격하기 때문에 부상의 정도가 훨씬 더 심각할 수 있습니다.
  • 공백: 우리는 자전거 이용자 옆을 지나가는 차량이 정확히 어떤 종류인지(예: 미니밴인가 대형 밴인가? 픽업트럭인가 상용 트럭인가?) 알아야 합니다. 기존 도구들은 실제 환경의 복잡하고 지저식한 영상 속에서 이러한 구체적인 유형을 구분해내지 못합니다.

2. 해결책: 2단계 "탐정 팀"

저자들은 두 명의 탐정이 협력하는 것과 같은 2단계 시스템을 구축했습니다.

탐정 #1: 빠른 정찰병 (RT-DETR)

  • 역할: 이 탐정은 영상을 빠르게 스캔합니다. 자동차의 정확한 모델을 알 필요는 없습니다. 그저 "헤이, 저기에 차량이 있어!"라고 말하며 박스를 그려내는 것만으로 충분합니다.
  • 특기: 자동차, 트럭, 버스, 또는 오토바이처럼 보이는 모든 것을 포착하는 데 매우 능숙합니다. 이미 학습된 뇌를 사용하기 때문에, 자동차를 찾는 법을 처음부터 배울 필요가 없었습니다.
  • 필터: 버스나 오토바이를 발견하면 거기서 멈춥니다. 만약 "자동차"나 "트럭"을 발견하면, 이 작업을 탐정 #2에게 넘깁니다.

탐정 #2: 전문가 분류기 (Vision Transformer)

  • 역할: 이 탐정은 탐정 #1로부터 받은 특정 "크롭(박스 안의 이미지)"을 가져와 아주 자세히 들여다봅니다.
  • 특기: 이 전문가는 세밀한 구분을 수행합니다. 차량을 다음 6가지 구체적인 카테지로 분류합니다:
    1. 승용차 (Passenger Car)
    2. SUV
    3. 픽업트럭 (Pickup Truck)
    4. 미니밴 (Minivan)
    5. 대형 밴 (Large Van)
    6. 상용 트럭 (Commercial Truck)
  • "모르겠음" 버튼: 이것이 가장 중요한 부분입니다. 만약 사진이 흐릿하거나, 각도가 이상하거나, 차량이 일부 가려져 있다면, 이 탐정은 확신을 갖지 못할 수 있습니다. 잘못된 추측을 하여 오류를 범하는 대신, 다음과 같은 규칙을 가집니다: "만약 확신도가 60% 미만이라면, '알 수 없음(Unknown)'이라고 답한다."
    • 왜 중요한가: 안전 연구에서는 "그건 픽업트럭이야"라고 자신 있게 말했다가 사실은 미니밴인 경우보다, 차라리 "모르겠다"라고 말하는 것이 낫습니다. 이는 "조용한 오류(silent errors)"를 방지합니다.

3. 학습: 로봇을 어떻게 가르쳤는가

"대형 밴"과 "상용 트럭"을 구분하도록 로봇을 가르치는 것은 어렵습니다. 왜냐하면 표준 데이터셋에는 이러한 특정 트럭의 사진이 매우 적기 때문입니다.

  • 혼합 구성: 연구진은 세 가지 요소를 섞어 커스텀 학습 라이브러리를 구축했습니다:
    1. 스튜디오 사진: 유명한 데이터셋(Stanford Cars)에서 가져온 고화질 자동차 사진.
    2. 웹 스크래핑: 인터넷에서 수집한 밴과 트럭 사진.
    3. 실제 거리 영상 컷: 미시간주 Ann Arbor의 실제 영상 클립을 사용하여 차량을 잘라낸 것으로, 로봇에게 실제 거리의 혼란스러운 환경(흐릿함, 측면 모습, 부분적으로 가려짐 등)을 보여줍니다.
  • 불균형 해소: 로봇은 일반 자동차나 SUV 사진은 훨씬 많이 보았지만, 큰 트럭 사진은 적게 보았습니다. 이를 해결하기 위해, 로봇이 희귀한 트럭 사진들을 무시하지 않도록 학습 과정에서 이들에게 더 많은 주의를 기울이도록 조정했습니다.

4. 결과: 얼마나 잘 작동했는가?

팀은 두 가지 다른 영상 세트로 이 로봇을 테스트했습니다.

테스트 1: "홈 경기" (In-Distribution)

  • 설정: 학습 클립을 가져온 곳과 동일한 거리의 영상으로 테스트했습니다 (Ann Arbor).
  • 점수: **94%**의 정확도를 기록했습니다.
  • 세부 사항: SUV를 포착하는 데 놀라운 성능(97% 정확도)을 보였습니다. 또한 승용차와 픽업트럭에 대해서도 매우 우수했습니다. 유일한 어려움은 차량이 잘 보이지 않을 때였으며, 이때 로봇은 잘못된 추측을 하는 대신 정확하게 "모르겠음" 버튼을 사용했습니다.

테스트 2: "원정 경기" (Out-of-Distribution)

  • 설정: 서로 다른 카메라와 조명을 가진 특수 연구용 자전거에서 촬영된, 완전히 다른 장소의 영상으로 테스트했습니다. 이 과정에서 로봇을 새로 재학습시키지 않았습니다.
  • 점수: **89%**의 정확도를 기록했습니다.
  • 세부 사항: 새로운 장소에 맞춰 재학습하지 않았음에도 불구하고 매우 강력한 결과입니다.
    • SUV와 픽업트럭은 여전히 높은 정확도를 유지했습니다.
    • 미니밴은 조금 까다로워졌습니다. 정확도가 떨어졌지만, 이는 주로 로봇이 더 신중해졌기 때문입니다. 미니밴이 새로운 영상에서 다르게 보였기 때문에 로봇은 (25%의 확률로) "알 수 없음"이라고 말하기 시작했습니다. 즉, 함부로 추측하는 대신 불확실성을 인정했습니다.

5. 이것이 왜 중요한가

  • 오픈 소스: 저자들은 모든 코드, 학습된 로봇의 뇌, 그리고 데이터를 무료로 공개했습니다. 누구나 이를 다운로드하여 자신의 거리 영상을 분석하는 데 사용할 수 있습니다.
  • 안전 우선: 작은 자동차와 큰 트럭을 구분함으로써, 도시 계획가와 안전 연구자들은 정확히 어떤 종류의 차량이 자전거 이용자를 위험에 빠뜨리는지 마침나 이해할 수 있게 됩니다.
  • 수동 작업 불필요: 이전에는 인간이 차량을 세기 위해 몇 시간씩 영상을 직접 봐야 했습니다. 이제 이 도구가 자동으로 그 작업을 수행할 수 있습니다.

요약하자면, 이 논문은 2단계 필터 역할을 하는 스마트하고 무료인 도구를 제시합니다. 먼저 자동차를 찾고, 그다음에는 그것들을 구체적인 유형으로 신중하게 분류합니다. 확신이 서지 않으면 이를 인정함으로써, 잘못된 추측으로 인해 안전 데이터가 오염되는 것을 방지합니다. 또한 재학습 없이도 새로운 거리에서 잘 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →