거대한 도시의 지저분한 항공 사진에서 사물을 찾아내도록 로봇을 가르친다고 상상해 보세요. 자동차처럼 직선적이고 네모난 모양인 일부 사물은 찾기 쉽지만, 항구의 선박이나 활주로의 비행기처럼 기이한 각도로 기울어진 다른 사물들은 찾기 어렵습니다. 이를 찾기 위해 로봇은 기울어진 사물을 감싸는 기울어진 상자를 그려야 합니다.
이 논문은 이전 모델들보다 기울어진 사물을 찾는 데 훨씬 뛰어난 새로운 로봇 두뇌 (RHINO) 를 소개합니다. 저자들은 기존 로봇들이 어려움을 겪었던 두 가지 주요 원인을 발견하고, 두 가지 영리한 트릭으로 이를 해결했습니다.
문제: "네모난" 혼란과 "노이즈가 있는" 교사
1. "네모난" 혼란 (하우스도르프 거리 수정) 로봇의 추측인 빨간 스티커 세트와 실제 사물인 파란 스티커를 매칭해야 하는 게임을 한다고 상상해 보세요.
기존 방식: 기존 로봇은 빨간 스티커와 파란 스티커의 중심 사이의 거리를 측정하는 간단한 자를 사용했습니다. 하지만 기울어진 사물은 특정 각도에서 네모처럼 보일 수 있기 때문에 자는 혼란을 겪었습니다. 때로는 "이 빨간 스티커는 멀리 떨어져 있지만 파란 스티커와 각도가 같으니 매칭이다!"라고 말하며, 같은 사물에 대해 두 개의 상자를 그리게 했습니다. 하나는 좋은 상자이고 다른 하나는 신뢰도가 낮은 나쁜 상자였습니다.
새로운 방식 (RHINO): 저자들은 중심만 측정하는 것이 아니라 상자의 전체 모양을 봐야 한다는 점을 깨달았습니다. 그들은 하우스도르프 거리 (Hausdorff Distance) 라는 수학적 도구를 사용했습니다. 이는 중심이 아니라 모양의 가장자리 사이의 거리를 측정하는 것과 같습니다. 마치 빨간 스티커의 모서리가 파란 스티커의 모서리와 실제로 맞는지 확인하는 것과 같습니다. 이로 인해 로봇은 네모처럼 보이는 모양에 혼란을 겪지 않게 되었고, 중복되고 쓸모없는 상자들이 사라졌습니다.
2. "노이즈가 있는" 교사 (적응형 쿼리 노이즈 제거) 로봇을 더 빠르게 가르치기 위해 기존 방법은 "쿼리 노이즈 제거 (Query Denoising)"라는 기법을 사용했습니다. 이는 교사가 학생에게 정답의 지저분하고 왜곡된 버전을 주고 이를 정리하라고 요구하는 것과 같습니다.
문제: 훈련 초기에는 로봇이 매우 미숙하기 때문에 교사의 지저분한 노트가 실제로 도움이 됩니다. 하지만 로봇이 더 똑똑해져 완벽한 예측을 시작하면, 교사는 여전히 같은 지저분하고 왜곡된 노트를 건네줍니다. 로봇은 혼란을 겪습니다. "잠깐, 정답은 완벽하다는 걸 알는데 교사는 이 지저분한 버전을 고치라고 하네. 교사의 말을 들어야 할지 내 두뇌를 믿어야 할지?" 이는 실제로 로봇 학습의 후기 단계에서 학습 속도를 늦췄습니다.
새로운 방식 (RHINO): 저자들은 교사를 적응형으로 만들었습니다. 로봇의 현재 숙련도를 확인하는 "필터"를 추가했습니다.
로봇이 초보자라면 필터는 지저분한 노트를 통과시킵니다.
로봇이 전문가가 되어 자신의 예측이 이미 지저분한 노트보다 낫다면, 필터는 그 지저분한 노트를 버립니다. 로봇에게 "이 쓰레기를 더 이상 고칠 필요가 없다. 너의 완벽한 답을 믿어라"라고 말해줍니다. 이로 인해 훈련은 집중적이고 효율적으로 유지됩니다.
결과
저자들은 이 새로운 로봇 (RHINO) 을 DOTA 와 DIOR-R 과 같은 유명한 항공 이미지 데이터셋에서 테스트했습니다.
점수: 동일한 기본 하드웨어 (ResNet-50 백본) 를 사용한 이전 최고 모델들과 비교했을 때, RHINO 는 훨씬 높은 점수를 기록했습니다. 점수가 높을수록 좋은 척도에서 정확도가 약 4~5 포인트 향상되었습니다.
비교: 훨씬 더 강력하고 복잡한 컴퓨터 두뇌 (백본) 를 사용한 다른 최상위 모델들보다도 더 좋은 성적을 거두었습니다.
한 마디로 요약
논문의 결론은 다음과 같습니다: "우리는 두 가지 사항을 수정하여 더 나은 기울어진 사물 탐지기를 만들었습니다.
로봇이 네모처럼 보이는 사물에 대해 이중 상자를 그리는 것을 막기 위해 거리 측정 방식을 변경했습니다.
로봇이 이미 정답을 배운 후에는 '노이즈가 있는' 예제에 귀 기울이지 않도록 훈련 과정을 더 똑똑하게 만들었습니다."
그 결과, 이전보다 선박과 비행기와 같은 회전된 사물을 더 정확하게 그리고 더 적은 실수로 찾아내는 모델이 탄생했습니다.
기술 요약: 회전된 Detection Transformer 를 위한 하우스도르프 거리 매칭과 적응적 쿼리 노이즈 제거
문제 제기 Detection Transformer(DETR) 가 수평 객체 탐지에서 새로운 벤치마크를 수립했지만, 회전된 객체 탐지 (방향성 바운딩 박스 사용) 에 적용하는 것은 전문적인 방향성 탐지기들에 비해 뒤처져 왔습니다. 저자들은 회전된 DETR 모델의 성능을 저해하는 두 가지 주요 병목 현상을 다음과 같이 규명했습니다:
이분 매칭에서의 "사각형과 유사한" 문제: DETR 의 표준 이분 매칭은 국소화 비용에 L1 거리를 의존합니다. 회전된 탐지에서 이 지표는 경계 불연속성과 "사각형과 유사한" 문제를 야기하는데, 이는 모델이 각도는 동일하지만 공간적으로 멀리 있거나 Intersection over Union(IoU) 이 낮은 예측에 정답을 할당하게 만듭니다. 이는 DETR 의 핵심 원칙인 일대일 매칭을 위반하여 중복된 저신뢰도 예측을 초래합니다.
정적 쿼리 노이즈 제거의 한계: 기존 쿼리 노이즈 제거 방법 (예: DINO) 은 초기 학습을 가속화하기 위해 정답에 노이즈를 도입합니다. 그러나 모델이 개선됨에 따라 예측이 노이즈가 포함된 정답보다 더 정확해질 수 있습니다. 정적 노이즈 제거는 모델이 이러한 열등하고 노이즈가 섞인 타겟으로부터 계속 학습하도록 강제하여, 학습 후기의 성능을 저해합니다.
방법론 저자들은 RHINO(하우스도르프 거리 매칭을 갖춘 회전된 탐지 Transformer) 를 제안합니다. 이는 DINO 기반 베이스라인에 두 가지 새로운 구성 요소를 강화한 것입니다:
이분 매칭을 위한 하우스도르프 거리: 사각형과 유사한 문제를 해결하기 위해 저자들은 표준 L1 거리 비용을 하우스도르프 거리로 대체합니다.
메커니즘: 하우스도르프 거리는 두 바운딩 박스를 정의하는 점 집합 간의 최대 거리를 계산합니다 (구체적으로 모서리 점이나 가장자리 중점을 사용).
효과: 정규화 후에도 각도 차이를 과도하게 강조하는 L1 과 달리, 하우스도르프 거리는 박스의 축 정렬과 공간적 중첩을 고려합니다. 이는 정답이 기하학적 일관성이 더 높은 예측과 매칭되도록 보장하여 중복된 저신뢰도 예측을 효과적으로 제거합니다.
구현: 모델은 표준 4 차원 박스 표현을 5 차원 좌표 [x,y,w,h,θ]로 확장하며, 각도 θ를 [0,180∘]에서 [0,1]로 매핑하여 반복적 정제 및 변형 가능 어텐션과 같은 기존 DETR 구성 요소와 원활하게 통합합니다.
적응적 쿼리 노이즈 제거: 학습 후기 단계에서 노이즈가 섞인 타겟으로부터 학습하는 문제를 해결하기 위해 저자들은 적응적 필터링 메커니즘을 도입합니다.
메커니즘: 모든 양의 노이즈가 포함된 쿼리를 맹목적으로 감독에 사용하는 대신, 정제된 노이즈가 포함된 쿼리 집합과 모델의 현재 예측 간의 이분 매칭을 수행합니다.
필터링: 원래의 정답 소스에 성공적으로 매칭된 (즉, 모델이 아직 능가하지 못했거나 여전히 최상의 매칭인) 노이즈가 포함된 쿼리만 노이즈 제거 손실에 유지됩니다. 더 이상 최적의 매칭이 아닌 쿼리는 필터링되거나 배경으로 처리됩니다.
개선된 변형: "개선된 적응적 쿼리 노이즈 제거 (AQD*)"가 제안되었으며, 이는 주요 분류 목적을 위해 선택되지 않더라도 필터링된 쿼리에 대해 회귀 손실을 유지하여 국소화 정제를 추가로 안내합니다.
주요 기여
강건한 베이스라인: 저자들은 복잡하고 수동으로 설계된 모듈이나 제안된 수정을 넘어선 전문 손실 함수를 요구하지 않고도 최첨단 향상 (반복적 정제, 동적 앵커 박스, 대비적 노이즈 제거) 을 통합한 단순하고 강건한 회전 탐지용 DETR 베이스라인을 설계했습니다.
하우스도르프 거리 비용: 매칭 비용으로서 하우스도르프 거리의 도입은 사각형과 유사한 문제와 중복 예측을 성공적으로 완화하여 더 안정적인 학습과 높은 성능을 이끌어냅니다.
적응적 쿼리 노이즈 제거: 모델 정확도가 향상됨에 따라 해로운 노이즈가 포함된 쿼리를 선택적으로 제거하는 동적 필터링 전략을 제안하여, 학습 후기 단계에서 모델이 노이즈가 섞인 타겟으로 역행하는 것을 방지합니다.
실험 결과 모델은 단일 스케일 학습 및 테스트 설정 하에 네 가지 표준 회전 객체 탐지 데이터셋인 DOTA-v1.0, DOTA-v1.5, DOTA-v2.0, DIOR-R에서 평가되었습니다.
성능 향상: ResNet-50 백본을 사용하는 모델과 비교하여 RHINO 는 다음과 같은 유의미한 개선을 달성했습니다:
DOTA-v2.0: AP50 +4.18.
DOTA-v1.5: AP50 +4.59.
DIOR-R: AP50 +4.99.
최첨단 성능: RHINO 는 모든 테스트된 데이터셋에서 새로운 벤치마크를 수립했습니다. 예를 들어, DOTA-v1.0 에서 Swin-Tiny 백본을 갖춘 RHINO 는 79.42 AP50 을 기록하여 이전의 DETR 기반 및 합성곱 기반 탐지기들을 능가했습니다.
고정밀 지표: 모델은 방향 정확도에 대한 더 엄격한 지표인 AP75 에서도 우수한 성능을 보여주었으며, 이는 하우스도르프 거리가 각도 정밀도를 효과적으로 향상시킴을 나타냅니다.
절차적 연구: 실험은 L1 을 하우스도르프 거리로 대체하면 중복 예측이 감소하며, 고정된 노이즈 수준의 정적 노이즈 제거보다 적응적 노이즈 제거가 더 우수함을 확인했습니다.
의의 본 논문은 RHINO 가 복잡하고 도메인 특화된 아키텍처 변경에 의존하지 않고도 쿼리 기반 탐지기가 전문적인 방향성 객체 탐지기의 성능을 능가하거나 이를 맞먹을 수 있음을 보여준다고 주장합니다. 회전된 객체의 맥락에서 이분 매칭의 근본적인 불일치와 정적 노이즈 제거의 한계를 해결함으로써, 이 연구는 방향성 객체 탐지에 대한 향후 연구를 위한 강력하고 DINO 기반의 베이스라인을 제공합니다. 이 작업은 신중한 지표 선택과 적응적 학습 전략을 통해 범용 DETR 아키텍처를 회전된 탐지에 적응시킬 수 있는 잠재력을 강조합니다.