A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches
이 논문은 클래스에 구애받지 않는 객체 카운팅(Class-Agnostic Counting, CAC) 기술의 발전 과정을 참조 기반(reference-based), 참조 없는(reference-less), 그리고 오픈 월드 텍스트 가이드(open-world text-guided) 방식의 세 가지 패러다임으로 분류하여 체계적으로 정리하고, 주요 벤치마크 성능 분석과 향후 과제를 제시한 첫 번째 종합 리뷰 논문입니다.
원저자:Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi
기존의 물건 세기 AI는 마치 **'특정 메뉴만 만들 줄 아는 요리사'**와 같습니다. "사과 세는 법"만 배운 요리사에게 "포도"를 가져다주면, 포도가 뭔지 몰라서 아예 못 세거나 엉뚱한 숫자를 말하죠. 이 요리사에게 새로운 음식을 가르치려면 매번 엄청나게 많은 사진과 연습(데이터 학습)이 필요했습니다.
2. 새로운 도전: 클래스-애그노스틱 카운팅 (CAC, 만능 요리사 만들기)
이 논문이 다루는 CAC(Class-Agnostic Counting) 기술은 어떤 재료가 들어와도 당황하지 않는 **'만능 요리사'**를 만드는 기술입니다. "사과든, 포도든, 아니면 처음 보는 외계 과일이든 상관없어! 모양이 반복되면 다 셀 수 있어!"라고 말하는 똑똑한 AI를 목표로 합니다.
3. 세 가지 진화 단계 (AI가 물건을 파악하는 방식)
논문은 이 만능 요리사가 발전해온 과정을 세 가지 단계로 나눕니다.
① 1단계: "샘플을 보여주며 가르치기" (참조 기반 방식)
비유: 요리사에게 사과를 세라고 하면서, 옆에 **"자, 여기 사과 사진 3장 있어. 이거랑 똑같이 생긴 걸 다 세어봐"**라고 샘플(Exemplar)을 보여주는 방식입니다.
장점: 샘플을 직접 보여주니 아주 정확하게 잘 셉니다.
단점: 매번 물건을 바꿀 때마다 사람이 옆에서 사진을 찍어 보여줘야 해서 귀찮습니다.
② 2단계: "눈치껏 알아서 하기" (참조 없는 방식)
비유: 샘플을 보여주지 않고 그냥 접시를 툭 던져줍니다. 요리사는 접시를 보더니 "음, 여기 똑같이 생긴 게 엄청 많이 반복되네? 그럼 이게 오늘 셀 물건인가 보다!" 하고 눈치껏 가장 많이 반복되는 걸 찾아냅니다.
장점: 사람이 일일이 샘플을 보여줄 필요가 없어 아주 편합니다.
단점: 만약 접시에 사과도 있고 포도도 있는데, 포도가 훨씬 많다면 요리사는 사과는 무시하고 포도만 세게 됩니다. (눈치가 좀 부족하죠.)
③ 3단계: "말로 설명하기" (텍스트 가이드 방식 - 최신 트렌드)
비유: 요리사에게 사진을 보여주거나 눈치를 보라고 하는 대신, **"지금 접시에 있는 '빨간색 작은 알갱이'들을 다 세어줘"**라고 말(Text Prompt)로 명령하는 방식입니다.
장점: 가장 인간답고 편리합니다. "파란색 차만 세어줘"처럼 아주 구체적인 명령도 가능합니다.
단점: 가끔 요리사가 말을 잘못 알아듣습니다. "빨간 사과"라고 했는데, 배경에 있는 "빨간 꽃"을 사과라고 착각해서 세버리기도 합니다.
4. 결론 및 요약 (세상에 공짜는 없다!)
이 논문은 연구를 통해 아주 중요한 사실 하나를 발견했습니다. 바로 **'편리함과 정확도 사이의 밀당(Trade-off)'**입니다.
사람이 직접 샘플을 보여주면(1단계): 귀찮지만 정확도는 최고입니다.
말로만 명령하면(3단계): 아주 편리하지만, 가끔 엉뚱한 걸 세는 등 정확도가 떨어질 수 있습니다.
결론적으로, 이 논문은 AI가 어떻게 하면 "사람처럼 말로 편하게 명령해도, 샘플을 보여준 것처럼 정확하게 물건을 셀 수 있을지" 그 미래를 향한 지도 역할을 하고 있습니다.
[기술 요약] 클래스 불가지론적 카운팅(Class-Agnostic Counting, CAC)에 관한 조사 연구
1. 문제 정의 (Problem Statement)
전통적인 객체 카운팅(Object Counting) 방식은 특정 클래스(예: 사람, 자동차)를 세기 위해 해당 클래스에 대한 대규모 라벨링 데이터셋과 전용 모델이 필요했습니다. 이는 새로운 객체를 마주했을 때 유연하게 대응하지 못한다는 한계가 있습니다.
**클래스 불가지론적 카운팅(CAC)**은 이러한 문제를 해결하기 위해 등장했습니다. CAC의 목표는 학습 과정에서 본 적 없는(unseen) 임의의 카테고리에 속하는 객체라도, 최소한의 정보(예시 이미지 또는 텍스트 설명)만 주어지면 그 개수를 정확히 추정하는 것입니다. 이는 인간이 처음 보는 물체라도 반복되는 패턴을 보고 개수를 셀 수 있는 능력과 유사한 것을 목표로 합니다.
2. 방법론 및 분류 체계 (Methodology & Taxonomy)
본 논문은 CAC 방법론을 사용자 개입(Guidance)의 정도와 방식에 따라 세 가지 패러다임으로 분류하는 독창적인 분류 체계를 제안합니다.
① 참조 기반 방식 (Reference-based CAC)
특징: 추론 시 사용자가 카운팅할 객체의 **바운딩 박스(Bounding Box) 예시(Exemplar)**를 직접 제공해야 합니다.
작동 원리: 제공된 예시의 시각적 특징(Visual Prototype)을 추출하고, 이를 쿼리 이미지 내의 다른 영역과 매칭(Matching)하여 밀도 맵(Density Map)을 생성합니다.
장점: 현재 가장 높은 정확도와 강건성(Robustness)을 보입니다.
단점: 매번 수동으로 예시를 지정해야 하므로 자동화 및 확장성이 떨어집니다.
② 참조 불필요 방식 (Reference-less CAC)
특징: 별도의 예시 입력 없이, 이미지 내의 **시각적 반복성(Self-similarity)**을 활용합니다.
작동 원리: 이미지 내에서 가장 지배적으로 반복되는 패턴을 알고리즘이 스스로 찾아내어 카운팅 대상으로 삼습니다.
장점: 사용자 개입이 전혀 필요 없어 자동화에 유리합니다.
단점: 사용자의 의도(Intent)를 반영할 수 없으며, 배경의 노이즈나 다른 반복 패턴을 객체로 오인할 가능성이 큽니다.
③ 오픈 월드 텍스트 가이드 방식 (Open-world Text-guided CAC)
특징: 자연어 **텍스트 프롬프트(Textual Prompt)**를 통해 카운팅할 대상을 지정합니다. (예: "빨간 사과를 세어줘")
작동 원리: 최신 시각-언어 모델(Vision-Language Models, 예: CLIP)을 활용하여 텍스트의 의미적 정보와 이미지의 시각적 특징을 정렬(Alignment)합니다.
장점: 인간의 언어와 가장 유사한 방식으로 상호작용할 수 있어 매우 유연하고 직관적입니다.
단점: 텍스트의 의미를 정확히 이해하지 못하거나(Semantic Ambiguity), 참조 기반 방식에 비해 정확도가 다소 낮을 수 있습니다.
3. 주요 기여 (Key Contributions)
최초의 종합적 리뷰: CAC 분야의 발전 과정을 체계적으로 정리한 최초의 포괄적인 서베이 논문입니다.
독창적 분류 체계 제안: CAC 방법론을 세 가지 패러다임으로 나누어 연구 흐름을 명확히 규정했습니다.
방대한 데이터 분석: 30개의 주요 CAC 아키텍처를 조사하고, 골드 스탠다드 벤치마크(FSC-147, CARPK)를 통해 성능을 비교 분석했습니다.
다각적 분석: 정확도뿐만 아니라 계산 복잡도(GFLOPs, Parameters), 텍스트 이해도, 일반화 능력 등을 심도 있게 논의했습니다.
4. 연구 결과 (Results)
성능 비교 (FSC-147 데이터셋 기준):
최고 성능:DAVE와 같은 참조 기반(Reference-based) 모델이 가장 낮은 MAE(평균 절대 오차)와 RMSE(평균 제곱근 오차)를 기록하며 압도적인 정확도를 보였습니다.
트레이드오프(Trade-off): 사용자 편의성(Convenience)이 높아질수록(참조 기반 → 참조 불필요/텍스트 가이드) 정확도는 감소하는 경향이 뚜렷하게 나타났습니다. 즉, **"편의성의 대가로 정확도를 지불"**하는 구조입니다.
일반화 능력 (CARPK 데이터셋 기준):
CACViT와 UPC 같은 모델들이 도메인 변화(Domain Shift)가 있는 환경에서도 우수한 일반화 성능을 보여주었습니다.
계산 복잡도:
최첨단 모델인 DAVE는 매우 높은 정확도를 보이지만, 계산 비용(GFLOPs)이 다른 모델들에 비해 압도적으로 높아 실제 엣지 디바이스(Edge Device) 적용에는 한계가 있음을 확인했습니다.
5. 의의 및 향후 과제 (Significance & Future Directions)
의의
본 논문은 파편화되어 있던 CAC 연구들을 하나의 체계적인 틀로 통합하였으며, 연구자들이 향후 어떤 방향으로 기술을 발전시켜야 할지에 대한 이정표를 제시했습니다.
향후 과제 (Open Challenges)
데이터셋의 한계: 현재의 데이터셋(FSC-147 등)은 단일 클래스 위주이며, 여러 클래스가 섞인 복잡한 이미지(Multi-class)가 부족합니다.
의미론적 이해(Semantic Understanding) 강화: 텍스트 가이드 방식에서 프롬프트의 의도를 정확히 파악하지 못하고 단순히 반복되는 물체를 세는 문제를 해결해야 합니다.
효율성과 정확도의 균형: 높은 정확도를 유지하면서도 계산 복잡도를 낮추어 실시간 시스템이나 모바일 환경에 적용 가능한 모델 개발이 필요합니다.
약지도 학습(Weakly-supervised Learning)의 활용: 라벨링 비용을 줄이기 위해 점(Point) 단위의 정밀한 라벨 없이도 학습 가능한 방법론 연구가 중요합니다.