← 최신 논문
💻 computer science

CoDi -- an exemplar-conditioned diffusion model for low-shot counting

이 논문은 정밀한 국지화를 위해 고품질 밀도 지도를 생성하는 특화된 컨디셔닝 모듈을 통해 조밀하고 작은 객체 영역에서의 과제를 효과적으로 해결함으로써, 로우샷(low-shot) 객체 계수 작업에서 기존의 최첨단 방법들을 크게 능가하는 새로운 예시 조건부 잠재 확산 모델인 CoDi를 소개한다.

원저자: Grega Šuštar, Jer Pelhan, Alan Lukežič, Matej Kristan

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Grega Šuštar, Jer Pelhan, Alan Lukežič, Matej Kristan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

해변의 모래알 하나하나를 세거나, 붐비는 밤하늘의 작은 별들을 하나하나 세려고 한다고 상상해 보십시오. 만약 전체적인 모습만 본다면 그것은 그저 흐릿한 덩어리일 뿐입니다. 만약 돋보기를 들고 하나씩 세려고 시도한다면, 몇 개를 놓치거나 같은 것을 두 번 셀 수도 있습니다. 이것이 컴퓨터가 이미지 속의 사물을 '세는' 작업, 즉 객체 카운팅(object counting)이라 불리는 작업을 수행할 때 겪는 일상적인 고충입니다. 오랫동안 컴퓨터에는 이를 수행하는 두 가지 주요 방법이 있었습니다. 첫 번째 방식은 모래 위에 물을 붓는 것과 같았습니다. 그들은 '밀도 맵(density map)'을 만들었는데, 이는 높이가 그곳에 얼마나 많은 것이 있는지를 나타내는 매끄러운 언덕 형태였습니다. 이 방식은 대략적인 총량을 파악하는 데는 좋았지만, 각 모래알이 정확히 어디에 있는지를 알려주는 데는 형편없었습니다. 두 번째 방식은 레이저 포인터를 사용하여 모든 별에 표식을 남기는 것과 같았습니다. 이 방식은 위치를 찾는 데는 매우 뛰어났지만, 별들이 너무 밀집되어 있으면 컴퓨터가 혼란을 느끼고 사용할 수 있는 '포인터'가 바닥나면서 무언가를 놓치거나 루프에 빠지게 됩니다.

이제 단순히 흐릿한 언덕을 그리거나 제한된 수의 레이저 포인터를 사용하는 것이 아니라, 새로운 종류의 예술가를 상상해 보십시오. 이 예술가는 정지 화면의 노이즈(마치 신호가 없는 TV 화면처럼)로 가득 찬 캔버스에서 시작하여, 단계별로 노이즈를 제거하며 모든 객체의 위치를 보여주는 완벽하고 선명한 그림을 드러냅니다. 이것이 CoDi(Counting by Diffusion)라고 불리는 새로운 방법의 핵심 아이디어입니다. 이 논문의 저자인 Grega Šuštar와 그의 팀은 이미지를 생성하는 데 유명한 AI 유형인 '확산 모델(diffusion model)'을 사용하여 카운팅 문제를 해결하는 시스템을 구축했습니다. CoDi는 숫자를 추측하거나 상자를 그리는 대신, 빈 캔버스의 노이즈를 제거하여 각 객체를 나타내는 작고 뚜렷한 점들을 튀어나오게 하는 법을 학습합니다. 이 마법 같은 기술의 비결은, 단 한두 개의 예시만 보여주거나 혹은 예시를 전혀 주지 않더라도 이 작업을 수행할 수 있다는 점에 있습니다. 마치 친구에게 특정 종류의 버섯 사진 한 장을 보여주며 숲속에서 그 버섯들을 모두 찾아보라고 부탁하는 것과 같습니다. CoDi는 단순히 총량을 추측하는 것이 아니라, 가장 붐비는 숲속에서도 각 버섯이 있는 정확한 지점을 가리킵니다.

문제점: "붐비는 방"의 딜레마

사진 속의 사물을 세는 것은 사물들이 흩어져 있을 때는 쉽습니다. 하지만 벌떼, 포도 더미, 또는 인파가 몰린 군중의 사진이라면 어떻게 될까요? 바로 이 지점에서 기존 방식들은 한계에 부딪힙니다.

'밀도' 방식은 군중의 '열기' 높이를 측정하여 군중을 세는 것과 같습니다. 군중이 밀집되면 열기가 높아지고, 컴퓨터는 그곳에 많은 사람이 있다는 것을 알게 됩니다. 하지만 그 열기 맵을 통해 누가 어디에 있는지는 말해주지 못합니다. 만약 그 열기 맵에서 가장 높은 정점을 찾으려 한다면, 열기가 서로 뭉쳐 있기 때문에 종종 오류가 발생하게 됩니다.

'탐지(detection)' 방식은 제한된 수의 무전기를 가진 보안 요원과 같습니다. 보안 요원은 특정 사람들을 가리킬 수 있지만, 사람이 너무 많으면(무전기 수보다 많으면) 요원은 군중을 작은 그룹으로 나누고 각각 따로 센 다음 그 답들을 다시 합치려고 시도해야 합니다. 이 과정은 느리고 번거로우며, 종종 같은 사람을 두 번 세거나 누군가를 완전히 놓치는 결과를 초래합니다.

해결책: CoDi의 "마법 같은 노이즈"

저자들은 CoDi를 "정지 화면을 청소하는 게임"처럼 취급하는 시스템으로 제안합니다.

작동 방식은 다음과 같습니다:

  1. 시작 지점: 신호가 없는 TV 화면을 상상해 보십시오. 이것이 CoDi의 시작점입니다. 아직 어디에 객체가 있는지 알지 못합니다.
  2. "예시(Exemplar)" 단서: 사과를 세고 싶다면, 컴퓨터에 사과 사진 몇 장을 보여줍니다(이를 '예시'라고 합니다). CoDi는 매우 똑똑한 필터 역할을 하는 특수한 '조건화 모듈(conditioning module)'을 가지고 있습니다. 이 모듈은 당신의 사과 예시들을 살펴보고 이렇게 말합니다. "좋아, 나는 이것들과 정확히 똑같이 생긴 것들을 찾아내고, 나머지는 무시해야겠어."
  3. 노이즈 제거의 춤: CoDi는 TV 화면에서 노이즈를 제거하기 시작하지만, 매우 구체적인 방식으로 수행합니다. 단순히 추측하는 것이 아니라 점진적으로 이미지를 정교하게 다듬습니다. 매 단계마다 흐릿한 노이즈는 점점 더 선명한 점들로 변해갑니다.
  4. 결과: 이 과정이 끝나면, 화면은 흐릿한 언덕이나 지저도한 목록이 아닙니다. 그것은 작고 날카로운 정점들이 있는 깨끗한 지도입니다. 각 정점은 하나의 객체를 나타내는 완벽한 점입니다. 컴퓨터는 그저 이 점들을 세기만 하면 됩니다.

비결은 CoDi가 이 점들을 평균 내는 것이 아니라, 하나씩 생성하는 법을 배운다는 것입니다. 이는 객체들이 서로 맞닿아 있는 매우 붐비는 장면에서도 CoDi가 이들을 분리하여 정확하게 셀 수 있음을 의미합니다.

성과: 최고를 넘어서다

연구팀은 FSC147(147가지의 서로 다른 객체 유형 포함)과 MCAC(다중 클래스 카운팅 데이터셋)를 포함한 매우 어려운 데이터셋으로 CoDi를 테스트했습니다. 결과는 인상적이었습니다:

  • 퓨샷 카운팅(Few-Shot Counting): 단 몇 개의 예시(예: 대상 객체의 이미지 3장)가 주어졌을 때, CoDi는 정확도(평균 절대 오차, MAE) 측면에서 기존 최신 방식들을 15% 차이로 앞질렀습니다.
  • 원샷 카운팅(One-Shot Counting):하나의 예시만 주어졌을 때도 CoDi는 여전히 최고였으며, 이전의 최고 방식을 13% 앞질렀습니다.
  • 예시 없음 (Reference-less): 예시를 전혀 받지 않고 이미지에서 가장 흔한 객체를 세라고 했을 때도, CoDi는 기존의 최선책들을 10% 상회하는 성능을 보였습니다.
  • 다중 클래스 도전 (The Multi-Class Challenge): 사과, 오렌지, 바나나가 한데 섞여 있을 수 있는 MCAC 데이터셋에서 CoDi는 경쟁자들을 압도하며 무려 **38%**라는 엄청난 차이로 기존 최고 방식을 격파했습니다.

이것이 중요한 이유

이 논문은 거대한 군중을 세기 위해 반드시 방대한 양의 사전 학습된 '포인터'가 필요하다는 생각을 명시적으로 반박합니다. 저자들은 이미지를 타일링(이미지를 조각으로 자르는 것)하는 방식이 속도를 늦추고 오류를 유발하는 투박한 임시방편임을 보여주었습니다. CoDi는 이미지를 잘라낼 필요 없이, 전체를 한 번에 처리하면서도 완벽한 결과를 얻을 수 있음을 증명했습니다.

또한 CoDi가 얼마나 견고한지도 보여주었습니다. 예시가 약간 지저도하거나 객체가 아주 작더라도 Co디는 잘 작동합니다. 실제로 저자들은 CoDi가 매우 안정적이어서, 동일한 이미지를 20번 실행하더라도 카운트 변화가 평균 1% 미만이라는 것을 발견했습니다.

한계와 미래

CoDi가 큰 진전을 이루었지만, 저자들은 어려움을 겪는 부분에 대해서도 솔직하게 밝히고 있습니다. 매우 길고 가는 물체(예: 세워져 있는 책들의 줄)나 객체들이 매우 기묘한 방식으로 겹쳐 있는 경우에 가끔 어려움을 겪습니다. 또한, Co-Di가 객체의 중심을 찾는 데는 뛰어나지만, 아직 객체 전체를 감싸는 상자를 그리지는 못한다는 점도 언급했습니다(물론 이에 대해 연구할 계획이라고 밝혔습니다).

요약하자면, CoDi는 카운팅을 '숫자를 추측하는 것'이 아니라 '노이즈를 청소하는 과정'으로 취급함으로써, 컴퓨터가 인간처럼 군중을 볼 수 있다는 것을 시사합니다. 즉, 군중을 흐릿한 덩어리가 아니라 구별 가능한 개별 존재들의 집합으로 보는 것입니다. 이것은 한 번에 하나의 점씩, 세상을 바라보는 새로운 방식입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →