← 최신 논문
🤖 machine learning

Contrastive Order Learning: A General Framework for Ordinal Regression

이 논문은 전역적 배치 단위 샘플 활용과 소프트 어피니티(soft affinity) 및 디스패리티티(disparity) 가중치를 통한 미세한 서열 모델링을 통합하여 얼굴 연령 및 품질 평가와 같은 다양한 작업에서 최첨단 성능을 달i는 새로운 서열 회귀용 대조 학습 프레임워크인 ConOrd를 제안한다.

원저자: Chaewon Lee, BeomJun Shim, Kwang Pyo Choi, Chang-Su Kim

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chaewon Lee, BeomJun Shim, Kwang Pyo Choi, Chang-Su Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 단순히 사물을 상자(예: "고양이" 또는 "개")로 분류하는 법이 아니라, 사물의 '스펙트럼'을 이해하도록 가르치려 한다고 상상해 보세요. 나이를 생각해 봅시다. 10살은 12살과는 가깝지만, 60살과는 멀리 떨어져 있습니다. 또는 사진의 품질을 판단하는 경우를 생각해 보세요. 약간 흐릿한 사진은 선명한 사진보다 "나쁘지만", 완전히 검은 화면보다는 "낫습니다". 이것을 **서수 회귀(ordinal regression)**라고 부릅니다. 즉, 순위와 그 사이의 거리를 학습하는 것입니다.

오랫동안 AI 연구자들은 이를 가르치기 위해 두 가지 주요 방법을 시도해 왔으며, 두 방법 모두 논리적인 결함이 있었습니다.

과거의 방식들: "전부 아니면 전무" 그리고 "단호한 경계선"

첫 번째는 **지도 대조 학습(Supervised Contrastive Learning)**이었습니다. 선생님이 학생에게 24세의 사진을 보여주며 이렇게 말한다고 상상해 보세요. "이 사람은 24세다. 그 외의 모든 사람은 24세가 아니다." 학생은 24세의 사진을 다른 모든 사람으로부터 밀어내도록 배웁니다. 하지만 여기에 문제가 있습니다. 학생은 24세와 매우 유사한 25세와, 24세와 전혀 다른 75세를 똑같이 취급합니다. 선생님은 24세와 25세는 이웃인 반면, 24세와 75세는 낯선 사이라는 사실을 무시합니다.

그 후 더 발전된 방식인 **RnC (Rank-N-Contrast)**가 등장했습니다. 이 선생님은 더 똑똑했습니다. 그들은 이렇게 말했습니다. "좋아, 24세가 기준점(anchor)이다. 25세는 '양성(positive)' 친구다. 하지만 25세보다 나이가 많은 사람은? 그들은 모두 '음성(negative)' 적이다." 선생님은 모래 위에 단호한 선을 긋습니다. 만약 당신이 25세보다 많다면, 당신은 적입니다. 하지만 기다려 보세요. 이 선생님은 26세와 100세를 똑같이 취급합니다. 두 사람 모두 똑같은 힘으로 밀려나게 됩니다. 선생님은 100세가 26세보다 훨씬 더 멀리 있다는 사실, 즉 그 거리가 중요하다는 점을 잊어버렸습니다.

새로운 영웅: ConOrd (Contrastive Order Learning)

드디어, Chaewon Lee와 그 팀이 제안한 새로운 프레임워크인 ConOrd가 등장했습니다. 그들은 진정으로 순서를 이해하려면 단호한 선이나 거리를 무시하는 방식이 아니라, 얼마나 떨어져 있는지에 대한 부드럽고 모호한(fuzzy) 이해가 필요하다는 것을 깨달았습니다.

새로운 선생님이 특수한 자석을 사용하는 모습을 상상해 보세요.

  • 부드러운 자석: 로봇이 24세의 사람을 볼 때, 단순히 다른 모든 사람을 밀어내는 것이 아닙니다. 25세를 보고는 "너는 가까우니까 아주 조금만 더 끌어당길게"라고 말합니다. 30세를 보고는 "너는 조금 더 멀구나, 그러니 조금 덜 끌어당길게"라고 합니다.
  • 척력(Repulsion): 이제 75세를 봅시다. 선생님은 말합니다. "너는 정말 멀리 있구나! 나는 너를 정말 세게 밀어내야겠어."

이것이 ConOrd의 마법입니다. 이 방식은 '친구냐 적이냐'라는 이분법적인 목록 대신, 기준점으로부터의 순위 차이에 따라 모든 샘플에 **부드러운 가중치(soft weight)**를 부여합니다.

  • 간격이 작으면? 완만한 인력.
  • 간격이 중간이면? 적당한 척력.
  • 간격이 크면? 강력한 척력.

ConOrd는 이전의 방식들이 이러한 간격을 "전부 아니면 전무"식으로 취급했기 때문에 실패했다고 주장합니다. ConOrd는 모든 샘플이 실제 순위 차이에 부합하는 강도로 학습에 기여할 수 있도록 하여, 이 문제를 해결합니다. 이는 마치 근처 스테이션의 신호는 매우 또렷하게 들리면서도, 멀리 떨어진 스테이션의 잡음까지도 들을 수 있는 라디오를 튜닝하는 것과 같습니다.

성공했을까요? 증거는 결과물에 있습니다

팀은 단순히 추측만 한 것이 아니라, 순서가 중요한 실제 문제들을 통해 테스트했습니다. 그들은 다음의 실험을 수행했습니다:

  • 나이 예측: MORPH II와 CLAP2015 세트를 포함한 6개의 서로 다른 데이터셋에서 테스트했습니다. CLAP2015 데이터셋에서 그들의 방식은 평균 절대 오차(MAE) 2.46을 기록하며, 이전의 최고 방식인 NumCLIP(2.55)과 OrdinalCLIP(3.20)을 앞질렀습니다. ConOrd는 MAE 지표에서 CACD를 제외한 모든 데이터셋에서 최고의 성능을 보이며, 다양한 연령 추정 벤치마크에서 강력한 일반화 능력을 입증했습니다.
  • 사진 품질 판단: 5개의 블라인드 이미지 품질 데이터셋을 테스트했습니다. BID 데이터셋에서 ConOrd는 스피어먼 상관 계수(SRCC) 0.913과 피어슨 선형 상관 계수(PCC) 0.925를 기록하며, QCN이나 VISGA와 같은 복잡한 방식을 포함한 모든 기존 방법들을 능가했습니다.
  • 비디오 품질 판단: LSVQ 및 KoNViD-1k와 같은 비디오 데이터셋을 테스트했습니다. LSVQ-TEST 세트에서 ConOrd는 SRCC 0.904, PCC 0.904를 달성하며 다시 한번 경쟁자들을 제쳤습니다.

저자들은 변수를 통제했기 때문에 이러한 결과에 자신감을 가집니다. 그들은 비교된 모든 방식에 대해 정확히 동일한 "두뇌"(ViT-B 인코더)를 사용했습니다. 이는 승리가 더 화려한 컴퓨터를 사용했기 때문이 아니라, 그들의 "부드러운 자석" 교수법이 단순히 더 뛰어났기 때문임을 의미합니다.

그들이 배제한 것들

논문은 누가 "양성"이고 누가 "음성"인지에 대해 단호한 결정을 내릴 필요가 있다는 생각에 명시적으로 반대합니다. 그들은 단호한 임계값(예: RnC)에 의존하거나 순위 거리를 무시하는(표준 대조 학습) 방식이 성능을 저하시킨다는 것을 보여주었습니다. 또한, 단순한 수학적 트릭(양의 로그)을 사용한 "나이브(naive)" 버전의 아이디어를 테스트했으나, 그것이 학습을 불안정하고 덜 신뢰할 수 있게 만든다는 것을 발견하여, 그 대신 그들만의 특정 "부드러운 가중치" 공식을 채택했습니다.

결론

ConOrd는 순위 차이를 단순한 카테고리 목록이 아닌 부드럽고 연속적인 척도로 다룸으로써, AI가 세상의 미묘한 차이를 더 잘 이해하도록 만들 수 있음을 시사합니다. 이는 단순히 순서를 아는 것이 아니라, 그들이 얼마나 떨어져 있는지를 아는 것에 관한 것입니다. 실험 결과는 이 접근 방식이 일관되게 최첨단 성능(state-of-the-art)을 이끌어내며, 사람의 나이를 추정하는 것부터 비디오 품질을 판단하는 것에 이르기까지 폭넓은 작업에 강력한 도구가 될 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →