← 최신 논문
💻 computer science

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

HANCHLIP은 쌍곡 기하학과 각도 삼중항 목적 함수를 활용하여 컴팩트한 학습 프레임워크 내에서 부정(negation)을 명시적으로 인코딩함으로써, 대규모 재학습 없이도 표준 작업의 성능을 유지하면서 NegBench와 같은 벤치마크에서 부정 민감도를 크게 향상시키는 비전-언어 모델 제품군을 소개한다.

원저자: Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

게시일 2026-06-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수백만 권의 책을 읽고 수백만 장의 사진을 본 매우 똑똑한 사서(시각-언어 모델, Vision-Language Model)가 있다고 상상해 보세요. 이 사서는 "고양이"라는 사진을 "고양이"라는 단어와 매칭하는 데는 아주 능숙합니다. 하지만 이 사서에게는 재미있는 약점이 하나 있습니다. 바로 **"아니오(not)"**라는 단어를 어려워한다는 점입니다.

만약 당신이 고양이 사진을 보여주며 "이것은 개가 아닌가요?"라고 묻는다면, 사서는 혼란에 빠집니다. 사서는 패턴을 암기하며 학습했기 때문에, "개"라는 단어와 고양이 사진을 보면, 비록 문장은 두 대상이 서로 반대임을 말하고 있음에도 불구하고, "아, 이 두 가지는 내 학습 데이터에서 자주 함께 등장했지"라며 뇌가 반응해 버립니다. 즉, 논리를 진정으로 이해하기보다는 단어 매칭에 의존하는 것입니다.

이 논문은 이를 해결하기 위해 HANCLIP이라는 새로운 시스템을 소개합니다. 이것이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 문제점: "평면적인" 지도

사서의 뇌를 거대한 평면 지도(유클리드 공간)라고 생각해 보세요. 이 지도 위에서 모든 것은 그저 하나의 점일 뿐입니다.

  • "고양이"라는 점은 "새끼 고양이"라는 점과 가깝습니다.
  • "개"라는 점은 멀리 떨어져 있습니다.
  • 하지만 사서가 "개가 아닌 것"이라는 문구를 보면, 그 점을 어디에 두어야 할지 모릅니다. "개"로부터는 너무 멀지만, 그렇다고 "고양이"와 완전히 같지도 않습니다. 평면 지도는 엉망이 되고, 사서는 잘못된 추측을 하게 됩니다.

2. 해결책: "나무" 지도 (쌍곡 공간)

저자들은 사서의 뇌를 나무 모양의 지도(쌍곡 공간, Hyperbolic space)로 옮길 것을 제안합니다.

  • 나무의 중심(줄기)을 상상해 보세요. 중심에 가까울수록 "동물"처럼 더 일반적인 개념입니다. 가지와 잎으로 나아갈수록 "고양이", "개", "개가 아닌 것"처럼 더 구체적인 개념이 됩니다.
  • 이 나무 세상에서 "고양이"와 "개가 아닌 것"은 서로 연관된 개념이기 때문에 같은 가지 위에 놓일 수 있지만, "개"는 완전히 다른 가지에 위치합니다.
  • 이를 통해 모델은 "이미지가 무엇인가"와 "이미지가 무엇이 아닌가"가 단순히 평면 바닥 위의 무작위 점들이 아니라, 동일한 나무의 서로 다른 가지라는 것을 이해할 수 있게 됩니다.

3. "각도" 기술 (각도 삼중항 부정 손실, Angular Triplet Negation Loss)

이 시스템은 **각도 삼중항(Angular Triplet)**이라는 두 번째 기술을 사용합니다. 방 안에 세 사람이 서 있다고 상상해 보세요.

  1. 부정 앵커 (N): "개"라고 적힌 표지판을 들고 있는 사람.
  2. 긍정 (P): "고양이"라고 적힌 표지판을 들고 있는 사람.
  3. 부정된 긍정 (P'): "개가 아닌 것"이라고 적힌 표지판을 들고 있는 사람.

시스템은 이들 사이의 각도를 관찰하도록 모델을 가르칩니다.

  • 정렬(Alignment): "개"를 들고 있는 사람의 관점에서 볼 때, "고양이"를 든 사람과 "개가 아닌 것"을 든 사람은 대략 같은 방향을 향하고 있어야 합니다. 둘 다 "개가 아닌 것"이기 때문입니다.
  • 분리(Separation): 그러나 "고양이"를 든 사람과 "개가 아닌 것"을 든 사람은 서로 혼동되지 않도록 충분히 떨어져 있어야 합니다.

이러러한 각도를 조정함으로써, 모델은 "개가 아닌 것"이 "고양이"와 유사한 방향을 가리키면서도(둘 다 개가 아니므로), 동시에 실수하지 않도록 서로를 별개의 존재로 유지하는 법을 배웁니다.

4. 결과: 스마트하고 효율적인 업그레이드

저자들은 사서의 뇌를 처음부터 다시 만들 필요가 없었습니다. 대신, 보통 필요한 수백만 개의 데이터에 비하면 아주 작은 양인 20,000개의 예시만을 사용하여 집중적인 학습을 진행했습니다.

그들은 이 새로운 "HANCLIP" 시스템을 네 가지 기존 모델(CLIP, LongCLIP, SmartCLIP, HiMo-CLIP)에 적용하여 테스트했습니다. 결과는 다음과 같습니다.

  • 더 나은 논리력: 모델들은 "not"이 포함된 질문(예: "어떤 이미지가 자동차를 포함하고 있지 않나요?")에 훨씬 더 잘 답하게 되었습니다.
  • 기억 상실 없음: 결정적으로, 모델들은 기존의 업무를 수행하는 법을 잊어버리지 않았습니다. 단순한 묘사를 바탕으로 사진을 찾거나 이미지를 분류하는 작업에서도 여전히 뛰어난 성능을 보였습니다.
  • 효율성: 이들은 방대한 양의 새로운 데이터나 전체 시스템의 재학습 없이도 이러한 개선을 이루어냈습니다.

요약하자면: HANCLIP은 AI 모델에게 더 나은 "정신적 지도"와 기하학적 규칙을 부여하여, 어떤 것이 무엇이 아닌지를 추론할 수 있게 함으로써, 원래 가지고 있던 "무엇인지" 이해하는 능력을 잃지 않으면서도 "아니오(NOT)"의 개념을 이해할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →