← 최신 논문
🤖 machine learning

Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction

본 논문은 비전-언어 모델의 성능 붕괴를 방지하고 클래스 불균형을 견고하게 처리하기 위해, 제로샷 사전 확률(zero-shot priors)에 의해 구동되는 동적 수축(dynamic shrinkage)을 갖춘 폰 미제스-피셔 혼합 모델(Von Mises-Fisher mixture model)을 활용하는 학습이 필요 없는 모델 불가지론적 테스트 시간 변환 방법인 MOON을 제안한다.

원저자: Jiazhen Huang, Zhiming Liu, Changhu Wang, Wei Ju, Ziyue Qiao, Xiao Luo

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiazhen Huang, Zhiming Liu, Changhu Wang, Wei Ju, Ziyue Qiao, Xiao Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게는 세상의 모든 책을 읽고 인터넷의 모든 사진을 본 초지능 로봇이 있습니다. 이 로봇은 세상을 이해하는 데 천재적이지만, 특정하고 까다로운 상황에 대해서는 아직 테스트를 받아본 적이 없습니다. 이것이 바로 **시각-언어 모델(Vision-Language Models, VLMs)**의 세계입니다. 이들은 사진을 보고 설명하거나, 문장을 읽고 장면을 상상할 수 있는 AI 시스템입니다. 이들은 믿기지 않을 정도로 강력하지만, 보통 거대하고 완벽하게 균형 잡힌 연습 예시가 주어졌을 때 가장 잘 작동합니다.

하지만 현실 세계는 무질서합니다. 예를 들어, 당신이 로봇에게 사진 더미를 분류하라고 주었는데, 그 더미가 이상하다고 가정해 봅시다. 사진의 99%는 고양이 사진이고, 단 한 장만이 강아지 사진인 식이죠. 또는 사진들이 보는 동안 계속 변해서, 자동차만 길게 이어지다가 갑한 사이에 새들이 쏟아져 나올 수도 있습니다. 이를 **클래스 불균형(class imbalance)**이라고 부릅니다. 로봇이 이러한 불균형하고 무질서한 데이터 더미로부터 실시간으로 학습하려고 할 때(이를 **테스트 타임 트랜스덕션(test-time transduction)**이라 합니다), 로봇은 종종 혼란에 빠집니다. 너무 많은 것을 보았기 때문에 모든 것을 고양이라고 생각하기 시작하거나, 드문 강아지 사진을 보는 것이 두려워 정답을 맞히기를 거부할 수도 있습니다. 과학자들의 큰 질문은 이것입니다. 어떻게 하면 이 로봇들을 처음부터 다시 훈련시키지 않고도, 데이터가 불균형하고 혼란스러운 상황에서도 침착함과 정확성을 유지하도록 가르칠 수 있을까?

여기서 황지전(Jiazhen Huang) 연구팀이 제안한 새로운 방법인 MOON이 등장합니다. MOON을 우리 로봇의 뇌를 위한 매우 현명하고 신중한 사서라고 생각해 보세요. 로봇이 새로운 사진 묶음을 분류하려고 할 때, 로봇은 대개 이전에 배웠던 지식을 바탕으로 빠르게 추측합니다("제로샷" 추측). 하지만 어떤 항목은 매우 희귀하고 어떤 항목은 흔한 무질서한 더미 속에서, 로봇의 빠른 추측은 소음이 심하고 신뢰할 수 없을 수 있습니다.

MOON은 **동적 수축(Dynamic Shrinkage)**이라는 영리한 기술을 사용하여 개입합니다. 로봇이 붐비는 방 안에서 친구들의 중심점을 찾으려고 노력하고 있다고 상상해 보세요. 그룹이 크고 명확하다면, 로봇은 자신의 눈을 완전히 신뢰할 것입니다. 하지만 그룹이 아주 작거나, 방 안에 친구들과 전혀 닮지 않은 낯선 사람들로 가득 차 있다면, 로봇은 불안해질 것입니다. MOON은 로봇에게 이렇게 말합니다. "이봐, 확신이 없다면 네 떨리는 추측을 너무 믿지 마. 네 답을 안전하고 신뢰할 수 있는 기존 지식 쪽으로 더 가까이 끌어당겨."

MOON의 마법은 얼마나 많이 뒤로 물러날지에 대해 고정된 규칙을 사용하지 않는다는 점에 있습니다. 대신, MOON은 동적으로 조정합니다.

  • 개별 수준에서: 만약 로봇이 사진을 보고 매우 혼란스러워한다면(높은 "엔트로피"), MOON은 "그 추측은 무시해; 너무 노이즈가 심해"라고 말합니다.
  • 그룹 수준에서: 만약 로봇이 더미에서 거의 나타나지 않는 카테고리의 항목(예: 고양이 바다 속에 있는 단 한 마리의 강아지)을 본다면, MOON은 "그 희귀한 항목 때문에 네 전체 이해가 바뀌도록 내버려 두지 마. 네가 훈련을 통해 배운 강아지에 대한 지식을 고수해"라고 말합니다.

연구진은 꽃, 자동차, 장면, 질감 등 다양한 11개의 데이터셋을 통해 이를 테스트했습니다. 그들은 다른 방법들이 데이터가 불균형할 때 종종 무너지거나 형편없는 성능을 보이는 반면, MOON은 안정적으로 유지된다는 것을 발견했습니다. 실제로, 거대한 ImageNet 데이터셋에서 MOON은 10가지 시나리오에 걸쳐 로봇의 정확도를 13.2% 향상시켰으며, 이전의 최고 방법들을 큰 차이로 앞질렀습니다. 이는 추가적인 학습 데이터나 복잡한 튜닝 없이 수행되었으며, 수천 개의 샘플을 단 몇 밀리초 만에 처리할 정도로 매우 빨랐습니다.

논문은 모든 데이터를 마치 완벽하게 균형 잡힌 것처럼 취급하거나, 실수를 바로잡기 위해 단일한 정적 규칙을 사용할 수 있다는 생각에 명시적으로 반대합니다. 연구진은 이러한 "앵커링(anchoring)" 메커니즘(뒤로 물러날 안전한 기준점)이 없는 방법들은 노이즈가 심한 국소 데이터에 과적합되어 붕괴하는 경향이 있음을 보여줍니다. 또한, 앵커를 사용하는 방법이라 할지라도 클래스의 희귀성이나 흔함에 따라 변하지 않는 "정적"인 강도를 사용하기 때문에 실패하는 경우가 많음을 보여줍니다. MOON은 이 수축 강도를 로봇이 실제로 가진 증거에 따라 실시간으로 변하는 동적인 것으로 만듦으로써 이를 해결합니다.

요약하자면, 저자들은 로봇의 지식을 구형 위의 점들로 모델링하고(Von Mises-Fisher mixture 사용), 필요할 때만 안전한 앵커 쪽으로 추측을 부드럽게 끌어당김으로써, 이 강력한 AI 시스템을 실제의 무질서한 세상에서 훨씬 더 견고하게 만들 수 있다고 제안합니다. 그들은 광범-한 실험을 통해 MOON이 단순한 이론적 아이디어가 아니라, 다양한 유형의 이미지와 AI 모델에 걸쳐 작동하는 실용적이고 효율적인 도구임을 입증했습니다. 이는 때때로 AI가 할 수 있는 가장 똑똑한 일은 자신의 직감을 믿어야 할 때와 노트를 다시 확인해야 할 때를 아는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →