← 최신 논문
🤖 machine learning

ΔEnergy\Delta \mathrm{Energy}: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

본 논문은 비전-언어 정렬 중 발생하는 에너지 변화에서 영감을 받은 새로운 OOD 점수인 Δ\DeltaEnergy 와 비전-언어 모델의 분포 외 검출 및 일반화를 동시에 향상시켜 기존 방법보다 상당한 성능 향상을 이루는 해당 미세 조정 프레임워크 (EBM) 를 소개합니다.

원저자: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 여행을 많이 한 가이드 (비전 - 언어 모델) 가 있다고 상상해 보세요. 이 가이드는 방대한 책과 사진 도서관을 통해 수천 가지 사물을 인식하는 법을 배웠습니다. 이 가이드는 '골든 리트리버'나 '빨간 스포츠카'처럼 이전에 본 것들을 식별하는 데 매우 뛰어납니다.

그러나 이 가이드가 실제 세계로 나가면 두 가지 까다로운 상황에 직면합니다:

  1. "코스프레" 문제 (공변량 이동): 골든 리트리버를 보지만, 이는 스케치로 그려진 것이거나 비 내리는 날에 찍힌 사진이거나 그림일 수 있습니다. 개는 동일하지만 스타일이 다릅니다. 가이드는 혼란을 겪으며 "이것 역시 개인가?"라고 생각할 수 있습니다.
  2. "외계인" 문제 (의미적 이동): 훈련 도서관에 전혀 없었던 "반짝이는 유니콘"과 같은 완전히 새로운 생물을 봅니다. 가이드는 "그것은 말이다!"라고 자신 있게 추측하는 대신, "이게 무엇인지 모르겠다"고 깨달아야 합니다.

이 논문은 두 가지 문제를 동시에 해결하기 위해 Δ\DeltaEnergy(델타 에너지) 라는 새로운 방법과 EBM이라는 훈련 기법을 소개합니다.

핵심 아이디어: "침묵" 테스트

이 방식이 어떻게 작동하는지 이해하려면, 가이드가 사진을 보고 다양한 레이블에 대해 얼마나 자신 있는지를 외치는 상황을 상상해 보세요.

  • 개 사진이 나오면 "개! (99% 확신) 고양이! (1%) 새! (0.1%)"라고 외칠 수 있습니다.
  • "반짝이는 유니콘"이 나오면 "말! (40%) 고양이! (30%) 개! (20%)"라고 외칠 수 있습니다. 혼란스러워하며 베팅을 여러 곳에 분산시키는 것입니다.

Δ\DeltaEnergy 의 트릭:
연구자들은 가이드에게 이상한 실험을 하도록 요청합니다. "가장 유력한 추측에 대해 완전히 침묵하도록 강요하면 어떻게 될까요?"

가이드의 최상위 추측 (예: "개") 을 가져와서 그 확신을 0 으로 설정합니다. 그런 다음 "좋습니다, 이제 '개'라고 말할 수 없다면 전체 '에너지'(또는 총 확신) 가 얼마나 떨어질까요?"라고 묻습니다.

  • 실제 개 (분포 내): 가이드는 그것이 개라는 것을 매우 확신했습니다. 그 답변을 침묵시키면 가이드는 당황합니다. 총 확신이 급락합니다. 에너지의 "하락"은 매우 큽니다.
  • 외계인/알 수 없는 물체 (분포 외): 가이드는 이미 불확실하여 여러 옵션에 베팅을 분산시켰습니다. 최상위 추측을 침묵시켜도 큰 변화가 없습니다. 왜냐하면 그것은 오직 하나의 답변에만 의존하지 않았기 때문입니다. 에너지의 "하락"은 작습니다.

에너지 변화(Δ\DeltaEnergy) 를 측정함으로써 시스템은 "이상한 스타일의 개"(큰 하락) 와 "완전히 새로운 생물"(작은 하락) 을 쉽게 구별할 수 있습니다.

훈련 업그레이드: EBM(에너지 경계 최대화)

차이를 식별하는 방법을 아는 것은 훌륭하지만, 이 논문은 가이드가 학습하는 동안 이를 더 잘 수행하는 방법도 가르칩니다.

연구자들은 EBM이라는 훈련 규칙을 도입합니다. 가이드가 개 사진 하나를 공부한다고 상상해 보세요.

  1. 가이드는 전체 사진을 봅니다.
  2. 그런 다음 연구자들은 사진의 일부에 "마스크"를 씌웁니다 (개 얼굴이나 배경을 가리는 것처럼) 그리고 가이드에게 다시 보게 합니다.
  3. 목표는 마스크가 있더라도 전체 사진일 때와 동일한 "에너지" 변화를 느끼도록 가이드를 훈련시키는 것입니다.

비유:
친구의 목소리를 인식하는 법을 배우는 것과 같습니다.

  • 기존 방식: 조용한 방에서 그들의 목소리를 완벽하게 암기합니다. 그들이 시끄러운 카페에서 말하면 (공변량 이동), 그들을 알아볼 수 없을 수 있습니다.
  • EBM 방식: 그들이 속삭이거나, 소리치거나, 벽을 통해 말할 때 그들을 인식하는 법을 연습합니다. 완벽한 조건뿐만 아니라 목소리의 핵심을 배우는 것입니다.

훈련 중에 데이터의 "마스킹"되거나 "자른" 버전을 처리하도록 모델을 강요함으로써, 스타일 변화 (비나 스케치 등) 에 강인하면서도 완전히 새로운 것들을 식별할 수 있는 능력을 배우게 됩니다.

결과: 매우 신뢰할 수 있는 가이드

이 논문은 ImageNet(수천 장의 이미지 포함) 과 같은 대규모 데이터셋에서 이를 테스트했습니다.

  • 더 나은 탐지: 새로운 방법은 이전 방법보다 "외계인"(알 수 없는 물체) 을 탐지하는 데 훨씬 뛰어납니다. 일부 테스트에서 오탐지 수를 10%~25% 더 크게 줄였습니다.
  • 더 나은 일반화: 또한 무엇을 잊지 않고 "코스프레" 개 (새로운 스타일의 물체) 를 인식하는 능력도 크게 향상되었습니다.

요약

이 논문은 간단하지만 강력한 아이디어를 제안합니다. 가장 유력한 추측을 침묵시켰을 때 모델의 확신이 얼마나 변하는지 측정하세요.

  • 확신이 급락하면, 이는 새로운 스타일의 알려진 물체일 가능성이 높습니다.
  • 확신이 안정적으로 유지되면, 이는 완전히 새로운 물체일 가능성이 높습니다.

그들은 이 통찰력을 활용하여 모델을 더 강인하게 훈련시켜, 미지의 것을 탐지하는 더 나은 탐정이자 새로운 상황에서 알려진 것을 인식하는 더 나은 일반주의자가 되는 시스템을 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →