← 최신 논문
🤖 machine learning

Neutral-Reference Prompting for Vision-Language Models

본 논문은 모델 파라미터를 수정하지 않고 중립적 텍스트 프롬프트와 참조 이미지를 활용하여 미시적 클래스에서 발생하는 비대칭적이고 사전 지식이 지배적인 오분류를 식별하고 수정함으로써 비전 - 언어 모델의 베이스 - 신규 트레이드오프를 완화하는 플러그 앤 플레이 프롬프트 수정 전략인 NeRP 를 제안합니다.

원저자: Senmao Tian, Xiang Wei, Shunli Zhang

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Senmao Tian, Xiang Wei, Shunli Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수백만 권의 책과 수백만 장의 사진을 읽고 본 매우 똑똑하고 여행 경험이 풍부한 사서 (시각 - 언어 모델) 가 있다고 가정해 봅시다. 이 사서는 '사과'나 '자동차'처럼 이전에 본 것들을 인식하는 데 뛰어납니다. 하지만 약간 새로운 것이나 다른 각도에서 보여 주면 때때로 혼란을 겪습니다.

이 논문은 구체적인 문제를 지적합니다: 기존 - 새로운 것 간의 트레이드오프 (Base–New Trade-off).
이렇게 생각해 보세요. 이 사서에게 몇 가지 새로운 기술 (예: 특정 희귀 꽃의 종류를 인식하는 것) 을 가르치려 하면, 종종 새로운 기술에 너무 집중하여 이미 완벽하게 알고 있던 일반적인 것들을 식별하는 방법을 잊기 시작합니다. 이는 '패배 - 패배' 상황입니다.

숨겨진 문제: 일방향 혼란

저자들은 특이한 현상을 발견했습니다. 보통 모델이 두 가지 (예: '개'와 '늑대') 사이에서 혼란을 겪을 때, 둘을 동등하게 혼동합니다. 하지만 종종 혼란은 일방향입니다.

  • 대칭적 혼란: 모델이 개를 늑대로 오인하는 경우가 50% 이고, 늑대를 개로 오인하는 경우도 50% 입니다. 단순히 구별하기 어려울 뿐입니다.
  • 비대칭적 혼란 (논문의 발견): 모델은 '늑대'를 항상 '개'로 오인하지만, '개'를 '늑대'로 오인하는 경우는 거의 없습니다.

왜일까요? 사서의 초기 훈련 (사전 훈련) 동안 개에 대한 사진이 늑대보다 훨씬 더 많이 노출되었거나, 개에 대한 텍스트 설명이 더 흔했기 때문입니다. 이는 사서의 뇌에 숨겨진 '편향'이나 기본 설정을 만들었습니다. 늑대를 볼 때, 사서의 뇌는 그것이 개일 가능성이 높다고 외칩니다. 왜냐하면 그것이 가장 저항이 적은 경로이기 때문입니다.

해결책: NeRP (중립 참조 프롬프팅)

저자들은 NeRP라는 해결책을 만들었습니다. 이는 사서의 기억을 실제로 다시 쓰거나 재훈련시키지 않고도 사서의 뇌에 부착할 수 있는 '플러그 앤 플레이' 도구와 같습니다.

간단한 비유를 들어 NeRP 가 어떻게 작동하는지 살펴보겠습니다.

1. '중립 참조' (백지 상태)
일반적인 '사물' 사진과 단순히 '무언가의 사진'이라고만 적힌 문장이 있다고 상상해 보세요. 이는 특정 동물이나 물건을 설명하지 않습니다.

  • 저자들은 이 '빈' 이미지와 텍스트를 사용하여 사서에게 질문합니다: "구체적인 것을 보여 주지 않는다면, 당신은 자연스럽게 어떤 범주로 기울어집니까?"
  • 이는 사서의 숨겨진 편향을 드러냅니다. 사서가 구체적인 증거가 없음에도 불구하고 '개' 쪽으로 크게 기울다면, NeRP 는 '아, 이 사서는 개에 대한 강한 편향을 가지고 있구나'라고 알게 됩니다.

2. '증거 확인'
이제 사서에게 늑대 사진을 보여 주세요.

  • 증거: 사진은 늑대처럼 보이지만 100% 명확하지는 않을 수 있습니다.
  • 편향: 사서의 뇌는 그 숨겨진 편향 때문에 '개!'라고 외칩니다.
  • 갈등: 증거 (사진) 는 약하지만 편향 (기본 설정) 은 강력합니다.

3. '국소 반전'
NeRP 는 현명한 심판처럼 행동합니다. 사서가 실제 사진이 아니라 주로 편향에 기반하여 결정을 내리고 있음을 알아차립니다.

  • 사서가 '개'라고 말하지만 증거는 약하고, NeRP 가 사서가 '개' 쪽으로 편향되어 있음을 알고 있다면, NeRP 는 개입하여 "잠깐, 당신은 지나치게 자신감이 넘칩니다. 다른 가능성 있는 옵션 (늑대) 으로 뒤집어 보자"라고 말합니다.
  • 이는 사서가 명확하게 게으름을 피워 새로운 증거를 보지 않고 옛 습관에 의존할 때만 수행됩니다.

이것이 중요한 이유

  • 재훈련 불필요: 사서에게 새로운 수업을 가르칠 필요가 없습니다. 단순히 불확실할 때 사용할 새로운 '체크리스트 (NeRP)'를 제공하면 됩니다.
  • 기존 기술 보존: 새로운 것을 가르치려다 실수로 사서가 기존 것을 잊게 만드는 다른 방법들과 달리, NeRP 는 기존에 완벽했던 점수를 해치지 않으면서 새로운 실수를 수정합니다.
  • 어디서나 작동: 이 논문은 꽃에서 자동차, 위성 이미지까지 15 가지 다른 유형의 작업에서 이를 테스트했으며, 매번 완벽하게 작동했습니다.

요약

논문의 결론은 다음과 같습니다: "시각 - 언어 모델은 종종 A 클래스를 B 클래스로 오인하지만 그 반대는 아닌 일방향 편향을 가집니다. 이는 원래 훈련 방식 때문입니다. 우리는 '편향 감지기'처럼 작동하는 NeRP라는 도구를 만들었습니다. 이 도구는 모델이 약한 추측이나 강한 습관에 기반하여 결정을 내리는지 확인합니다. 만약 그것이 단순한 습관이라면, NeRP 는 답변을 부드럽게 수정합니다. 이를 통해 모델은 기존 것을 잊지 않으면서 새로운 것을 훨씬 더 잘 인식하게 됩니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →