← 최신 논문
💻 computer science

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

본 논문은 잘못된 레이블을 가진 샘플로부터의 극단적인 업데이트를 자연스럽게 필터링함으로써 라벨 노이즈에 대해 Vision-Language 모델을 강건하게 적응시키는 내재적 기울기 억제를 순차적 확률 정규화를 통해 활용하는 하이퍼파라미터가 없는 Double-Softmax 프롬프트 튜닝 (DSPT) 방법을 제안한다.

원저자: Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

게시일 2026-05-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"시각-언어 모델의 라벨 노이즈 프롬프트 튜닝을 위한 내재적 기울기 억제"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 제시합니다.

큰 그림: 나쁜 교과서로 가르치는 똑똑한 학생

당신에게 CLIP이라는 이름의 뛰어난 학생이 있다고 상상해 보세요. 이 학생은 이미 수백만 권의 책을 읽고 수백만 장의 그림을 보았기 때문에 세상에 대해 이미 많은 것을 알고 있습니다. 만약 이 학생에게 자동차 사진을 보여주고 "이건 자동차인가, 개인가?"라고 물으면, 기존 지식을 활용하여 보통은 정확하게 추측할 수 있습니다 (이를 Zero-Shot 학습이라고 합니다).

하지만 때로는 이 학생에게 매우 구체적인 빈티지 자동차 종류를 인식하는 것과 같은 새로운 기술을 가르치고 싶을 때가 있습니다. 이를 위해 모든 것을 다시 가르치는 것이 아니라, 집중할 수 있도록 몇 가지 "힌트 단어" (Prompts) 만 주어줍니다. 이 과정을 프롬프트 튜닝 (Prompt Tuning) 이라고 합니다.

문제: 나쁜 교과서
보통은 모든 그림에 올바른 라벨이 있는 교과서로 학생을 가르칩니다. 하지만 이 논문에서는 교과서가 오타와 거짓말 (라벨 노이즈) 로 가득 찬 상황을 가정합니다.

  • 상황: 당신은 학생에게 자동차 사진을 보여주지만, 교과서에는 "이건 입니다"라고 적혀 있습니다.
  • 반응: 학생이 매우 똑똑하기 때문에 즉시 "잠깐, 이건 확실히 개가 아니라 자동차야!"라고 알게 됩니다. 그들은 자신의 지식에 매우 확신을 갖습니다.
  • 재앙: 표준적인 교수법에서는 학생이 확신하지만 교사가 틀렸다고 강요할 때, 학생은 거대한 "징계" (거대한 수학적 기울기) 를 받습니다. 학생은 "교사가 이렇게 확신하니 내가 틀렸나 보다"라고 생각하며, 거짓말에 맞추기 위해 자신이 알고 있는 것을 필사적으로 잊으려 합니다.
  • 결과: 학생은 혼란을 겪고 원래 지식을 잊어버려, 아무런 도움 없이 그냥 추측했을 때보다 더 나쁜 성능을 보이게 됩니다.

해결책: "더블-소프트맥스" 필터

저자들은 더블-소프트맥스 프롬프트 튜닝 (DSPT) 이라는 새로운 교수법을 제안합니다. 그들은 학생 (CLIP) 이 이미 똑똑하므로 신중하게 접근해야 한다고 주장합니다. 교사의 실수가 학생의 생각을 너무 빨리 바꾸게 해서는 안 됩니다.

다음은 비유를 통해 설명한 그들의 방법입니다:

1. "이중 확인" (필터)
학생이 손을 들어 답을 말한다고 상상해 보세요.

  • 표준 방법: 교사는 답을 보고 교과서와 맞지 않음을 확인하자마자 책상 위에 거대한 망치를 내리칩니다 (거대한 기울기).
  • DSPT 방법: 교사가 망치를 내리기 전에, 답은 더블-소프트맥스 필터를 통과합니다. 이는 교사의 피드백을 위한 특수한 노이즈 캔슬링 헤드폰과 같습니다.

2. 필터의 작동 방식

  • 거짓말쟁이에게 (노이즈가 있는 샘플): 학생이 100% 자동차라고 확신하는데 교과서가 "개"라고 할 때, 필터는 "이건 엄청난 불일치야"라고 인식합니다. 교수가 학생에게 소리치는 것을 허용하는 대신, 필터는 교수의 목소리를 음소거합니다. 거대한 징계를 거의 제로 수준으로 줄입니다. 학생은 거짓말을 무시하고 원래 지식을 유지합니다.
  • 진실한 사람에게 (깨끗한 샘플): 학생이 불확실할 때 (아마도 흐릿한 자동차일 수 있음) 교과서가 "자동차"라고 할 때, 필터는 교수의 목소리를 부드럽게 통과시킵니다. 이는 학생이 압도당하지 않으면서 유용한 새로운 세부 사항을 학습할 수 있게 합니다.

3. "포화 영역"
이 논문은 이를 "자기 적응형 포화 영역"이라고 부릅니다. 자동차의 쇼크 업소버와 같다고 생각하세요.

  • 작은 요철 (작은 학습 기회) 을 만나면 차는 부드럽게 주행합니다.
  • 거대한 구덩이 (노이즈 라벨에서 비롯된 거대한 오차) 를 만나면 쇼크 업소버가 너무 강하게 압축되어 차가 격렬하게 튀지 않습니다. 이는 충격이 차 (모델) 가 추락하지 않도록 흡수합니다.

이것이 특별한 이유

다른 대부분의 방법들은 복잡한 규칙을 추가하거나 학생을 얼마나 징계할지 결정하기 위해 인간이 많은 노브 (하이퍼파라미터) 를 조정하도록 합니다.

  • 논문의 주장: 그들의 방법은 자동입니다. 돌릴 노브가 필요 없습니다. 그들이 사용한 수학 (더블-소프트맥스) 때문에 자연스럽게 발생합니다.
  • 결과: 실험에서 이 간단한 방법은 교과서가 80% 틀렸을 때도 학생이 잘 수행하도록 유지했습니다. 다른 방법들은 학생이 맹목적으로 추측했을 때보다 더 나쁜 성능을 보이게 만들었습니다.

비유의 요약

  • CLIP 모델: 강한 기억력을 가진 똑똑한 학생.
  • 라벨 노이즈: 무작위이고 틀린 답이 가득한 교과서.
  • 표준 학습: 학생이 잘못된 답에 겁을 먹고 모든 것을 잊어 성능이 저하됨.
  • DSPT (더블-소프트맥스): "학생이 맞고 책은 틀렸다"고 인식하여 책의 나쁜 조언을 침묵시키고, 학생이 좋은 조언에서만 학습하도록 허용하는 똑똑한 필터.

저자들은 일반적으로 나쁜 것으로 간주되는 문제 ("기울기 소실" 또는 신호가 너무 약해지는 것) 를 특징으로 바꾸어 모델이 거짓말을 학습하는 것을 막는 방패를 만들었음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →