← 최신 논문
💻 computer science

Improving Adversarial Robustness of Zero-Shot CLIP with Confidence-Aware Weighting

본 논문은 신뢰도 기반 가중치 부여(Confidence-Aware Weighting, CAW)를 제안하는데, 이는 신뢰도 기반 손실을 통해 불확실한 샘플을 우선시하고 특징 정렬을 통해 의미론적 일관성을 보존함으로써 제로샷 CLIP 모델의 적대적 강건성을 향상시키며, 이를 통해 강건성과 메모리 효율성 측면 모두에서 최첨단 방식들을 능가하는 새로운 방법이다.

원저자: Nikoo Naghavian, Mostafa Tavassolipour

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nikoo Naghavian, Mostafa Tavassolipour

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 글을 읽는 동시에 이미지를 "볼" 수 있고, 인터넷 전체를 학습하여 골든 레트리버 사진이 "행복한 강아지"라는 단어와 일치한다는 것을 이해하는 세상을 상상해 보십시오. 이것은 유명한 CLIP과 같은 시각-언어 모델(Vision-Language Models)의 마법입니다. 이들은 온라인상의 모든 책을 읽고 모든 사진을 본 아주 똑똑한 학생과 같아서, 특정 종류의 동물을 본 적이 없더라도 사진 속에 무엇이 있는지 추측할 수 있습니다. 하지만 인간이 교묘한 착시 현상에 속을 수 있는 것처럼, 이 AI 모델들에게도 비밀스러운 약점이 있습니다. 만약 이미지에 인간의 눈에는 보이지 않는 미세하고 투명한 양의 "노이즈(noise)"를 추가한다면—마치 디지털 모래 몇 알갱이를 뿌리는 것처럼—컴퓨터는 갑자기 완전히 혼란에 빠져 고양이를 토스터기로 착각할 수 있습니다. 이것을 "적대적 공격(adversarial attack)"이라고 부르며, 이는 이러한 강력한 도구들이 실제 상황에서 쉽게 속을 수 있다는 점에서 큰 문제가 됩니다.

과학자들이 던지는 핵심 질문은 이것입니다: 모델이 이미 알고 있는 것을 잊어버리지 않으면서 어떻게 하면 이 모델들을 더 강하게 만들 수 있을까? 보통 컴퓨터에게 강인함을 가르치기 위해서는 훈련 과정에서 수천 개의 이러한 까다롭고 노이즈가 섞인 이미지들을 보여주어야 합니다. 하지만 여기에는 함정이 있습니다. 만약 모든 이미지를 똑같은 방식으로 다룬다면, 컴퓨터는 이미 이해하고 있는 쉬운 문제들을 공부하는 데 시간을 낭비하게 되고, 정작 도움이 가장 필요한 정말 까다로운 문제들은 놓칠 수도 있습니다. 이는 마치 선생님이 학생이 이미 완벽하게 풀어낸 수학 문제를 복습하는 데 수업 시간 전체를 쓰면서, 정작 학생을 시험에서 낙제하게 만드는 진짜 어려운 문제는 무시하는 것과 같습니다.

이 논문은 이 문제를 해결하기 위해 **신뢰도 기반 가중치 부여(Confidence-Aware Weighting, CAW)**라는 영리한 새로운 전략을 소개합니다. 연구진은 모든 까다로운 이미지가 다 똑같지는 않다는 점을 깨달았습니다. 어떤 이미지는 너무 혼란스러워서 모델이 거의 맞히지 못하는 반면, 어떤 이미지는 약간 흔들리기만 할 뿐입니다. 모든 혼란스러운 이미지에 동일한 양의 주의를 기울이는 대신, CAW는 가장 많이 고전하고 있는 학생에게 특별히 더 많은 관심을 기울이는 똑똑한 튜터처럼 행동합니다.

이 방법이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다. AI 모델을 시험을 치르는 학생이라고 상상해 보십시오.

  1. "신뢰도 인식(Confidence-Aware)" 부분: 학생이 문제를 틀리거나 확신이 없을 때, 선생님(CAW 시스템)은 "좋아, 이건 어려운 문제구나! 여기에 집중하자!"라고 말합니다. 모델이 가장 확신이 없는 이미지에 더 많은 가중치를 부여합니다. 만약 모델이 이미 어떤 이미지에 대해 꽤 확신하고 있다면, 선생님은 "너는 이미 잘 알고 있으니 다음으로 넘어가자"라고 말합니다. 이를 통해 모델은 이미 알고 있는 것을 다시 배우는 대신, 자신의 가장 큰 약점을 보완하는 데 에너지를 쓰게 됩니다.
  2. "특징 정렬(Feature Alignment)" 부분: 두 번째 기술은 학생이 이전 수업에서 배운 것을 잊지 않도록 하는 것입니다. 모델이 까다롭고 노이즈가 섞인 이미지를 볼 때, CAW는 모델이 보는 "내부적인 이미지"가 이전에 보았던 "깨끗한 이미지"와 일치하는지 확인합니다. 이는 마치 학생에게 "이 사진이 흐릿하더라도, 이것은 여전히 토스터기가 아니라 강아지라는 것을 기억해라"라고 말하는 것과 같습니다. 이를 통해 모델이 혼란에 빠져 원래의 지식을 잃어버리는 것을 방지합니다.

연구진은 TinyImageNet을 포함하여 반려동물, 꽃, 의료 스캔 등 14개의 다양한 데이터셋을 활용한 방대한 컬렉션에서 이 아이디어를 테스트했습니다. 그들은 자신들의 새로운 방법론을 AutoAttack이라는 강력한 자동화된 테스트를 포함한 가장 강력한 "공격"들과 맞붙게 했습니다. 결과는 유망했습니다: CAW 방식은 단순히 공격에서 살아남았을 뿐만 아니라, 실제로 이전의 최고 기술들보다 더 나은 성능을 보였습니다. 예를 들어, 15개의 서로 다른 데이터셋 전체에 걸쳐 평균적으로, CAW는 차점자(runner-up)와 비교했을 때 공격 상황에서의 정확도를 약 2% 향상시키면서도 컴퓨터 메모리는 더 적게 사용했습니다.

정말 멋진 점은 모델이 공격을 막아내는 것뿐만 아니라, 일반적이고 깨끗한 사진을 보는 능력도 향려되었다는 것입니다. 연구진은 "어려운" 사례들에 집중함으로써 모델이 세상을 보는 더 안정적인 방식을 학습했다는 것을 발견했습니다. 모델이 이미지의 서로 다른 부분에 어떻게 "주의(attention)"를 기울이는지 살펴보았을 때, 훈련 전에는 모델이 노이즈에 쉽게 주의를 빼앗겨 배경이나 무작위 픽셀을 보고 있었던 것을 확인했습니다. CAW를 사용한 후, 모델은 이미지가 공격받고 있는 상황에서도 실제 객체에 집중하는 법을 배웠습니다.

요약하자면, 이 논문은 혼란스러운 사례들을 조금 더 선택적으로 공부함으로써, 우리는 더 똑똑하면서도 더 강인한 AI를 구축할 수 있다는 것을 시사합니다. 이는 시각-언어 모델이 항상 완벽하지 않고 때로는 우리를 속이려 드는 실제 세상에서 신뢰할 수 있게 만드는 데 있어 중요한 한 걸음입니다. 현재 이 방법은 모델의 이미지 부분에 초점을 맞추고 있으며 주로 공격자가 모델의 비밀을 알고 있는 화이트박스(white-box) 공격을 대상으로 테스트되었지만, 이는 새로운 것을 배우는 능력을 희생하지 않으면서도 AI의 회복 탄력성을 높이는 새로운 문을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →