← 최신 논문
🤖 AI

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

본 논문은 구조적 변경이나 태스크별 재학습 없이도 적대적 공격에 대한 대규모 시각-언어 모델의 강건성과 교차 태스크 일반화 능력을 크게 향상시키기 위해, 시각적 및 의미적 감독 신호를 공동으로 최적화하는 이중 적대적 미세 조정 프레임워크를 제안한다.

원저자: Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

게시일 2026-07-22
📖 6 분 읽기🧠 심층 분석

원저자: Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 사진을 보는 것을 넘어, 마치 사진첩을 보는 친구처럼 그 안에 무엇이 있는지 실제로 "이해"하는 세상을 상상해 보세요. 이것이 바로 대규모 시각-언어 모델(Large Vision-Language Models, LVLMs)의 영역입니다. 이들은 일몰을 묘사하거나, 도표에 대해 질문에 답하거나, 단 한 장의 이미지로부터 이야기를 들려줄 수 있는 도구 뒤에 숨겨진 초스마트 AI 두뇌입니다. 이 거인들을 작동시키기 위해, 과학자들은 퍼즐 조각을 완벽한 위치에 맞추는 것처럼 이미지와 단어를 연결하도록 가르칩니다. 하지만 여기에는 교활한 문제가 있습니다. 이 AI 두뇌들은 놀라울 정도로 취약합니다. 마술사가 약간의 주의 분산만으로도 속을 수 있듯이, 이 모델들은 "적대적 공격(adversarial attacks)"에 의해 속을 수 있습니다. 이는 인간의 눈에는 정적인 노이즈처럼 보이지만, AI를 완전히 미치게 만들어 개를 토스터기로, 버스를 기린으로 보게 만드는 아주 미세하고 보이지 않는 이미지 수정입니다. 이는 우리가 이 모델들을 중요한 업무에 신뢰하기 시작함에 따라, 모델이 디지털 노이즈에 속지 않도록 보장해야 하기 때문에 매우 중요한 문제입니다.

이때, AI가 그렇게 쉽게 속지 않도록 막기로 결심한 새로운 연구팀이 등장했습니다. 그들은 기존의 모델을 "강하게 만드는" 시도들이 마치 복싱 선수를 특정 상대하고만 싸우도록 훈련시키는 것과 같다는 점을 깨달았습니다. 즉, 모델이 그 한 번의 싸움에는 잘 적응했지만, 다른 어떤 것도 처리할 수 없게 된다는 것입니다. 연구진은 **이중 적대적 미세 조정(Dual Adversarial Fine-Tuning, DAFT)**이라는 영리한 새로운 훈련 캠프를 제안했습니다. 단순히 AI에게 노이즈를 무시하도록 가르치는 대신, 그들은 두 가지 레슨을 동시에 가르쳤습니다. 첫째, 기억력을 날카롭게 유지하기 위해 이미지의 "깨끗한" 버전(진실)을 보여주었습니다. 둘째, 단순한 "고양이"나 "개" 같은 레이블 대신, 이미지에 대한 풍부하고 묘사적인 이야기(캡션)를 사용했습니다. 이것은 학생에게 단순히 "사과"라는 단어를 암기시키는 것이 아니라, 사과의 붉은색, 아삭함, 그리고 과일 바구니에 어떻게 어울리는지 등 사과의 전체적인 개념을 이해하도록 가르치는 것과 같습니다. 그래야 누군가 그림 위에 낙서를 하더라도 학생이 여전히 그것이 무엇인지 알 수 있기 때문입니다.

이 논문은 이 이중적인 접근 방식이 놀라운 효과를 낸다는 것을 발견했습니다. 그들이 새로운 방법을 기존의 방법들과 테스트했을 때, DAFT로 훈련된 모델들은 이미지가 적대적 노이즈의 공격을 받을 때도 침착하고 차분함을 유지했습니다. 작업이 무엇이든(이미지 분류, 문장 작성, 또는 까다로운 질문 답변), 새로운 방법은 평정심을 유지했습니다. 연구진은 AI의 "눈"을 새로 훈련된 버전으로 교체함으로써, 전체 시스템을 처음부터 다시 구축할 필요 없이 훨씬 더 속이기 어렵게 만들 수 있음을 보여주었습니다. 이는 마치 슈퍼히어로에게 나쁜 것은 걸러내고 좋은 것은 수정처럼 맑게 보여주는 새로운 고글을 씌워주는 것과 같습니다.

논문의 이야기

문제점: "한 가지 기술만 가진" AI
대규모 시각-언어 모델(LVLMs)은 놀랍습니다. 그들은 관람차 사진을 보고 그것이 "관람차"라고 말하거나, "가운데에 있는 놀이기구는 무엇인가요?"와 같은 질문에 답할 수 있습니다. 하지만 이 모델들은 비밀스러운 약점이 있습니다: 쉽게 속는다는 것입니다. 만약 이미지에 아주 미세하고 보이지 않는 정적(adversarial attack)을 추가하면, AI는 갑자기 관람차를 "버스"나 "기린"이라고 생각할 수 있습니다.

과학자들은 이를 해결하기 위해 이전에 노력해 왔습니다. 어떤 이들은 트릭이 섞인 노이즈가 있는 사진을 보여주면서 단순한 레이블(예: "고양이" 또는 "버스")을 사용하여 AI를 훈련시키려 했습니다. 하지만 이 논문은 이것이 마치 조용한 방에서 "앉아"라고 말할 때만 앉도록 개를 훈련시키는 것과 같다고 주장합니다. 만약 시끄러운 공원에서 "앉아"라고 말하면 개는 혼란에 빠집니다. 이러한 방법들은 단순한 작업에는 효과적이었지만, AI가 이야기를 쓰거나 복잡한 질문에 답하는 것과 같은 더 어려운 일을 해야 할 때는 실패했습니다. 다른 방법들은 레이블 없이 AI를 훈련시키려 했지만, 정말 까다로운 공격을 견뎌낼 만큼 강력해지지는 못했습니다.

해결책: 2단계 훈련 캠프
이 논문의 저자인 Sibo Wang과 그의 팀은 DAFT(Dual Adversarial Fine-Tuning)라고 불리는 새로운 AI 훈련 방식을 고안했습니다. 그들은 AI를 진정으로 강인하게 만들기 위해서는, 마치 두 명의 선생님과 함께 공부하는 학생처럼 두 종류의 지침이 동시에 필요하다는 것을 깨달았습니다.

  1. "시각적" 선생님 (앵커): 이 훈련 부분은 동결된(frozen) 원래 AI의 "눈"(비전 인코더)을 사용합니다. 이것은 참조 가이드 역할을 합니다. AI가 노이즈가 섞인 까다로운 이미지를 볼 때, 이 선생님은 "헤이, 진짜 이미지가 어떻게 생겼는지 기억해! 원래의 특징들을 잊지 마!"라고 말합니다. 이는 AI가 혼란에 빠지거나 오버피팅(노이즈를 진실 대신 암기하는 것)되는 것을 막아줍니다.
  2. "의미론적" 선생님 (스토리텔러): 이것이 핵심적인 혁신입니다. "버스"나 "고양이" 같은 단순한 레이블 대신, 이 선생님은 이미지를 상세하게 설명하는 전체 문장이나 캡션을 사용합니다. 예를 들어, 단순히 "버스"라고 하는 대신, "빗길을 달리는 파란색 버스"라고 말합니다. 그러면 AI는 노이즈가 섞인 이미지를 이 풍부한 묘사와 일치시키도록 훈련됩니다. 이는 AI가 단순히 카테고리를 맞추는 것이 아니라, 이미지의 의미맥락을 이해하도록 돕습니다.

마법은 이 두 선생님이 함께 작동할 때 일어납니다. "시각적" 선생님은 AI를 현실에 기반하게 만들고, "의미론적" 선생님은 이미지가 망가졌을 때도 그 깊은 의미를 이해하도록 가르칩니다.

결과: 더 강하고 더 똑똑하게
팀은 다양한 작업에 대해 새로운 방법을 테스트했습니다. 그들은 인기 있는 AI 모델인 LLaVA를 가져와서 그 "눈"을 새로 훈련된 강력한 버전으로 교체했습니다. 그런 다음, 보이지 않는 노이즈로 공격하여 어떤 일이 일어나는지 확인했습니다.

  • 제로샷 분류 (Zero-Shot Classification): 본 적 없는 사진 속의 물체를 식별하라는 요청을 받았을 때, DAFT 모델은 노이즈를 무시하는 데 훨씬 뛰어났습니다. 단순한 레이블을 사용한 기존 방법들과 비교했을 때 평균적으로 정확도가 약 12% 향상되었습니다.
  • 캡셔닝 및 질의응답 (Q&A): 이 부분이 새로운 방법이 진정으로 빛을 발한 곳입니다. 노이즈가 섞인 이미지에 대해 설명을 쓰거나 질문에 답하라는 요청을 받았을 때, 기존 모델들은 종종 엉뚱한 답변(예: 크레인을 기린이라고 부르는 것)을 내놓았습니다. 그러나 DAFT 모델은 계속해서 정답을 맞혔습니다. 예를 들어, 한 테스트에서 다른 모델들이 공격을 받은 상황에서 "관람차"를 제대로 식별하지 못했을 때, DAft 모델은 정확히 맞혔습니다.
  • 트레이드오프 (Trade-off): 논문은 모델을 공격에 너무 강하게 만들면 깨끗한 사진을 보는 능력이 약간 떨어질 수 있다고 언급합니다. 그러나 DAFT는 깨끗한 사진에 대한 성능을 기존의 가장 좋은 방법들과 거의 비슷하게 유지하면서도, 공격에 대해서는 훨씬 더 강력한 모습을 보였습니다.

이 논문이 배제하는 것들
저자들은 무엇이 효과가 없는지에 대해 매우 명확하게 밝히고 있습니다. 그들은 단순히 카테고리 레이블(예: "고양이" 또는 "버스")만을 가이드로 사용하는 것은 오버피팅을 유발하기 때문에 충분하지 않다고 주장합니다. 또한, 텍스트 도움 없이 학습하는 비지도 학습 방식(unsupervised methods)만으로는 가장 발전된 공격을 견디기에 충분히 강하지 않다는 것을 보여줍니다. 그들의 실험은 최상의 결과를 얻기 위해서는 시각적 접지(visual grounding)와 풍부한 의미론적 이해의 조합이 반드시 필요하다는 것을 시사합니다.

얼마나 확실한가?
저자들은 많은 다양한 데이터셋(Calicut101, COCO, VQAv2 등)과 다양한 수준의 노이즈(특히 ϵ=2/255\epsilon = 2/255ϵ=4/255\epsilon = 4/255의 섭동 예산)에 걸쳐 광범ale한 실험을 수행했습니다. 그들은 자신들의 방법을 현재 최고의 방법들(TeCoA 및 FARE 등)과 비교했으며, DAFT가 일관되게 그들을 능가한다는 것을 발견했습니다. 그들은 단순히 시뮬레이션만 한 것이 아니라, 실제로 모델을 훈련시키고 실제 세계의 작업에서 테스트했습니다. 결과는 그들의 실험에서 측정된 사실로서 제시되었으며, 명확한 개선을 보여줍니다.

핵-심 요약
이 논문은 AI 시각 모델을 진정으로 안전하고 신뢰할 수 있게 만들기 위해서는, 단순히 노이즈를 무시하도록 가르치는 것이 아니라, 시각적 사실에 대한 확고한 파악을 유지하면서 이미지 뒤에 숨겨진 이야기를 이해하도록 가르쳐야 한다는 것을 시사합니다. 시각적 앵커와 풍부하고 묘사적인 캡션을 결합한 "이중" 접근 방식을 사용함으로써, 연구진은 속이기 훨씬 어려운 모델을 구축했으며, 이는 이 강력한 AI 도구들의 안전성을 높이는 데 있어 중요한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →