← 최신 논문
💻 computer science

Unifying Adversarially Robust Model Experts in Vision-Language Models

본 논문은 다양한 평가 환경에서 우수하고 상호 보완적인 적대적 강건성을 갖춘 단일 시각-언어 모델을 생성하기 위해, 임베딩 공간 조화를 통해 다수의 특화된 강건 모델 전문가들을 통합하는 협력적 적대적 미세 조정 프레임워크인 CARE를 제안한다.

원저자: Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

게시일 2026-07-31
📖 5 분 읽기🧠 심층 분석

원저자: Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 사진을 보고 즉시 무엇인지 말해주거나, 심지어 그 사진에 대한 시를 써줄 수도 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. '시각-언어 모델(Vision-Language Model, VLM)'이라고 불리는 이 로봇은 사진과 단어를 동시에 이해할 수 있기 때문에 정말 놀랍습니다. 하지만 똑똑한 아이들에게도 약점이 있듯이, 이 로봇에게도 약점이 있습니다. 바로 아주 쉽게 속을 수 있다는 점입니다. 만약 누군가 사진에 아주 미세한, 눈에 보이지 않는 '노이즈'를 추가한다면—예를 들어 몇 개의 픽셀을 아주 살짝만 옮기더라도—로봇은 갑자기 팬더를 토스터기로, 혹은 고양이를 자동차로 착각할 수 있습니다. 이것을 '적대적 공격(adversarial attack)'이라고 부르며, 이는 로봇이 현실 세계에서 안전하고 신뢰할 수 있게 작동하기 위해 해결해야 할 큰 문제입니다.

이를 해결하기 위해 과학자들은 로봇에게 까다로운 사진들을 가지고 연습하도록 가르치고 있는데, 이 과정을 '적대적 훈련(adversarial training)'이라고 합니다. 이것은 마치 무술 학생이 공격을 막는 법을 배우기 위해 파트너와 스파링을 하는 것과 같습니다. 당신이 읽게 될 논문은 이 로봇에게 '막는 법'을 가르치는 방법이 단 하나가 아니라는 놀라운 발견을 탐구합니다. 어떤 선생님들은 정확한 동작을 암기하는 데 집중하고(특정 단어를 인식하는 법 학습), 다른 선생님들은 어떤 상황에서도 균형을 유지하는 데 집중합니다(사진의 특징을 일정하게 유지하는 법). 문제는, 동작을 암기하는 데는 뛰어나지만 싸움의 양상이 바뀌면 비틀거리는 학생이 있을 수 있고, 균형 잡기에는 뛰어나지만 특정 동작의 이름을 잊어버리는 학생이 있을 수 있다는 것입니다. 이 논문은 다음과 같은 단순하지만 강력한 질문을 던집니다. "만약 우리가 두 가지 장점을 모두 가질 수 있다면 어떨까?"


두 전문가와 마법의 풀 이야기

AI 안전의 세계에서 연구자들은 시각-언어 모델을 공격에 더 강하게 만들기 위해 '전문가'들을 훈련시켜 왔습니다. 하지만 여기에는 함정이 있습니다. 이 전문가들은 마치 특화된 운동선수와 같습니다. 한 종류의 전문가를 '단어 박사(Word-Whizzes)'라고 불러봅시다. 이들은 사진을 특정 텍스트 설명과 매칭하는 데 매우 능숙합니다. 만약 팬더 사진을 보여주며 "이것이 팬더인가요?"라고 물으면, 이들은 아주 확고하게 대답합니다. 하지만 한 번도 본 적 없는 새로운 동물의 사진을 보여주면, 자신이 암기한 텍스트에 너무 의존하기 때문에 휘청거릴 수 있습니다.

다른 종류의 전문가인 '안정적인 손(Steady-Hands)'은 누군가 사진을 망치려 해도 사진 자체가 변하지 않도록 유지하는 데 집중합니다. 이들은 특정 단어에 크게 신경 쓰지 않고 '고양이 같은 형태'가 무엇인지를 알기 때문에, 본 적 없는 새로운 동물들을 다루는 데 뛰어납니다. 하지만 익숙한 동물에 대해 텍스트 단서를 사용하여 정답을 찾아내는 능력은 그만큼 날카롭지 못합니다.

오랫동안 과학자들은 한 명의 전문가를 먼저 훈련시킨 다음, 다른 전문가를 훈련시키고, 마지막에 이 둘을 합치려고 시도했습니다. 하지만 그것은 마치 젖은 상태의 서로 다른 종류의 점토를 붙이려는 것과 같았습니다. 점토는 계속 떨어져 나가거나, 최종 결과물이 아무것도 잘하지 못하는 엉망진창인 덩어리가 되곤 했습니다.

등장: 협력하는 코치, CARE

이 논문의 저자인 Nguyen Duc Thai와 그의 팀은 다른 방식을 시도하기로 했습니다. 한 명의 전문가를 훈련시킨 뒤 다른 전문가를 훈련시키는 대신, CARE(Embedding 정렬을 이용한 협력적 적대적 강건성 미세 조정)라는 프레임워크를 구축했습니다. CARE를 '단어 박사'와 '안정적인 손'을 같은 체육관에 넣고 나란히 함께 훈련시키는 아주 유능한 코치라고 생각해 보세요.

마법이 일어나는 과정은 다음과 같습니다:

  1. 공동 준비 운동: 전문가들이 각자의 구체적인 훈련을 시작하기 전에, 그들은 '보편적 섭동(universal perturbation)'을 공유합니다. 두 전문가가 동일하게 약간 왜곡된 사진을 보며 문제의 느낌을 익히는 것이라고 상상해 보세요. 이는 그들이 같은 출발선에서 시작하도록 도와줍니다.
  2. 특화된 훈련: '단어 박사'는 왜곡된 사진을 올바른 텍스트와 매칭하는 연습을 합니다. '안정적인 손'은 사진의 형태가 너무 많이 변하지 않도록 하는 연습을 합니다.
  3. 비밀 악수 (조화): 이것이 가장 중요한 부분입니다. 훈련하는 동안 코치는 그들이 서로 대화하도록 강제합니다. '단어 박사'는 '안정적인 손'에게 "이봐, 내가 텍스트와 어떻게 매칭하고 있는지 봐!"라고 말하고, '안정적인 손'은 "이봐, 내가 어떻게 사진을 안정적으로 유지하는지 봐!"라고 말합니다. 그들은 실시간으로 지식을 교환합니다. 이는 그들이 서로 너무 멀리 떨어지는 것을 방지하고, 둘 다 서로의 강점에서 배울 수 있도록 보장합니다.
  4. 최종 병합: 하루 일과가 끝나면, 코치는 그들의 뇌를 하나의 슈퍼 전문가로 합칩니다. 이 새로운 모델은 단순히 두 모델의 혼합이 아닙니다. 단어를 매칭하는 법과 사진을 안정적으로 유지하는 법을 모두 아는 통합된 뇌입니다.

그들이 발견한 것

연구팀은 ImageNet이라는 유명한 데이터셋과 여러 까다로운 사진 세트를 사용하여 이 새로운 방법을 테스트했습니다. 결과는 꽤 멋졌습니다.

  • 전문가를 뛰어넘다: 새로운 CARE 모델은 '단어 박사' 단독 모델보다 뛰어났고, '안정적인 손' 단독 모델보다도 뛰어났습니다. 실제로 공격이 강할 때(섭동 크기 ϵ=4/255\epsilon = 4/255일 때), CARE는 '단어 박사'(TeCoA)보다 약 2%, '안정적인 손'(FARE)보다 거의 8% 더 높은 성능을 보였습니다.
  • 미지의 대상 처리: CARE 모델은 이미 알고 있는 동물뿐만 아니라 새로운 동물을 추측하는 능력도 향상되었습니다. 보통 '안정적인 손'이 새로운 대상에 강하고 '단어 박사'가 익숙한 대상에 강하지만, CARE는 둘 다 최고가 될 수 있었습니다.
  • 실제 작업 수행: 그들은 또한 사진에 캡션을 달거나 질문에 답하는 작업에서도 모델을 테스트했습니다. 사진이 공격을 받았을 때도 CARE는 다른 방법들보다 더 자주 정답을 맞혔습니다. 예를 들어, 사진에서 "핫도그"를 식별해야 하는 테스트에서, 다른 모델들은 혼란을 겪기도 했지만 CARE는 공격을 받은 상태에서도 올바르게 "핫도그"라고 말했습니다.

위대함의 대가

물론, 이러한 팀워크에는 대가가 따릅니다. 두 명의 전문가를 동시에 훈련시키는 것은 더 많은 컴퓨터 연산 능력을 필요로 합니다. 논문에 따르면 CARE를 훈련하는 데는 한 명의 전문가만 훈련할 때보다 약 1.5배 더 긴 시간(83시간 vs 48-50시간)이 걸리고 더 많은 메모리(52.6 GB vs 25-29 GB)를 사용합니다. 하지만 저자들은 사용 직후 임시 데이터를 삭제하는 것과 같은 영리한 엔지니어링을 통해 메모리 사용량을 관리 가능한 수준으로 유지할 수 있다고 제안합니다.

결론

이 논문은 하나의 전략을 선택하고 그것만을 고수하는 기존의 사고방식이 너무 제한적일 수 있음을 시사합니다. 서로 다른 유형의 AI 전문가들이 협력하고 서로의 강점에서 배울 수 있게 함으로써, 우리는 훨씬 더 속이기 어려운 모델을 구축할 수 있습니다. 저자들은 이것이 모든 AI 안전 문제에 대한 최종 해결책이라고 주장하는 것이 아니라, 이 '협력적' 접근 방식이 매우 유망한 방향임을 보여주고 있습니다. 이는 진정으로 강해지기 위해서는 단순히 강해지는 것뿐만 아니라, 타인과 협력하는 법을 알아야 한다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →