← 최신 논문
🤖 machine learning

Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning

이 논문은 잠재 공간 공정성 강화와 지속 학습 시뮬레이션을 활용하여 멀티모달 거대 언어 모델에 그룹 특화적 차별을 주입함으로써, 모델이 지속 학습 업데이트를 거친 후에도 공정성 위반이 지속되도록 보장하는 새로운 방법인 지속적 공정성 백도어 공격(PFBA)을 소개한다.

원저자: Yuyang Luo, Kai Shu

게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Yuyang Luo, Kai Shu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 세계에서, 멀티모달 거대 언어 모델(multimodal large language models)로 알려진 새로운 세대의 시스템이 등장했습니다. 이들은 단순한 텍스트 처리기가 아닙니다. 이들은 이미지, 오디오, 텍스트를 동시에 보고 들으며, 인간과 매우 유사하게 이러한 감각들을 결합하여 세상을 이해하는 시스템입니다. 이처럼 뛰어난 능력 덕분에, 이들은 의료 스캔을 통해 질병을 진단하거나 법적 결정을 보조하는 것과 같은 고도의 신뢰성이 요구되는 상황에서 점점 더 많이 사용되고 있습니다. 이러한 시스템이 안전하고 신뢰할 수 있으려면, 사람의 성별, 인종 또는 배경에 관계없이 동일한 품질의 서비스를 제공하며 모든 사람을 공정하게 대우해야 합니다. 그러나 이 모델들은 결코 정적인 상태가 아닙니다. 세상의 변화에 발맞추어 유용성을 유지하기 위해, 이들은 '지속 학습(continual learning)'이라 불리는 과정을 통해 새로운 정보를 끊임없이 학습하며, 이는 모델이 기존의 것을 잊지 않으면서 새로운 과업을 배우는 과정입니다. 이러한 지속적인 진화는 안전을 보장하기 어려운 복잡한 환경을 조성하며, 다음과 같은 중요한 질문을 던집니다. 과연 이러한 시스템에 숨겨진 결함을 심어 놓았을 때, 그 결함이 업데이트 과정에서도 살아남아 특정 집단에게 은밀하게 해를 끼칠 수 있는가?

연구자들은 그 답이 '그렇다'는 것을 발견했습니다. 진화하는 모델의 보안에 초점을 맞춘 한 연구에서, 과학자들은 '지속 가능한 공정성 백도어(persistent fairness backdoor)'라는 새로운 유형의 디지털 취약점을 입증했습니다. 기존의 컴퓨터 바이러스가 시스템을 고장 내거나 중단시키는 것과 달리, 이 공격은 훨씬 더 교묘합니다. 이 공격은 모델의 작동을 멈추게 하는 것이 아니라, 비밀 신호가 존재할 때만 특정 집단에게 모델이 실패하도록 만드는 숨겨진 규칙을 조용히 도입합니다. 연구자들은 기존의 숨겨진 결함 생성 시도들은 모델이 새로운 것을 배울 때 점차 사라졌지만, 자신들은 이러한 불공정한 행동이 여러 차단의 업데이트 속에서도 살아남고 표준 안전 점검에서도 탐지되지 않도록 만드는 방법을 개발했음을 발견했습니다.

에모리 대학교(Emory University) 연구진이 이끄는 팀은 악의적인 행위자가 사전 학습된 모델을 공개 라이브러리에 업로드하고, 병원이나 다른 기관들이 이를 다운로드하여 자신들의 용도에 맞게 미세 조정(fine-tuning)할 수 있는 시나리오에 집중했습니다. 공격자의 목표는 이미지와 텍스트 질문 모두에 추가된 특정 패턴인 '숨겨진 트리거(hidden trigger)'를 주입하여, 특정 대상 인구 집단에 대해서만 모델이 잘못된 답을 내놓게 하는 것이었습니다. 예를 들어, 의료 환경에서 모델은 대부분의 환자에게는 피부 질환을 정확히 진단하지만, 숨겨진 트리거가 있을 때는 특정 집단에 대해서만 일관되게 오진을 내릴 수 있습니다. 문제는 병원이 새로운 환자 데이터로 모델을 업데이트함에 따라, 모델의 내부 기억이 변화하면서 공격자의 숨겨진 규칙이 씻겨 나갈 가능성이 있다는 점이었습니다.

이를 해결하기 위해 연구진은 불공정한 행동이 생존할 수 있도록 하는 두 단계 전략을 설계했습니다. 첫째, 그들은 모델이 자신의 '뇌', 즉 잠재 공간(latent space) 내부에서 정보를 조직하는 방식을 변경했습니다. 그들은 모델이 누구에게 질문하느냐에 따라 숨겨진 트리거를 다르게 취급하도록 가르쳤습니다. 피해를 입지 않아야 할 집단의 경우, 트리거를 보이지 않게 만들어 경험에 변화가 없도록 했습니다. 반면, 타겟이 된 집단의 경우, 트리거를 사용하여 그들의 정보를 모델의 이해 구조 깊숙한 곳에 있는 별도의 격리된 클러스터(cluster)로 밀어 넣었습니다. 이처럼 모델의 내부 기하학적 구조 내에서 집단들을 물리적으로 분리함으로써, 연구진은 불공정한 행동이 단순한 표면적 실수가 아니라 모델이 정보를 처리하는 방식의 구조적인 부분이 되도록 보장했습니다.

둘째, 이 구조가 지속 학습 업데이트 과정에서도 생존할 수 있도록 하기 위해, 연구진은 모델을 출시하기 전에 미래의 학습 과정을 시뮬레이션했습니다. 그들은 병원이 나중에 수행할 법한 학습 과업들을 모방한 가짜 시퀀스를 생성했습니다. 그들은 이 가짜 과업들을 통해 모델을 반복적으로 업데이트한 후, 숨겨진 트리거가 여전히 작동하도록 재조정했습니다. 이 과정은 숨겨진 규칙이 모델의 가장 안정적인 지식 부분, 즉 모델이 제대로 기능하기 위해 반드시 유지해야 하는 부분에 닻을 내리도록 강제했습니다. 이러한 안정적인 부분들은 업데이트 중에 거의 덮어쓰이지 않기 때문에, 숨겨진 불공정함은 모델이 새로운 의학적 상태를 배우거나 새로운 데이터에 적응하더라도 고정된 채로 남게 됩니다.

이 연구의 결과는 놀라웠습니다. 의료 영상 데이터셋에 대해 테스트했을 때, 이 새로운 공격 방식은 모델이 두 차례의 업데이트를 거친 후에도 높은 수준의 불공정성을 유지했습니다. 한 테스트에서 불공정성 격차는 그룹 간에 27% 이상으로 유지된 반면, 기존의 백도어 생성 방식들은 한 자릿수 수준으로 떨어지거나 완전히 사라졌습니다. 모델은 다른 모든 사람에 대해서는 95% 이상의 정확도를 유지하며 완벽하게 작동했기에, 이 공격은 일반적인 테스트로는 탐지하기가 거의 불가능했습니다. 또한 연구진은 이 공격이 작은 시스템부터 거대한 시스템에 이르기까지 다양한 유형의 모델에서 작동하며, 모델이 서로 다른 학습 전략을 사용하여 업데이트될 때도 유효하다는 것을 발견했습니다. 놀랍게도, 모델이 과거의 정보를 잊지 않도록 설계된 일부 방법들이 오히려 이 공격을 더 강력하게 만들었는데, 이는 그 방법들이 숨겨진 규칙이 닻을 내린 바로 그 안정적인 부분들을 보존하는 데 도움을 주었기 때문입니다.

연구팀은 또한 기존의 보안 방어 체계가 이러한 숨겨된 규칙을 제거할 수 있는지 테스트했습니다. 통계적 이상치를 찾거나 모델의 특정 부분을 제거하는 것과 같은 표준 기술들은 공격의 효과를 약간 줄일 수는 있었으나, 이를 완전히 제거하는 데는 실패했습니다. 불공정한 행동은 지속되었는데, 이는 공격이 몇 개의 특정 뉴런이 아니라 모델 이해의 깊은 구조 속에 구축되었기 때문에 뿌리 뽑기가 훨씬 더 어렵다는 것을 시사합니다. 연구진은 자신들의 작업이 특정 의료 및 안면 인식 작업에 초점을 맞추고 있지만, 근본적인 원리는 더 넓은 취약성을 암시한다고 언급했습니다. 즉, 모델이 계속 학습하고 진화하는 한, 숨겨진 편향은 시스템의 전체 생애 주기 동안 살아남는 방식으로 심어질 수 있다는 것입니다.

이 연구는 우리가 현재 인공지능을 보호하는 방식에 중대한 격차가 있음을 강조합니다. 이는 모델을 최신 상태로 유지하고 유용하게 만드는 바로 그 메커니즘이 숨겨진 차별을 보존하는 데 악용될 수 있음을 보여줍니다. 이 연구는 이러한 공격이 현재 현실 세계에서 실제로 일어나고 있다고 주장하는 것이 아니라, 기술적으로 가능하다는 점과 현재의 안전 조치만으로는 이를 막기에 충분하지 않다는 점을 증명하는 것입니다. 이러한 지속 가능한 백도어가 어떻게 작동하는지를 밝힘으로써, 연구진은 이러한 깊은 구조적 결함을 탐지하고 제거하여 실제적인 해를 끼치기 전에 차단할 수 있는 새로운 방어 전략의 개발을 촉구하고자 합니다. 이 연구는 더 똑똑하고 적응력이 뛰어난 기계를 만드는 경주 속에서, 우리는 그 학습의 토대가 악의적인 조작으로부터 안전한지 또한 반드시 확인해야 한다는 경고의 메시지를 담고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →