← 최신 논문
🤖 AI

Adversarially Robust Abductive Fusion of Pre-trained Transformer-based Perception Models

본 논문은 레이블 벡터 풀(Label Vector Pools)과 일관성 기반 어브덕션(consistency-based abduction)을 활용하여 사전 학습된 ViT 검출기들을 강건하게 결합함으로써, 분포 변화와 협동적 적대 공격 모두에서 다수결 투표 베이스라인보다 우수한 성능을 달성하는 도메인 지식 불필요한 뉴로심볼릭 융합 프레임워크를 제안한다.

원저자: Mario Leiva, Yue Ma, Qinru Qiu, Gerardo Simari, Paulo Shakarian

게시일 2026-08-06
📖 6 분 읽기🧠 심층 분석

원저자: Mario Leiva, Yue Ma, Qinru Qiu, Gerardo Simari, Paulo Shakarian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 폭풍우가 치는 외계 은하를 항해하는 우주선의 선장이라고 상상해 보십시오. 당신에게는 바위, 우주선, 또는 우주 정거장 같은 특정 지형을 포착하도록 훈련된 6명의 전문가 센서 팀이 있습니다. 하지만 문제가 하나 있습니다. 당신의 센서들은 모두 평온하고 화창한 태양계에서 훈련되었습니다. 그런데 지금 당신은 기묘한 안개, 소용돌이치는 먼지, 이상한 조명으로 가득 찬 혼란스러운 성운 속을 비행하고 있습니다. 센서들이 혼란에 빠진 것입니다. 그들은 서로 상충하는 보고를 하며 소리치기 시작합니다. "저건 바위야!" "아니, 저건 우주선이야!" "사실, 저건 거대한 우주 곰이야!"

이것이 바로 과학자들이 직면한 현실 세계의 문제, 즉 **인공지능(AI)**의 문제입니다. 우리는 자동차나 사람 같은 사물을 사진에서 식별할 수 있는 매우 똑똑한 컴퓨터 프로그램(이를 "인지 모델"이라 부릅니다)을 만들어 왔습니다. 하지만 이 프로그램들은 앞서 말한 우리의 우주 센서와 같습니다. 이들은 이전에 보았던 것에는 전문가이지만, 세상이 변하면 쉽게 혼란에 빠집니다. 만약 캘리포니아의 화창한 도로에서 훈련된 자율주행 자동차를 미네소타의 눈보라 속으로 몰고 간다면, 자동차는 눈송이를 보행자로 착각하거나 작동을 완전히 멈춰버릴 수도 있습니다 있습니다.

이를 해결하기 위해 엔지니어들은 보통 여러 AI 모델이 하나의 위원회처럼 함께 작동하도록 만듭니다. 위원회의 결정을 내리는 가장 흔한 방법은 **다수결 투표(Majority Voting)**입니다. 만약 6개 모델 중 3개가 "자동차다"라고 말한다면, 시스템은 그것을 자동차라고 결정합니다. 공평하게 들리나요? 하지만 여기 큰 결함이 있습니다. 만약 교활한 해커(또는 정말 심한 폭풍)가 몇몇 모델을 속여서 잘못된 답에 동의하게 만든다면, 위원회 전체가 속아 넘어가게 됩니다. 이는 마치 단체 채팅방의 친구 세 명이 당신을 골탕 먹이려고 하늘이 초록색이라고 결정했을 때, 당신이 다수결을 따름으로써 결국 하늘이 초록색이라고 믿게 되는 것과 같습니다.

이 논문은 그 위원회를 운영하는 더 똑똑한 방법을 소개합니다. 단순히 표를 세는 대신, 이 새로운 시스템은 **논리적 일관성(Logical Consistency)**을 확인하는 탐정처럼 행동합니다. 이 시스템은 "이 이야기가 말이 되는가?"라고 묻습니다. 만약 한 모델은 "자동차다"라고 하고 다른 모델은 "구름이다"라고 한다면, 시스템은 단순히 머릿수를 세는 것이 아니라, 어떤 이야기가 모순 없이 성립하는지 증거를 살펴봅니다. 저자들은 이 방법이 속임수에 훨씬 강하며, 환경이 완전히 바뀌었을 때 더 잘 작동한다는 것을 보여줍니다.

탐정의 새로운 도구 상자: 참조 가이드 없는 학습

연구자인 마리오 레이바(Mario Leiva)와 그의 팀은 두 가지 큰 문제를 해결하고자 했습니다. 첫째, 기존 방식들은 오류를 찾아내기 위해 인간의 지식이 담긴 "참조 가이드"가 필요했습니다. 예를 들어, 인간은 컴퓨터에게 "보행자는 보통 인도 위에 있지, 하늘에 있지 않다"라거나 "자동차는 이것보다 크다"라고 알려줄 수 있습니다. 하지만 만약 당신이 규칙을 알 수 없는 완전히 새로운 환경에 있다면 어떻게 될까요? 가본 적도 없는 곳을 위한 참조 가이드를 작성할 수는 없습니다.

둘째, 그들은 "다수결 투표"가 쉽게 해킹되는 것을 막고 싶었습니다.

해결책: "레이블 벡터 풀(Label Vector Pool)"
첫 번째 문제를 해결하기 위해, 팀은 AI가 인간의 도움 없이 스스로 자신의 참조 가이드를 학습할 수 있는 방법을 발명했습니다. 그들은 각 AI 모델의 "기억"을 이용한 영리한 트릭을 사용했습니다.

각 AI 모델은 자신이 훈련 중에 보았던 모든 객체의 정신적 도서관을 가지고 있다고 상상해 보십시오. 모델이 "자동차"를 볼 때, 단순히 "자동차"라는 단어만 저장하는 것이 아니라, 그 자동차가 어떻게 생겼는지에 대한 고유한 수학적 지문(임베딩)을 저장합니다. 연구진은 각 유형의 객체에 대한 이러한 지문들을 모두 모아 **레이블 벡터 풀(Label Vector Pools)**이라는 작은 클러스터로 그룹화했습니다.

이것은 객체를 위한 "무드 링(Mood Ring)"과 같습니다. 만약 모델이 새로운 객체를 발견하면, 시스템은 다음과 같이 확인합니다. "이 객체의 지문이 '자동차' 무드 링과 닮았는가, 아니면 '나무' 무드 링과 닮았는가?" 만약 어떤 객체가 자동차여야 하는데 그 지문이 너무 동떨어져 있다면(예: 구름처럼 보이는 자동차), 시스템은 이를 의심스러운 것으로 분류합니다. 이 과정은 인간이 정한 인도나 크기에 대한 규칙 없이, 오직 모델 내부의 수학만을 사용하여 자동으로 이루어집니다.

해결책: "일관성 탐정(Consistency Detective)"
시스템이 어떤 예측이 의심스러운지 알게 된 후, 시스템은 단순히 그것들을 버리지 않습니다. 대신, **귀추적 추론(Abductive Reasoning)**이라는 방법을 사용합니다. 이것은 "최선의 설명을 향한 추론"이라는 멋진 표현의 다른 이름입니다.

당신이 여섯 명의 목격자를 데리고 미스터리를 풀려는 탐정이라고 상상해 보십시오.

  • 다수결 투표는 단순히 "누가 가장 많은 사람과 동의하는가?"를 묻습니다. 만약 세 명의 목격자가 "집사가 범인이다"라고 말하면, 탐정은 집사를 체포합니다.
  • 이 새로운 시스템은 "누구의 이야기가 다른 이들과 모순되지 않는가?"를 묻습니다.

만약 세 명의 목격자가 "집사가 범인이다"라고 말하지만, 한 명의 목격자가 "집사는 그 시간에 주방에 있었다"라고 말하고, 또 다른 목격자가 "집사는 무기에 알레르기가 있다"라고 말한다면, 시스템은 "집사가 범인이다"라는 이야기에 구멍이 있다는 것을 깨닫습니다. 시스템은 설령 소수파일지라도 서로 일관성을 유지하는 목격자들을 신뢰하기로 결정할 수 있습니다. 시스템은 모든 조각이 완벽하게 들어맞아야 하는 논리적인 퍼즐을 구축합니다. 만약 어떤 조각(예측)이 전체 그림을 무너뜨린다면, 설령 많은 사람이 그 조각을 선택했더라도 그것은 거부됩니다.

대규모 테스트: 폭풍과 교활한 해커들

연구팀은 15가지의 다양한 기상 조건(폭우부터 먼지 폭풍까지) 하에서의 도시 항공 이미지라는 까다로운 과제로 이 아이디어를 테스트했습니다. 그들은 각각 한 가지 유형의 날씨에 대해서만 훈련된 6개의 서로 다른 AI 모델을 사용했습니다. 이 모델들을 모두 섞어 놓았을 때, 날씨는 엉망진창이 되었습니다.

깨끗한 데이터 결과
먼저, 그들은 해킹되지 않은 정상적인 조건에서 시스템을 테스트했습니다. 그 결과, 새로운 "일관성 탐정"이 최고의 "다수결 투표" 팀만큼 성능이 좋다는 것을 발견했습니다. 정확도를 잃지 않았으며, 기존 방식만큼 자동차와 사람을 잘 찾아냈습니다.

공격 테스트
그다음, 그들은 악당들을 투입했습니다. 그들은 **조직적인 공격(Coordinated Attack)**을 시뮬레이션했습니다. 해커가 개별 AI 모델을 직접 파괴할 수는 없지만, 소수의 모델이 동시에 똑같이 틀린 답을 외치도록 유도하여 속이는 상황을 가정했습니다.

  • 다수결 투표 팀: 해커가 객체의 90%에 대해 "뒤집힌(flipped)" 레이블(공격에 의해 강제된 잘못된 레이블)을 적용했을 때, 다수결 투표 시스템은 무너졌습니다. 다수결 시스템의 평균 정확도는 0.35로 떨어졌습니다. 해커들이 몇 개의 모델만 통제해도 여론을 바꿀 수 있었기 때문에 완전히 속아 넘어간 것입니다.
  • 일관성 탐정: 새로운 시스템은 그리 크게 흔들리지 않았습니다. 동일한 90%의 공격 상황에서도, 이 시스템은 15개 테스트 세트 전체에서 평균 0.42의 정확도를 유지했습니다. 큰 차이가 없어 보일 수도 있지만, AI의 세계에서 이것은 기존 방식보다 22% 개선된 수치입니다.

이유는 무엇일까요? 해커들은 다수를 점유하려고 노력했지만, 일관성 탐정은 논리를 살펴보았습니다. 만약 해커들이 세 개의 모델에게 "이것은 구름이다"라고 강요했더라도, 나머지 세 개의 모델(그리고 시스템의 내부 논리)이 "그것은 말이 안 된다"라고 판단했다면, 탐정은 해커를 무시했습니다. 시스템은 숫자의 힘이 아니라, 말이 되는 이야기를 신뢰했습니다.

이것이 왜 중요한가

이 논문은 AI를 위한 안전망을 구축하기 위해 반드시 인간 전문가가 될 필요는 없다는 것을 보여줍니다. AI가 스스로 자신의 "지문" 규칙을 학습하게 하고, 그들이 하는 이야기가 논리적으로 일관되는지 확인함으로써, 다음과 같은 시스템을 구축할 수 있습니다:

  1. 이식성(Portable): 매뉴얼 없이도 새로운, 기이한 환경에서 작동합니다.
  2. 강인함(Tough): 투표를 조작하려는 해커들에게 쉽게 속지 않습니다.

연구진은 이 테스트를 표준 컴퓨터 서버에서 실행했으며, 시스템은 실용적으로 사용할 수 있을 만큼 빨랐습니다. "일관성 탐정"(특히 그들의 "IP+TB" 방식)은 단순한 투표 카운터보다 퍼즐을 푸는 데 시간이 조금 더 걸렸지만, 실시간으로 사용하기에 충분히 빨랐습니다.

결론적으로, 이 논문은 우리가 재난 지역, 외딴 행성, 혹은 공격받는 도시와 같이 미지의 세계로 AI를 보낼 때, 단순히 가장 큰 목소리에 귀를 기울여서는 안 된다는 것을 시사합니다. 우리는 가장 말이 되는 목소리에 귀를 기울여야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →