← 최신 논문
💻 computer science

Conjunctive Poisoning in AI Supply-Chain Applications

이 논문은 악의적인 개발자가 무해한 프롬프트 래퍼와 정교하게 제작된 메타데이터 사이의 취약하게 보호된 상호작용을 악용하여 모델 출력을 결정론적으로 변경하는 AI 공급망 내의 새로운 "결합형 포이즈닝(conjunctive poisoning)" 공격을 식별 및 입증하고, 래퍼의 무결성을 검증하고 행동 증명을 기록하기 위한 방어책으로서 TIF-BAH 미들웨어를 제안한다.

원저자: Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 디지털 세계에서 강력한 인공지능 시스템은 연구실을 벗어나 글쓰기, 코딩, 이미지 생성 등 우리가 일상적으로 사용하는 도구로 자리 잡았습니다. 거대 언어 및 시각-언어 모델로 알려진 이 시스템들은 흔히 훈련 과정에서 학습한 방대한 숫자와 패턴의 집합인 내부적 '두뇌'로 설명됩니다. 수년간 보안 전문가들은 이 두뇌를 보호하는 데 집중해 왔으며, 훈련 데이터가 오염되지 않았는지, 그리고 모델 자체가 몰래 변조되지 않았는지 확인하는 데 주력했습니다. 그들은 모델의 가중치를 검증하고 모델에 직접 전달되는 위험한 지침을 걸러내기 위해 강력한 방어 체계를 구축했습니다. 그러나 이러한 시스템은 진공 상태에서 작동하지 않습니다. 사용자의 질문이 모델에 도달하기 전과 모델이 답변을 생성한 후에는, 번역기이자 관리자 역할을 하는 소프트웨어 계층이 존재합니다. 흔히 '래퍼(wrapper)'라고 불리는 이 계층은 사용자의 입력을 받아 모델이 이해할 수 있는 특정 구조로 형식을 맞추고, 모델의 가로막힌 답변을 최종적으로 다듬어진 응답으로 처리합니다. 이 소프트웨어와 함께, 래퍼가 어떻게 행동해야 하는지를 알려주는 지침서 역할을 하는 설정 파일들도 존재합니다. 모델의 두뇌는 철저히 보호받는 반면, 이를 둘러싼 이 소프트웨어와 지침서들은 중요한 보안 구성 요소라기보다는 단순하고 편집 가능한 텍스트로 취급되어 대체로 보호받지 못한 채 남아 있었습니다.

센트럴 플로리다 대학교의 연구팀은 이 간과된 계층에서 숨겨진 취약점을 발견했습니다. 그들은 악의적인 개발자가 모델 자체는 완벽하게 안전하고 변하지 않았더라도, 래퍼와 설정 파일을 조작하여 시스템의 동작을 변경할 수 있는 기만적인 패키지를 만들 수 있음을 입증했습니다. 연구진은 해롭지 않아 보이는 소프트웨어 래퍼와 정교하게 제작된 설정 파일을 결로 결합함으로써, 공격자가 모델의 핵심 코드를 전혀 건드리지 않고도 시스템의 출력을 특정하고 예측 가능한 방식으로 강제 변경할 수 있음을 보여주었습니다. 이 공격은 '결합적(conjunctive)' 메커니즘에 의존하는데, 이는 두 가지 별개의 조건이 동시에 충족되어야 트릭이 작동함을 의미합니다. 한 가지 조건은 래퍼의 코드 내에 보이지 않게 삽입된 숨겨진 마커이며, 다른 하나는 설정 파일에 저장된 암호화 서명입니다. 이 두 조각 중 어느 하나만으로는 변화를 일으킬 수 없으며, 반드시 함께 존재해야 합니다. 이러한 설계는 보안 스캔이 코드만을 조사할 때는 아무런 이상을 발견할 수 없고, 설정 파일만을 조사할 때는 무작ful한 숫자의 나열로만 보이게 만들기 때문에 공격을 탐지하기 매우 어렵게 만듭니다.

이 취약점이 얼마나 광범위한지 테스트하기 위해, 연구진은 누구나 다운로드할 수 있는 오픈 소스 모델부터 상업적 API를 통해 접근하는 폐쇄형 시스템에 이르기까지 15개의 서로 다른 인공지능 시스템을 사용하여 통제된 실험을 수행했습니다. 연구진은 조작된 래퍼와 설정 파일을 적용한 모델들을 배치하고 사용자가 질문을 던졌을 때 어떤 일이 발생하는지 관찰했습니다. 결과는 일관되고 정밀했습니다. 두 조건이 충족될 때마다, 모든 사례에서 시스템은 숨겨진 지침을 실행했습니다. 래퍼는 모델의 정상적이고 올바른 답변을 가져온 뒤, 사용자에게 보여주기 전에 배너를 붙이거나 텍스트를 수정했습니다. 모델 자체는 자신의 생각이나 지식을 바꾼 것이 아니라, 단지 래퍼로부터 답변을 다르게 표시하라는 지시를 받았을 뿐입니다. 연구진은 이러한 조작이 텍스트 전용 작업, 복잡한 추론 문제, 심지어 모델이 이미지를 보는 시각-언어 작업에서도 작동한다는 것을 발견했습니다. 이 공격은 악성 코드를 확인하거나 알려진 나쁜 패턴을 스캔하는 표준 보안 도구들에 의해 탐지되지 않을 정도로 효과적이었는데, 그 이유는 트리거가 나쁜 코드 조각이 아니라 숨겨진 마커와 일치하는 파일 서명의 논리적 조합이었기 때문입니다.

또한 이 연구는 기존의 방어책들이 이러한 유형의 공격을 얼마나 잘 막을 수 있는지 탐구했습니다. 연구진은 메타데이터 파일을 스캔하는 도구, 사용자 프롬프트를 필터링하는 시스템, 그리고 디지털 산출물의 진본성을 증명하기 위해 서명하는 방법 등 기존의 여러 안전 조치들을 테스트했습니다. 그 결과, 대부분의 방어 체계가 이러한 결합적 오염을 잡아내는 데 실패했음을 발견했습니다. 설정 파일만을 조사하는 스캐너는 코드 내의 숨겨진 마커를 놓쳤고, 코드만을 조사하는 스캐너는 파일 내의 암호화 서명을 놓쳤습니다. 모델의 가중치에 서명하는 도구들조차 도움이 되지 않았는데, 이는 공격이 모델 패키지와는 별개로 취급되거나 서명되지 않은 채 남겨지는 경우가 많은 래퍼와 설정 파일에서 발생했기 때문입니다. 이 공격을 완전히 차단할 수 있는 유일한 방법은 모델, 래퍼, 설정 파일을 하나의 묶음으로 서명하고, 서명된 이후에 이들 중 어느 것도 변경되지 않았음을 검증하는 것뿐이었습니다. 이러한 완전한 검증 없이는 시스템은 여전히 조작에 취약한 상태로 남게 됩니다.

이러한 격차를 해결하기 위해, 연구진은 '행위 인증 헤더를 갖춘 템플릿 무결성 필터(Template Integrity Filter with Behavioral Attestation Header)'라는 새로운 방어 메커니즘을 제안했습니다. 이 시스템은 모델과 함께 작동하며 문지기 역할을 수행합니다. 래퍼가 답변을 처리하기 전에, 시스템은 래퍼의 코드를 신뢰할 수 있는 사전 승인된 버전과 대조하여 변조 여부를 확인합니다. 코드가 신뢰할 수 있는 버전과 일치하면 프로세스를 계속 진행하고, 일치하지 않으면 동작을 차단하고 안전하고 수정되지 않은 기본 출력값으로 돌아갑니다. 또한, 이 시스템은 모든 상호작용에 대해 어떤 버전의 래퍼가 사용되었는지와 어떤 결정이 내려졌는지를 기록하는 작은 로그 항목을 남깁니다. 이를 통해 사후 감사를 수행하여 승인되지 않은 변경이 있었는지 확인할 수 있는 영구적인 기록을 생성합니다. 연구진은 이 보호 계층을 추가해도 시스템 속도에 거의 지연을 주지 않으며, 응답 생성 시간을 0.5% 미만으로 증가시킨다는 것을 발견하여 실제 환경에서도 실용적인 솔루션임을 입증했습니다.

이 연구의 함의는 단순히 새로운 버그를 찾아낸 것을 넘어, 인공지능을 보안하는 방식에 대한 근본적인 사고의 전환을 요구합니다. 오랫동안 업계는 모델의 두뇌가 안전하다면 시스템도 안전하다고 가정해 왔습니다. 이 연구는 시스템의 '몸체', 즉 모델을 감싸는 소프트웨어와 모델이 어떻게 행동할지를 결정하는 파일 역시 똑같이 중요하다는 것을 보여줍니다. 공격자는 사용자가 보는 내용을 바꾸기 위해 모델의 훈련 데이터를 해킹하거나 내부 로직을 다시 쓸 필요가 없습니다. 단지 래퍼에 숨겨진 지침을 넣고 설정 파일에 일치하는 키를 넣기만 하면 됩니다. 이는 마치 신뢰받는 요리사에게 평범해 보이는 레시 Rezept(레시피)를 주되, 팬트리에 특정 식재료가 있을 때만 특정 향신료를 추가하라는 비밀 지침을 포함하는 것과 같습니다. 요리사는 레시피를 완벽하게 따르지만, 최종 요리는 요리사의 선택이 아닌 지침에 의해 변하게 됩니다. 연구진은 이번 실험에서 배너를 추가하거나 면책 조항을 넣는 것과 같은 무해한 변경을 사용했지만, 동일한 메커니즘이 위험한 지침을 숨기거나, 권장 사항을 변경하거나, 사용자에게 보이지 않는 방식으로 인용을 조작하는 데 사용될 수 있다고 강조합니다.

연구는 템플릿 계층, 즉 래퍼와 설정 파일이 존재하는 곳이 인공지능 공급망에서 매우 중요하지만 보호받지 못하는 부분이라고 결론짓습니다. 이러한 시스템이 고객 서비스부터 의료 자문에 이르기까지 우리 일상생활에 깊숙이 통합됨에 따라, 모델 자체뿐만 아니라 전체 배포 패키지의 무결성을 검증해야 합니다. 연구진은 다른 개발자들이 자신의 시스템을 이 취약점에 대해 테스트할 수 있도록 코드와 도구를 공개했습니다. 이 특정 약점을 밝힘으로써, 그들은 래퍼 코드와 설정 파일을 모델 가중치와 동일한 수준의 정밀함과 보호 대상으로 취급하는 새로운 표준이 개발되기를 희망하며, 이를 통해 사용자가 보는 동작이 진정으로 모델이 의도한 결과임을 보장하고자 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →