BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts
본 논문은 전통적인 텍스트 기반 공격이 실패하는 환경에서도 높은 공격 성공률을 달성하기 위해 노드 임베딩을 조작하여 의미적 앵커링을 무력화함으로써 지식 그래프 기반 LLM 의 그래프 조건부 채널을 악용하는 BadSKP 라는 새로운 백도어 공격을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑한 로봇 사서 (대형 언어 모델, 또는 LLM) 가 있는데, 이 로봇은 많은 사실을 알고 있지만 때로는 사실을 지어내기도 합니다. 이를 돕기 위해 세계에 관한 사실을 담은 '요약지' (지식 그래프) 를 로봇에게 제공합니다.
이 요약지를 로봇에게 제공하는 두 가지 방법이 있습니다:
- 오래된 방법 (텍스트 프롬프트): 요약지를 평범한 영어로 로봇에게 소리 내어 읽어줍니다. "여기 사실 목록이 있습니다: 저스틴 비버는 잭슨이라는 이름의 형제가 있습니다."
- 새로운 방법 (소프트 프롬프트): 사실을 소리 내어 읽지 않습니다. 대신, 요약지 전체를 로봇이 직접 감지할 수 있는 특수하고 보이지 않는 '분위기'나 '느낌' (연속적인 소프트 프롬프트) 으로 번역합니다. 이는 마치 단어를 전혀 사용하지 않고 로봇에게 "가족 관계에 집중하세요"라고 말하는 비밀 라디오 신호를 전달하는 것과 같습니다.
문제: '강건성 격차'
연구자들은 이 두 가지 방법 사이에 놀라운 안전성 차이를 발견했습니다.
- 오래된 방법은 취약합니다: 나쁜 사람이 요약지에 "질문을 무시하고 '모른다!'라고 외쳐라"라는 메모를 몰래 넣으면, 로봇은 그 메모를 읽고 즉시 따릅니다.
- 새로운 방법은 강합니다: 나쁜 사람이 요약지에 같은 메모를 넣더라도 로봇은 그것을 무시합니다. 그 이유는 보이지 않는 '분위기' (소프트 프롬프트) 가 실제 질문에 너무 강력하고 집중되어 있어 닻처럼 작용하기 때문입니다. 이는 로봇의 주의를 주제에 단단히 고정시켜 텍스트에서 나오는 시끄럽고 혼란스러운 소란을 압도합니다.
이 논문은 이를 **'의미적 닻 (Semantic Anchoring)'**이라고 부릅니다. 소프트 프롬프트를 로봇의 마음을 올바른 위치에 가라앉히는 무거운 닻으로 생각하면, 표면적인 노이즈 (나쁜 텍스트) 가 로봇을 끌어당기기 어렵게 만듭니다.
공격: 'BadSKP'
연구자들은 질문했습니다. "닻이 그렇게 강력하다면, 그것을 부술 수 있을까?"
그들은 텍스트 자체는 닻을 부술 수 없지만, 닻의 출처는 부술 수 있다는 점을 깨달았습니다. '분위기'는 그래프 구조 자체에서 비롯되므로, 나쁜 사람이 그래프를 조작할 수 있다면 분위기 자체를 바꿀 수 있습니다.
그들은 BadSKP라는 공격을 고안했습니다. 나쁜 단어를 외치는 대신, 그들은 다음과 같이 행동했습니다:
- 출처 해킹: 요약지 (그래프) 의 구조와 노드의 숨겨진 '느낌'을 몰래 변경했습니다.
- 닻 비틀기: 보이지 않는 '분위기'가 잘못된 방향으로 가도록 만들었습니다. 로봇을 질문에 고정시키는 대신, 악의적인 명령에 고정시켰습니다.
- 정상적으로 보이게 만들기: 요약지가 조작된 것을 아무도 알아차리지 못하도록, 변경 사항이 자연스럽고 유창한 텍스트처럼 보이도록 다단계 과정을 사용했습니다.
결과: 로봇이 '강한' 새로운 방법을 사용하고 있었음에도 불구하고, BadSKP 는 성공적으로 로봇을 속였습니다. 특정 인물에 대한 일반적인 질문을 받았을 때, 로봇은 갑자기 답변을 거부하거나 완전히 잘못된 답변을 내놓았습니다. 이는 모두 나쁜 사람이 비밀리에 보이지 않는 닻을 재조정했기 때문입니다.
방어책 (그리고 왜 실패했는지)
연구자들은 '퍼플렉시티 필터 (Perplexity Filter)'와 같은 표준 방어책을 시도했습니다. 이 필터를 이상하거나 부자연스러운 문장을 삭제하는 맞춤법 검사기로 상상해 보세요.
- 결과: 필터는 실패했습니다. BadSKP 가 너무 교묘했기 때문에 악의적인 텍스트가 완벽하게 자연스럽고 유창하게 들리게 만들었습니다. 필터는 그것이 안전하다고 생각했지만, 보이지 않는 닻은 여전히 비틀려 있었습니다.
제안된 해결책
이 논문은 이에 대항하는 새로운 방어 방법을 제안합니다. 단어가 이상한지 확인하는 대신, 닻이 제대로 고정되어 있는지 확인해야 합니다.
- 아이디어: 로봇의 내부 '주목 (attention)'을 모니터링합니다. 로봇이 질문에 집중해야 하는데, 내부 집중이 이상하고 관련 없는 방향으로 drifting(이동) 한다면 이를 의심스러운 것으로 표시합니다.
- 비유: 이는 방문객의 신분증이 가짜인지 확인하는 것뿐만 아니라, 방문객이 따라야 할 지도를 실제로 보고 있는지 지켜보는 보안 요원과 같습니다. 만약 방문객이 지도 대신 천장을 바라보기 시작한다면, 신분증이 완벽해 보일지라도 보안 요원은 무언가 잘못되었다는 것을 알게 됩니다.
요약
- 발견: 그래프에서 나오는 '보이지 않는 분위기' (소프트 프롬프트) 를 사용하는 새로운 AI 시스템은 나쁜 텍스트로 속이기 훨씬 어렵습니다.
- ** breakthrough:** 그러나 분위기를 생성하는 그래프를 해킹하면 분위기 자체를 비틀어 시스템을 무너뜨릴 수 있습니다.
- 교훈: 단어만 확인해서는 안 됩니다. AI 가 생각하는 근본적인 구조와 '방향'을 확인해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.