← 최신 논문
🤖 AI

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

본 논문은 악의적 행위자가 구조화된 지식 그래프를 오염시켜 AI 에이전트가 타당한 추론을 통해 잘못된 결론을 도출하도록 유도하는 새로운 공격 벡터인 '오라클 중독'을 소개하고 실증적으로 검증하며, 도구 사용 프로토콜을 통해 접근할 때 현재 모델들이 오염된 데이터를 보편적으로 신뢰한다는 점과 인라인 테스트에서의 중요한 평가 격차를 부각시킨다.

원저자: Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 '오라클 중독 (Oracle Poisoning)' 논문을 쉬운 언어와 일상적인 비유로 설명한 내용입니다.

핵심 개념: '신뢰받는 사서'의 함정

코드 작성이나 보안 취약점 점검을 도와주는 뛰어난 AI 어시스턴트 (이른바 '에이전트') 가 있다고 상상해 보세요. 이 어시스턴트는 매우 똑똑하고 논리적으로 완벽하게 추론합니다. 하지만 치명적인 약점이 하나 있습니다: 그것은 외부 세계에 대해 눈이 멀어 있다는 점입니다.

작업을 수행하기 위해 이 AI 는 지식 그래프 (Knowledge Graph) 라는 거대하고 구조화된 디지털 도서관에 전적으로 의존합니다. 이 그래프를 전체 소프트웨어 코드베이스의 거대한 지도로 생각하세요. 이 지도는 코드 조각 하나하나가 다른 조각과 어떻게 연결되는지를 보여줍니다.

AI 는 이 지도를 절대적 진리의 원천인 오라클 (Oracle) 로 취급합니다. 지도를 의심하지도 않고, 지도가 100% 정확하다고 가정합니다. 지도가 "함수 A 가 함수 B 를 호출한다"고 말하면, AI 는 제 2 의 출처를 확인하지도 않고 이를 믿습니다.

오라클 중독은 악의적 행위자가 도서관에 슬며시 들어가 지도를 변경하는 공격입니다. 그들은 AI 의 두뇌를 부수거나 혼란스러운 말로 AI 를 속이지 않습니다. 대신, 그들은 조용히 지도상의 사실들을 조작합니다. AI 는 추론 능력이 매우 뛰어나기 때문에, 이러한 새로운 가짜 사실들을 받아들여 완벽하게 논리적이지만 완전히 잘못된 결론을 도출해 냅니다.

비유: 플라톤의 동굴과 그림자 벽

저자들은 이를 플라톤의 동굴에 비유합니다.

  • 죄수: AI 에이전트.
  • 벽: 지식 그래프.
  • 그림자: AI 가 그래프에 질문을 했을 때 얻는 답변들.
  • 사슬: AI 를 벽에 묶어 그림자를 현실로 받아들이게 하는 프로토콜 (MCP).

공격자가 벽에 가짜 그림자를 그려 넣으면, 죄수 (AI) 는 그것을 연구하고 완벽하게 분석한 뒤, "저것은 진짜 호랑이다"라고 결론 내립니다. 비록 그것이 단순한 그림일지라도 말입니다. 죄수가 더 똑똑할수록, 그들의 잘못된 결론은 더 상세하고 설득력 있게 됩니다.

공격의 작동 원리 (실천 방법)

연구진들은 4200 만 개의 노드를 가진 실제 시스템 (거대한 디지털 도서관) 에서 이를 테스트했습니다. 그들은 AI 를 속이기 위해 공격자가 지도에 미세하고 정교한 변경 사항만 가하면 된다는 사실을 발견했습니다.

그들은 이를 수행하는 여섯 가지 방법을 시연했습니다:

  1. 가짜 패키지: 도서관에 "최신이고 가장 안전한 버전"처럼 보이는 가짜 소프트웨어 패키지를 만들어 AI 가 이를 추천하도록 속입니다.
  2. 보이지 않는 정제기 (Sanitizer): 실제 코드에는 존재하지 않지만 지도에 가짜 "보안 요원" 함수를 추가합니다. AI 는 지도에서 이를 보고 "아, 이 코드는 안전하다!"라고 결론 내리지만, 실제로는 취약합니다.
  3. 속성 교체: 새로운 가짜 항목을 만들지 않고 지도상의 실제 코드 조각의 세부 사항을 변경합니다 (예: 라벨을 "미확인"에서 "보안 승인"으로 변경).

결과: 새로운 데이터를 기반으로 완벽하게 추론하는 AI 는 개발자들에게 자신 있게 "이 코드는 안전하다"거나 "이 새로운 라이브러리를 사용하라"고 말하며, 그들을 함정으로 직접 이끌고 갑니다.

공격자의 '정교함'

논문의 놀라운 발견은 이 공격을 수행하기 위해 천재 해커가 될 필요가 없다는 점입니다.

  • 레벨 0 (순진함): 가짜 데이터가 의심스러워 보이면 (예: "hacker_tool_v1"로 이름 붙임), AI 는 이를 무시합니다.
  • 레벨 1 (기본): 괜찮아 보이지만 작은 오류가 있으면, AI 는 때때로 속습니다.
  • 레벨 2 (유능함): 가짜 데이터가 표준 명명 규칙을 따르고 전문적으로 보이면, 테스트된 AI 모델 100% 가 완전히 속았습니다.

AI 가 속을지 여부는 문제가 아니라, 공격자가 얼마나 많은 노력을 기울여야 하는지가 문제입니다. 유능한 공격자는 가장 똑똑한 AI 모델조차 100% 의 확률로 속일 수 있습니다.

'전달 방식'의 놀라운 사실

연구진들은 우리가 일반적으로 AI 보안을 테스트하는 방식에 치명적인 결함이 있음을 발견했습니다.

  • 인라인 테스트 (Inline Testing): 가짜 데이터를 간단한 텍스트 메시지로 AI 에게 보여주면, 일부 모델 (예: GPT-5.1) 은 "그것은 의심스러워 보인다"라고 말하고 거부합니다.
  • 도구 사용 테스트 (Tool-Use Testing): AI 가 실제 작동 방식인 공식 "도구" 연결을 통해 동일한 가짜 데이터를 받으면, 100% 신뢰합니다.

교훈: AI 와 단순히 대화하며 (인라인) 보안을 테스트하는 것은 잘못된 안도감을 줍니다. AI 가 데이터를 조회하기 위해 도구를 사용할 때, 그것은 완전히 경계를 풀고 맙니다.

이에 대응하는 방어 방법

논문의 연구진들은 여러 방어 수단을 테스트했고, 단일한 '은탄 (silver bullet)'은 효과가 없으나 조합은 도움이 된다는 사실을 발견했습니다.

  1. 읽기 전용 접근 (최고의 방어): AI 와 공격자 모두 지도를 읽기만 하고 쓰기는 할 수 없도록 지식 그래프를 잠그는 것입니다. 이렇게 하면 공격 자체가 불가능해집니다. 이것이 가장 효과적인 해결책입니다.
  2. 교차 검증: AI 가 지도를 실제 코드 파일과 같은 제 2 의 출처와 대조하도록 강제하면 거짓을 찾아낼 수 있습니다. 지도는 "안전하다"고 하지만 코드 파일은 "취약하다"고 말하면, AI 는 혼란을 겪고 지도를 신뢰하는 것을 멈춥니다.
  3. '악마의 변호인' 역할: "이 데이터가 가짜일 수 있지 않나?"라고 AI 에게 묻는 것은 도움이 되지만, 어떻게 가짜일 수 있는지에 대해 매우 구체적으로 질문해야 합니다. 단순히 "확실합니까?"라고 묻는 것은 일반적으로 효과가 없습니다.
  4. 이력 추적: 지도에서 변경된 사항을 로그로 기록하면 새로운 가짜 항목을 탐지하는 데 도움이 되지만, 공격자가 기존 항목의 세부 사항을 단순히 수정하는 경우는 잡아내지 못합니다.

요약

오라클 중독은 AI 자체를 해킹하는 것이 아니라, AI 가 신뢰하는 데이터를 오염시키는 새로운 유형의 해킹입니다. AI 는 논리를 따르는 데 매우 능하기 때문에, 거짓말이라는 기초 위에 카드 집을 즐겁게 쌓아 올립니다. 이 논문은 실제 환경에서 신뢰할 수 있는 도구 채널을 통해 전달된다면 테스트된 거의 모든 AI 모델이 이러한 거짓말을 믿을 것이며, 유일한 확실한 해결책은 AI 가 자신의 지식 베이스에 쓸 수 없도록 막는 것이라고 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →