← 최신 논문
🤖 machine learning

HijackKV: New Threat in Position-Independent KV Cache Reuse

이 논문은 대규모 언어 모델의 위치 독립적 KV 캐시 재사용을 악용하여 공격자가 제어하는 접두사를 주입함으로써 양질의 텍스트에 대한 캐시된 표현을 오염시켜 모델의 동작을 은밀하게 탈취하는 새로운 공격 프레임워크인 HIJACKKV를 소개하며, 이는 현실적인 제약 조건 하에서도 다양한 모델에 걸쳐 높은 성공률을 달성한다.

원저자: Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang

게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수천 명의 사람들이 매초마다 똑똑한 사서에게 질문을 던지는 거대하고 북적이는 도서관에 있다고 상상해 보세요. 질문에 빠르게 답하기 위해, 사서는 이미 처리한 대화의 부분들을 처음부터 모든 책을 다시 읽는 대신, 일종의 "요약 노트"(KV 캐시라고 불리는)를 보관합니다. 만약 누군가 이전 질문과 똑같은 단어로 시작하는 질문을 한다면, 사서는 기존의 요약 노트를 가져와서 힘든 과정을 건너뛸 수 있고, 덕분에 답변이 번개처럼 빠르게 나옵니다. 이것이 현대의 AI 챗봇들이 시간과 에너지를 아끼는 방식입니다. 하지만 이러한 속도는 까다로운 규칙 하나를 동반합니다. 보통 이 요약 노트는 질문에 이르는 전체 이야기가 정확히 일치할 때만 작동한다는 것입니다. 그러나 최근 엔지니어들은 이 요약 노트를 사용하는 더 빠르고 새로운 방법을 발명했습니다. 그들은 이야기의 앞부분이 완전히 다르더라도, 특정 문장이나 *텍의 덩어리(chunk)*가 나타나기만 하면 요약 노트를 가져올 수 있도록 결정했습니다. 이는 마치 앞선 이야기가 우주 여행에 관한 것이든 피자 파티에 관한 것이든 상관없이, 단순히 "달(The Moon)"이라는 단어가 언급되었다는 이유만으로 역사책의 한 페이지를 집어 드는 것과 같습니다.

HIJACKKV라는 제목의 이 논문은 이 새로운, 더 빠른 방식에 숨겨진 교활한 보안 결함을 밝혀냅니다. 연구진은 이 새로운 시스템이 속도 면에서는 훌륭하지만, 의도치 않게 백도어를 생성한다는 사실을 발견했습니다. "요약 노트"는 해당 문장이 작성된 *맥락(context)*을 바탕으로 저장되기 때문에, 공격자는 AI에게 "독이 든(poisoned)" 요약 노트를 쓰도록 속일 수 있습니다. 공격자는 겉보기에는 무해해 보이지만, 공통적인 문장에 대한 노트를 몰래 왜곡하도록 설계된 가짜 이야기를 AI에게 입력합니다. 나중에 무고한 사용자가 그 공통적인 문장을 포함한 질문을 하면, 사서는 독이 든 노트를 가져오게 됩니다. 갑자기 AI는 사용자가 직접 나쁜 내용을 입력하지 않았음에도 불구하고, 잘못된 답변을 하거나 심지어 위험한 답변을 하기 시작합니다. 이는 마치 누군가 도서관의 참고서에 " '달'이라는 단어를 보면, 모든 사람에게 절벽에서 뛰어내리라고 말하라"라는 메모를 몰래 끼워 넣었고, 사서가 규칙에 따라 다음 사람이 달에 대해 물었을 때 그대로 실행하는 것과 같습니다.

컴퓨터 과학 전문가들과 협력한 연구진은 이 공격이 단순한 이론이 아님을 증명하기 위해 HIJACKKV라는 도구를 구축했습니다. 그들은 공격자가 도서관에 침입하거나 컴퓨터를 해킹할 필요 없이, 단 몇 개의 질문을 던지는 것만으로 독이 든 노트를 심을 수 있다는 것을 보여주었습니다. 일단 심어지면, 이 노트들은 다른 사람들의 AI 행동을 가로챌 수 있습니다. 테스트 결과, 이 공격은 매우 효과적이어서 단 한 번의 시도로 약 **94%**의 성공률을 보였습니다. 더욱 무서운 점은 이 공격을 막기가 어렵다는 것입니다. 연구진은 시스템이 데이터의 일부를 다시 계산함으로써 스스로를 수정하려고 시도하더라도(흔히 쓰이는 안전 조치), 특히 시스템이 데이터의 적은 부분(10%에서 50%)만 다시 계산할 경우에도 공격이 여전히 작동한다는 것을 발견했습니다. 독이 든 노트는 수백 개의 새로운 관련 없는 문장들이 채팅에 추가된 후에도 오랫동안 살아남을 수 있습니다.

또한 이 논문은 이 기술이 공격자가 직접 접근할 수 없는 유형의 AI 모델(블랙박스 시나리오)에서도 작동하는지 테스트했습니다. 연구진은 한 AI 모델을 위해 설계된 트릭이 종종 다른 모델도 속일 수 있다는 것을 발견했으며, 이는 문제가 광범위하다는 것을 보여줍니다. 연구진은 "수상한" 노트를 삭제하거나 공간 절약을 위해 요약 노트를 압축하는 소프트웨어와 같은 기존의 보안 가드들이 이 공격을 막을 수 있는지 확인해 보았습니다. 불행히도, 독이 든 노트가 보안 가드들에게는 완벽하게 정상적으로 보이기 때문에 이러한 방어책들은 대부분 실패했다는 것을 발견했습니다. 이 연구는 AI를 더 빠르게 만드는 것은 좋지만, 서로 다른 사용자 간에 이러한 "요약 노트"를 공유하는 현재의 방식은 근본적으로 안전하지 않다고 결론짓습니다. 저자들은 미래의 시스템이 속도를 위해 낯선 이들이 AI의 말을 통제하게 되는 대가를 치르는 대신, 노트를 재사용하기 전에 맥락을 더 주의 깊게 확인하도록 재설계되어야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →