← 최신 논문
🤖 AI

Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models

이 논문은 추론 과정 중 키-값(key-value) 캐시를 섭동시키는 것이 트랜스포머 언어 모델을 체계적으로 손상시킬 수 있음을 입증하는 프레임워크인 악성 토큰 주입(Malicious Token Injection, MTI)을 소개하며, 이를 통해 캐시 무결성이 LLM 보안에서 매우 중요하지만 이전에 간과되었던 취약점임을 밝힌다.

원저자: Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 언어 모델(LLM)을 아주 똑똑하고 빠르게 생각하는 학생이 긴 시험을 치르고 있다고 상상해 보세요. 질문에 답하기 위해 이 학생은 단순히 현재의 질문만 보는 것이 아니라, 답변의 일관성을 유지하기 위해 지금까지 써 내려간 모든 내용을 기억해야 합니다. AI의 세계에서 이 "기억"을 **KV 캐시(KV Cache)**라고 부릅니다. 이는 모델이 다음 단어를 쓸 때마다 책 전체를 다시 읽지 않아도 되도록 대화의 가장 중요한 부분들을 저장해 두는 디지털 메모장입니다.

*"Transformer의 메모리가 오염될 수 있는가?(Can Transformer Memory Be Corrupted?)"*라는 제목의 이 논문은 무섭지만 단순한 질문을 던집니다: 만약 누군가 학생이 시험을 치르는 동안 그 메모장에 몰래 낙서를 한다면 어떻게 될까?

다음은 일상적인 비유를 사용한 연구 결과의 요약입니다:

1. 숨겨진 약점: "보이지 않는" 메모장

보통 우리는 해커가 모델의 교과서(학습 데이터)를 바꾸거나 이상한 질문으로 속이는 것(프롬프트 인젝션)을 걱정합니다. 하지만 이 논문은 시스템을 망가뜨릴 수 있는 더 은밀하고 교활한 방법을 발견했습니다.

연구진은 "메모장"(KV 캐시)이 종종 보호받지 못한 채 방치되어 있다는 사실을 깨달았습니다. 설령 교과서와 시험 문제가 철저히 통제되고 있더라도, 모델을 실행 중인 컴퓨터 내부로 침입할 수 있는 공격자는 그 메모장 위의 숫자들을 미세하게 조작할 수 있습니다.

  • 비유: 복잡한 스튜를 요리하는 요리사를 상상해 보세요. 레시피는 안전하고 재료도 신선합니다. 하지만 만약 사보타주를 하는 사람이 요리사가 맛을 보는 동안 몰래 소금 한 꼬집을 설탕으로 바꾼다면, 레시피나 재료를 바꾸지 않았음에도 불구하고 요리 전체를 망칠 수 있습니다.

2. 공격 방식: "악의적 토큰 주입(Malicious Token Injection, MTI)"

저자들은 이를 테스트하기 위해 MTI V.1이라는 도구를 만들었습니다. 그들은 모델을 파괴한 것이 아니라, 단지 메모리를 "툭 건드린" 것입니다. 그들은 메모장을 망가뜨리기 위해 세 가지 주요 방법을 시도했습니다:

  • "정적" 자극 (가우시안 노이즈/Gaussian Noise): 라디오 볼륨을 약간 높여서 소리가 뭉개지는 것처럼, 메모리에 무작위적인 정적이나 잡음을 추가하는 것입니다.
  • "지우개" (제로잉/Zeroing): 메모의 특정 부분을 완전히 지워버리는 것으로, 마치 메모지의 일부를 빨간 마커로 지워버리는 것과 같습니다.
  • "뒤틀기" (회전/Rotation): 메모를 옆으로 돌려버리는 것입니다. 정보는 여전히 존재하지만 방향이 잘못되어 모델을 혼란에 빠뜨립니다.

3. 결과: 작은 자극, 거대한 혼란

연구진은 인기 있는 AI 모델(GPT-2 및 LLaMA-2 등)을 대상으로 테스트했습니다. 그들은 메모리에 가해진 아주 작고 거의 보이지 않는 변화조차 큰 문제를 일으킨다는 것을 발견했습니다:

  • 혼란: 모델이 말해서는 안 될 단어를 추측하기 시작했습니다. 확신이 떨어지고 사실을 지어내는 현상(환각)이 더 자주 발생했습니다.
  • 과업 실패:
    • 단순 과업: 문장이 행복한지 슬픈지 맞히라는 질문을 받았을 때, 모델은 혼란을 느껴 틀리기 시작했습니다.
    • 복잡한 과업: 긴 문서에서 특정 사실을 찾아내라는 요청(예: 퀴즈)을 받았을 때, 모델은 완전히 실패했습니다. 마치 학생이 질문 읽는 법 자체를 잊어버린 것과 같았습니다.
    • "에이전트" 테스트: AI가 일련의 단계(예: 항공권 예약)를 계획하는 로봇 역할을 수행할 때, 메모리 오염은 모델이 길을 잃고 잘못된 행동을 선택하게 만들었습니다.

4. "왜" 발생하는가: 전파의 원리

논문은 이 수학적 원리를 간단하게 설명합니다. AI는 자신의 메모리를 보고 다음에 올 단어를 결정합니다. 만약 메모리가 약간이라도 잘못되면, AI의 주의력(Attention)이 쏠리는 방향이 바뀝니다.

  • 비유: 당신이 붐비는 방에서 친구를 찾으려고 한다고 상상해 보세요. 당신은 지도(메모리)를 보고 있습니다. 만약 누군가 지도 위에 아주 작은 잘못된 선 하나를 그었다면, 당신은 엉뚱한 구석을 보게 될 것입니다. 일단 엉뚱한 구석을 보게 되면, 남은 밤의 계획 전체가 무너집니다. 이 논문은 이러한 "작은 선들"이 수학적으로 AI의 주의력을 왜곡시킨다는 것을 증명합니다.

5. 해결할 수 있는가? (방어책)

연구진은 이 공격을 막을 수 있는지 확인하기 위해 몇 가지 빠른 해결책을 시도했습니다:

  • 메모장 비우기: 주기적으로 메모리를 깨끗이 지우는 것입니다.
  • 메모 무작위화: 메모의 일부를 무작위로 숨겨서 모델이 여전히 추측할 수 있는지 확인하는 것입니다.
  • 노이즈 평활화: 숫자들을 평균 내어 "정적"을 제거하는 것입니다.

결론: 이러한 해결책들은 어느 정도 도움이 되었지만, 마법 같은 해결책은 아니었습니다. 그것들은 최악의 피해를 막아주기는 했지만, 공격이 강력하거나 지속적으로 발생할 경우 모델은 여전히 실패했습니다. 이는 마치 상처에 반창고를 붙이는 것과 같습니다. 도움이 되긴 하지만, 공격자가 계속해서 칼질을 한다면 상처가 깊어지는 것을 막을 수는 없습니다.

핵심 요약

이 논문은 AI가 고장 났으니 사용을 중단하라고 말하는 것이 아닙니다. 대신, AI를 구축하고 보호하는 사람들에게 경종을 울리고 있습니다.

주요 시사점: 우리는 AI의 "두뇌"(학습 데이터)와 "입"(입력 프롬프트)을 보호하는 데는 매우 능숙해졌지만, AI의 "단기 기억"(KV 캐시)은 대체로 간과해 왔습니다. 만약 공격자가 AI를 실행 중인 컴퓨터 내부로 들어올 수 있다면, 코드 한 줄 바꾸지 않고도 메모리를 오염시켜 AI를 신뢰할 수 없게 만들거나, 혼란스럽게 하거나, 위험하게 만들 수 있습니다.

저자들은 이 "메모장"을 시스템의 나머지 부분만큼이나 엄격하게 보호해야 할 핵심 안전 구역으로 취급하는 새로운 종류의 보안이 필요하다고 촉구하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →