← 최신 논문
💬 NLP

Knowledge Packs: Zero-Token Knowledge Delivery via KV Cache Injection

이 논문은 RAG 의 토큰 낭비 문제를 해결하기 위해 사전 계산된 KV 캐시를 직접 주입하여 0 토큰 비용으로 지식을 전달하고 모델 행동을 제어할 수 있는 'Knowledge Packs'를 제안합니다.

원저자: Andrey Pustovit

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Andrey Pustovit

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 방식 (RAG) 의 문제: "매번 다시 설명하는 비효율"

지금까지 AI 에게 정보를 알려줄 때 (예: "이 회사의 매출은 얼마야?") 는 검색해서 찾은 긴 글 (문서) 을 AI 에게 매번 다시 읽어주었습니다.

  • 비유: 당신이 친구에게 "내 친구 민수는 키가 180cm 야"라고 알려주고 싶다고 상상해 보세요.
    • 기존 방식 (RAG): 친구가 기억을 못 하니까, 민수에 대한 긴 프로필 (이름, 나이, 키, 취미, 좋아하는 음식 등) 을 글로 적어서 친구에게 다시 읽어주는 거예요.
    • 문제점: 친구가 5 번이나 다른 질문을 한다면, 당신은 5 번이나 그 긴 프로필을 다시 읽어줘야 합니다. 말 (토큰) 이 너무 많이 소모되고, 친구의 머릿속 (메모리) 이 금방 꽉 차버립니다.

2. 새로운 방식 (지식 팩): "기억 조각 (KV Cache) 을 바로 끼우기"

이 논문은 "아니, 굳이 글로 다시 읽힐 필요 없잖아?"라고 말합니다. 대신 AI 가 그 글을 이미 읽었을 때 머릿속에 생긴 **완성된 기억 조각 (KV Cache)**을 미리 만들어 두었다가, 질문이 들어오면 그 조각을 바로 끼워 넣는 것입니다.

  • 비유: 친구가 민수에 대한 프로필을 이미 읽어서 기억하고 있다면, 당신은 그 긴 글을 다시 읽히지 않아도 됩니다. 대신 **"민수 = 180cm"라는 기억이 담긴 작은 카드 (기억 조각)**를 친구의 책상 위에 바로 올려놓으면 됩니다.
  • 효과:
    • 비용 0: 친구에게 다시 읽어줄 필요가 없으니, 말 (토큰) 을 전혀 쓰지 않습니다.
    • 정확도 100%: 기억 조각을 끼워 넣으면, 글로 다시 읽어준 것과 완전히 똑같은 대답을 합니다. (논문에 따르면 700 번의 테스트에서 오차 0%)
    • 한계: 이 기억 조각은 특정 AI 모델 (친구) 에만 맞습니다. A 모델용 카드를 B 모델에 끼우면 작동하지 않습니다. (친구마다 기억하는 방식이 조금 다르기 때문)

3. 중요한 주의사항: "말투 (템플릿) 를 맞춰줘야 한다"

이 기술이 작동하려면 아주 중요한 규칙이 하나 있습니다. 바로 AI 가 좋아하는 '말투 (Chat Template)'를 지켜야 한다는 것입니다.

  • 비유: 당신이 친구에게 카드를 줄 때, "여기 카드 있어"라고 그냥 던지면 친구가 무시할 수 있습니다. 하지만 "친구야, 이거 받아봐"라고 정중한 인사말 (시스템 토큰) 과 함께 주면 친구가 바로 받아들입니다.
  • 결과: 말투를 맞추지 않고 그냥 텍스트만 주면, AI 는 "이게 뭐지?"라고 혼란을 느껴 정답률이 6~7% 나 떨어집니다. 이전 연구들 중 "기억 조각이 더 좋다"고 한 건, 사실 말투를 잘못 맞춰서 비교한 경우가 많았을 수 있다고 논문은 지적합니다.

4. 추가 기능: "성격 조절 (Steering)"

이 기술은 지식 전달뿐만 아니라 AI 의 성격이나 말투를 조절하는 데에도 쓸 수 있습니다.

  • 비유: 기억 조각을 끼워 넣을 때, 단순히 정보만 넣는 게 아니라 **"조금 더 조심스럽게 말해줘"**라는 신호 (벡터) 를 함께 섞어 넣는 것입니다.
  • 신기한 점:
    • 중간층 효과: AI 의 뇌 (레이어) 중 중간 부분만 건드리면 성격이 바뀝니다. 처음이나 마지막 부분을 건드리면 효과가 없습니다.
    • 동시 사용: "지식"을 전달하는 것과 "성격"을 조절하는 것을 동시에 할 수 있습니다. (예: "민수에 대해 알려주면서, 동시에 예의 바르게 말해줘")
    • 결과: 지식 전달의 정확성은 그대로 유지하면서, AI 가 더 정중하거나 방어적인 태도를 취하게 만들 수 있습니다.

5. 요약: 왜 이것이 중요한가요?

  1. 돈과 시간 절약: AI 에게 정보를 줄 때 긴 글을 다시 읽히지 않아도 되므로, 토큰 비용 (비용) 을 95% 까지 아낄 수 있습니다.
  2. 정확한 기억: 기억 조각을 끼워 넣으면, 글로 읽힌 것과 완전히 똑같은 결과를 냅니다.
  3. 새로운 가능성: 단순히 정보를 넣는 것을 넘어, AI 의 말투나 태도를 조절할 수 있는 새로운 방법을 제시합니다.

한 줄 요약:

"AI 에게 정보를 줄 때, 긴 글을 다시 읽어주는 대신 '기억 조각'을 바로 끼워 넣으면, 비용은 0 이고 정확도는 그대로 유지됩니다. 다만, AI 가 좋아하는 '말투'를 맞춰서 주어야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →