← 최신 논문
🤖 AI

P2^2RAG: Efficient Privacy-Preserving RAG Service Supporting Arbitrary Top-kk Retrieval

본 논문은 안전한 정렬 없이 임의의 상위-k 검색을 지원하기 위해 상호작용 이분법과 비밀 분할을 활용하여 기존 시스템 대비 상당한 속도 향상을 달성하면서도 데이터와 사용자 프롬프트를 보호하는 효율적인 프라이버시 보호형 검색 증강 생성 서비스인 P2^2RAG를 제안한다.

원저자: Yulong Ming, Mingyue Wang, Jijia Yang, Jie Xu, Zihan Wu, Cong Wang, Xiaohua Jia

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yulong Ming, Mingyue Wang, Jijia Yang, Jie Xu, Zihan Wu, Cong Wang, Xiaohua Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

방문자 여러분, 의료 기록, 법적 계약서, 또는 재무 보고서와 같은 방대하고 비밀스러운 문서 라이브러리가 있다고 상상해 보세요. 그리고 이 라이브러리를 이용해 질문에 답하고 싶다고 가정해 봅시다. 하지만 이 라이브러리 전체를 검색 엔진 회사에 넘기고 싶지는 않습니다. 너무 민감한 정보이기 때문입니다. 동시에 검색 엔진이 정확히 무엇을 질문하는지 알기를 원하지도 않습니다. 이는 여러분의 사적인 생각이나 비즈니스 전략을 드러내기 때문입니다.

이것이 바로 P2RAG가 해결하는 문제입니다. P2RAG는 "비밀 문서를 이용해 질문에 답하는 AI"라는 화려한 용어로 불리는 "검색 증강 생성 (Retrieval-Augmented Generation, RAG)" 서비스를 아무도 비밀을 엿보지 못하게 하는 새로운 방식으로 실행하는 방법입니다.

다음은 이를 단순한 개념으로 분해하여 설명한 작동 원리입니다:

1. 구식 방식: 전체 덱 정렬하기

각각 점수가 적힌 1,000 장의 카드 덱이 있다고 상상해 보세요. 여러분은 점수가 가장 높은 상위 10 장의 카드를 찾고 싶습니다.

  • 문제: 이전의 보안 시스템에서는 상위 10 장을 찾기 위해 컴퓨터가 모든 카드를 서로 비교하여 높은 점수부터 낮은 점수까지 비밀리에 정렬해야 했습니다. 이는 마치 군중 속에서 가장 키 큰 사람을 찾기 위해 모든 사람을 줄 세우고 하나씩 측정하는 것과 같지만, 아무도 그 측정 결과를 볼 수 없는 방식으로 수행됩니다.
  • 병목 현상: 상위 10 장 대신 상위 100 장을 원한다면, 이 "정렬" 과정은 극도로 느리고 비용이 많이 들게 됩니다. 이는 마치 5 권의 가장 좋은 책을 찾기 위해 도서관의 모든 책을 정렬하려는 것과 같습니다. 책이 많을수록 시간이 더 오래 걸립니다.

2. P2RAG 해결책: "임계값 추측하기" 게임

P2RAG는 게임을 바꿉니다. 전체 덱을 정렬하는 대신, **차단선 (cutoff line)**을 찾기 위해 "뜨겁고 차가운 (Hot and Cold)" 게임 (구체적으로 이진 탐색 또는 "이분법") 을 플레이합니다.

  • 준비: 두 개의 서버 (서버 A 와 서버 B 라고 부르겠습니다) 가 비밀 라이브러리를 보유하고 있다고 가정해 보세요. 이 서버들은 각 문서를 반으로 나누어 어떤 서버도 전체 내용을 알지 못하도록 합니다. 사용자 (여러분) 도 질문을 반으로 나누어 각 서버에 한 조각씩 보냅니다.
  • 게임 진행:
    1. 서버에게 질문합니다: "이 특정 수준으로 기준을 설정할 때, 내 질문과 충분히 유사한 문서는 몇 개나 됩니까?"
    2. 서버들은 어떤 문서들이 일치하는지 알려주지 않고 점수도 보이지 않은 채 일치하는 개수만 셉니다. 그들은 단순히 "50 개가 일치합니다"라고 말합니다.
    3. 여러분은 생각합니다: "나는 10 개만 원했는데, 너무 많네. 기준을 높여야겠다."
    4. 더 높은 기준으로 다시 질문합니다. 그들은 말합니다: "이제 5 개만 일치합니다."
    5. 여러분은 생각합니다: "너무 적네. 기준을 조금 낮춰야겠다."
    6. 여러분은 개수가 정확히 필요한 수 (예: 10 개) 가 될 때까지 기준을 오가며 조정합니다.

마법 같은 점: 여러분은 전체 라이브러리를 정렬할 필요가 없이 단순히 "기준선"을 조정하고 개수를 세기만 하면 됩니다. 올바른 높이로 기준선을 찾기만 하면 됩니다. 이로 인해 과정이 극도로 빨라지며, 1,000 개의 문서와 같이 엄청난 수의 결과를 원하더라도 마찬가지입니다.

3. 비밀 보호 (신뢰하지 않는 규칙)

이 논문은 이 시스템이 서버가 "정직하지만 호기심이 많은 (규칙은 따르지만 엿보려 함)" 경우나 사용자가 "악의적 (시스템을 속이려 함)"인 경우에도 안전하다고 주장합니다.

  • 호기심 많은 서버에 대해: 데이터가 분할 (비밀 공유) 되어 있기 때문에, 서버 A 는 무작위로 뒤섞인 숫자만 보고, 서버 B 는 또 다른 무작위 뒤섞인 숫자만 봅니다. 두 서버가 합세하지 않는 한 어느 쪽도 문서나 질문을 재구성할 수 없습니다. 논문은 그들이 합세하지 않을 것이라고 가정합니다 (예: 서로 다른 나라에 있는 두 개의 다른 회사).
  • 교활한 사용자에게 대해: 교활한 사용자는 기준을 너무 낮게 설정하도록 서버에게 요청하여 모든 문서가 일치하게 만들고, 결과적으로 전체 라이브러리를 훔치려 할 수 있습니다. P2RAG는 질문 횟수에 "속도 제한"을 두고, 허용된 문서만 얻을 수 있도록 수학을 검증합니다. 이는 나쁜 사용자가 훔칠 수 있는 정보량을 엄격히 제한합니다.

4. 이것이 중요한 이유 (결과)

저자들은 이 시스템을 테스트하여 다음과 같은 결과를 발견했습니다:

  • 속도: 많은 수의 문서 (16 개에서 1,024 개까지) 를 검색하고자 할 때, 현재 가장 우수한 보안 시스템보다 3 배에서 300 배까지 빠릅니다.
  • 유연성: 여러분은 임의의 수 (arbitrary k) 의 결과를 요청할 수 있습니다. 이는 많은 컨텍스트를 확인해야 올바른 답을 얻을 수 있는 금융이나 법률 분야와 같은 분야에서 매우 중요합니다.
  • 정확도: 이 시스템은 비보안 시스템이 찾을 것과 정확히 동일한 문서를 찾아낼 정도로 정밀하며, 거의 수학적 오류가 없습니다.

결론

P2RAG는 방대하고 잠긴 금고에서 특정 문서를 찾아내되, 책을 보여주기 위해 금고 문을 열지 않고, 여러분이 금고 안의 다른 책들을 보지 못하게 하는 보안성이 뛰어나고 고속인 사서와 같습니다. 이는 전체 컬렉션을 정렬하는 대신 "차단점"을 찾기 위한 스마트한 추측 게임을 수행함으로써, 현실 세계에서 유용할 정도로 속도를 높인 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →