← नवीनतम पेपर
💻 computer science

A Unified Benchmark for Privacy-preserving Vector Search

यह शोधपत्र एक एकीकृत बेंचमार्क प्रस्तुत करता है जो गोपनीयता-संरक्षण वेक्टर खोज योजनाओं (SAP, EMVP, BNTM, और Tiptoe) की एक प्लेनटेक्स्ट बेसलाइन के विरुद्ध पहली निष्पक्ष, तुलनात्मक समीक्षा प्रदान करता है, जो चिकित्सकों को सबसे उपयुक्त परिनियोजन विकल्प चुनने में मार्गदर्शन करने के लिए गोपनीयता, प्रदर्शन और रिकॉल में उनके विशिष्ट समझौतों (trade-offs) को प्रकट करता है।

मूल लेखक: Anne-Marie Kermarrec, Rafael Pires, Mathis Randl, Martijn de Vos

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anne-Marie Kermarrec, Rafael Pires, Mathis Randl, Martijn de Vos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अरबों गानों के एक विशाल पुस्तकालय में एक विशिष्ट गाना खोजने की कोशिश कर रहे हैं। आप कुछ धुनें गुनगुनाते हैं, और एक सुपर-स्मार्ट लाइब्रेरियन तुरंत जान जाता है कि आपका मतलब किस गाने से है और वह आपको वह गाना थमा देता है। आधुनिक "वेक्टर सर्च" (vector search) कंप्यूटर के लिए ठीक इसी तरह काम करता है: यह आपके सवालों और दस्तावेजों को गणितीय बिंदुओं (वेक्टर्स) में बदल देता है और सबसे करीबी मिलान खोज लेता है। यह मूवी रिकमेंडेशन से लेकर उन चैटबॉट्स तक सब कुछ संचालित करता है जो दस्तावेजों का उपयोग करके आपके सवालों के जवाब देते हैं। लेकिन यहाँ एक पेच है: लाइब्रेरियन को अपना काम करने के लिए, उसे आपकी गुनगुनाहट और पूरे पुस्तकालय, दोनों को देखना पड़ता है। इसका मतलब है कि लाइब्रेरियन यह पता लगा सकता है कि आप क्या खोज रहे हैं, या आपके खोजने के तरीके से पुस्तकालय के रहस्यों को भी फिर से बना सकता है।

इसे रोकने के लिए, वैज्ञानिकों ने "प्राइवेसी-प्रिजर्विंग" (privacy-preserving) यानी गोपनीयता बनाए रखने वाले नुस्खे ईजाद किए हैं। कुछ ऐसे हैं जैसे आपने अपनी गाने की रिक्वेस्ट को एक ऐसे उलझे हुए लिफाफे में रखा हो जिसे लाइब्रेरियन बिना खोले भी छाँट सके। अन्य ऐसे हैं जैसे आपने पूरे पुस्तकालय को एक अटूट तिजोरी में रख दिया हो जहाँ लाइब्रेरियन केवल बंद बक्सों पर गणितीय गणना कर सकता है, बिना उनकी सामग्री को देखे। समस्या यह है कि हर वैज्ञानिक जिसने एक नया नुस्खा ईजाद किया है, वह अपनी प्रयोगशाला में, अपने नियमों के साथ, अपने पुस्तकालय के आकार के साथ और अपनी घड़ी के साथ उसका परीक्षण करता है। यह एक फॉर्मूला 1 कार की गति की तुलना एक साइकिल की गति से करने जैसा है, लेकिन एक परीक्षण ढलान वाली सड़क पर किया गया था और दूसरे का परीक्षण कीचड़ भरे मैदान में। आप यह नहीं बता सकते कि कौन सा वाहन वास्तव में बेहतर है।

यह शोध पत्र एक अंतिम रेफरी की भूमिका निभाता है। शोधकर्ताओं ने एक एकल, निष्पक्ष परीक्षण मैदान बनाया जहाँ उन्होंने चार अलग-अलग प्राइवेसी तकनीकों को एक मानक, अनएन्क्रिप्टेड (unencrypted) सर्च के खिलाफ मुकाबला कराया। उन्होंने हर टेस्ट के लिए बिल्कुल एक ही लाइब्रेरी, बिल्कुल एक ही सवाल और बिल्कुल एक ही कंप्यूटर हार्डवेयर का उपयोग किया। उनका लक्ष्य एक सरल प्रश्न का उत्तर देना था: "यदि मैं अपने डेटा को निजी रखना चाहता हूँ, तो मेरी खोज कितनी धीमी हो जाएगी, और क्या यह इसके लायक है?"

परिणाम "हैरान कर देने वाले रूप से सस्ते" और "महंगे लेकिन आवश्यक" के मिश्रण थे। शोधकर्ताओं ने पाया कि यह विचार कि "प्राइटेसी का उपयोग करना बहुत धीमा है" ज्यादातर एक मिथक है, लेकिन यह पूरी तरह से इस पर निर्भर करता है कि आपको कितनी प्राइवेसी चाहिए।

सबसे पहले, "लाइटवेट" (lightweight) तकनीक है जिसे SAP कहा जाता है। कल्पना कीजिए कि आपने अपनी गाने की रिक्वेस्ट पर थोड़ा सा स्टैटिक शोर डाल दिया है ताकि लाइब्रेरियन सटीक धुन न सुन सके, लेकिन वे फिर भी यह बता सकें कि दो गाने एक जैसे सुनाई देते हैं या नहीं। यह तरीका अविश्वसनीय रूप से तेज़ है; यह लगभग उसी गति से चलता है जिस गति से अनएन्क्रिप्टेड सर्च चलता है। पेच यह है कि लाइब्रेरियन अभी भी आपके पुस्तकालय के सामान्य आकार को देख सकता है। वे यह जान सकते हैं कि कौन से गाने एक-दूसरे के समान हैं, भले ही वे आपकी विशिष्ट रिक्वेस्ट को पूरी तरह से न सुन सकें। यदि आप केवल अपनी विशिष्ट क्वेरी को छिपाना चाहते हैं, तो यह एक बेहतरीन सौदा है, लेकिन यदि आप पुस्तकालय के लेआउट को छिपाना चाहते हैं तो नहीं।

फिर, "भारी कवच" (heavy armor) वाले तरीके हैं जैसे EMVP और BNTM। ये ऐसे हैं जैसे आपने पूरे पुस्तकालय को एक जादुई तिजोरी में रख दिया हो जहाँ लाइब्रेरियन केवल बंद बक्सों पर गणित कर सकता है। लाइब्रेरियन गानों या आपकी रिक्वेस्ट के बारे में बिल्कुल कुछ नहीं जान पाता। यह बहुत मजबूत प्राइवेसी है, लेकिन इसकी एक कीमत है। एक मानक कंप्यूटर पर, ये तरीके अनएन्क्रिप्टेड सर्च की तुलना में लगभग 4 गुना धीमे हैं। यदि आप लाइब्रेरियन के ऑपरेशन्स को सत्यापित करने के लिए एक फीचर जोड़ते हैं (BNTM), तो यह और भी धीमा हो जाता है, लगभग 22 गुना धीमा

अंत में, "अल्टीमेट प्राइवेसी" (ultimate privacy) वाला तरीका है जिसे Tiptoe कहा जाता है। यह न केवल गानों और रिक्वेस्ट को छिपाता है, बल्कि यह भी छिपा देता है कि आप पुस्तकालय के किस हिस्से को देख रहे हैं। लाइब्रेरियन को यह सुनिश्चित करने के लिए कि वे आपके लक्ष्य को उजागर न करें, हर एक सवाल के लिए पूरे पुस्तकालय की जांच करनी पड़ती है। यह सबसे मजबूत सुरक्षा है, लेकिन यह सबसे महंगा भी है। यह अनएन्क्रिप्टेड सर्च की तुलना में लगभग 190 गुना धीमा है।

शोधकर्ताओं ने इन तरीकों का शक्तिशाली ग्राफिक्स कार्ड (GPUs) पर भी परीक्षण किया, जो आमतौर पर चीजों को तेज करने के लिए बेहतरीन होते हैं। आश्चर्यजनक रूप से, GPUs ने केवल तेज़ तरीकों (अनएन्क्रिप्टेड और लाइटवेट SAP) की मदद की। भारी कवच वाले तरीकों के लिए, GPUs ने चीजों को धीमा कर दिया या कोई मदद नहीं की। ऐसा इसलिए है क्योंकि ये तरीके इस बात से सीमित हैं कि वे मेमोरी से डेटा कितनी तेज़ी से पढ़ सकते हैं, न कि इस बात से कि वे गणित कितनी तेज़ी से कर सकते हैं।

संक्षेप में, यह पेपर साबित करता है कि आपको प्राइवेसी और स्पीड के बीच चुनाव करने की आवश्यकता नहीं है, लेकिन आपको अपनी प्राइवेसी के स्तर का चुनाव करना होगा। यदि आप केवल अपनी क्वेरी छिपाना चाहते हैं, तो एक तेज़, हल्का तरीका बिना किसी प्राइवेसी के लगभग उतना ही प्रभावी है। यदि आप पूरे पुस्तकालय की संरचना को छिपाना चाहते हैं, तो आपको गति का एक महत्वपूर्ण दंड भुगतना होगा, लेकिन यह अभी भी चलाना संभव है। पुराना विश्वास कि "एन्क्रिप्टेड सर्च उपयोगी होने के लिए बहुत धीमा है" गलत साबित हुआ है; यह बस सही उपकरण चुनने और उसके ट्रेड-ऑफ (समझौते) को समझने की बात है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →