← नवीनतम पेपर
💬 NLP

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

यह शोध पत्र DP-Fusion का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक टोकन-स्तरीय डिफरेंशियल प्राइवेट इन्फरेंस तंत्र है, जो आउटपुट पर संवेदनशील संदर्भ टोकनों के प्रभाव को प्रमाणित रूप से सीमित करता है ताकि मौजूदा विधियों की तुलना में काफी बेहतर गोपनीयता और उपयोगिता ट्रेड-ऑफ के साथ उच्च-गुणवत्ता वाली दस्तावेज़ गोपनीयता सक्षम की जा सके।

मूल लेखक: Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, बातूनी रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो दस्तावेज़ों का सारांश बनाने में आपकी मदद करता है। कभी-कभी, उन दस्तावेज़ों में गुप्त जानकारी हो सकती है, जैसे किसी मरीज़ का नाम, कोई विशिष्ट तिथि, या बैंक खाता संख्या। आप चाहते हैं कि रोबोट कहानी का सारांश तो बनाए, लेकिन गलती से उन रहस्यों को उजागर न कर दे।

समस्या यह है कि वर्तमान रोबोट इस मामले में खराब हैं। यदि आप उन्हें सिर्फ यह कहते हैं कि "नाम मत बताओ," तो वे भ्रमित हो सकते हैं और अर्थहीन शब्द लिख सकते हैं। यदि आप उन्हें "इसे अच्छे से फिर से लिखने" के लिए कहते हैं, तो वे अनजाने में रहस्य को प्रकट करने में चूक सकते हैं।

DP-FUSION से मिलिए: "सीक्रेट-सेफ" ब्लेंडर

लेखकों ने DP-FUSION नामक एक नई विधि बनाई है। इसे एक विशेष टेक्स्ट ब्लेंडर (मिश्रण करने वाला यंत्र) की तरह समझें जो यह गारंटी देता है कि रहस्य छिपे रहें जबकि कहानी पढ़ने योग्य बनी रहे। यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

परिदृश्य: कहानी के दो संस्करण

कल्पना कीजिए कि आपके पास "मिसेज स्मिथ" के बारे में एक मेडिकल रिपोर्ट है जिनका बिल $345.25 था।

  1. मूल कहानी (Original Story): इसमें "मिसेज स्मिथ" नाम और सटीक बिल राशि शामिल है।
  2. संशोधित कहानी (Redacted Story): आप एक मार्कर लेते हैं और "मिसेज स्मिथ" और "$345.25" को मिटा देते हैं, उन्हें खाली स्थानों जैसे [NAME] और [AMOUNT] से बदल देते हैं।

DP-FUSION कैसे काम करता है (ब्लेंडर प्रक्रिया)

केवल एक संस्करण या दूसरे को चुनने के बजाय, DP-FUSION एक चतुर नृत्य करता है:

  1. रोबोट को दो बार चलाएं:

    • पहले, यह रोबोट को संशोधित कहानी (सुरक्षित संस्करण) का उपयोग करके अगले शब्द की भविष्यवाणी करने के लिए कहता है। यह एक "सुरक्षित" अनुमान देता है।
    • दूसरा, यह रोबोट को मूल कहानी (गुप्त संस्करण) का उपयोग करके अगले शब्द की भविष्यवाणी करने के लिए कहता है। यह एक "जोखिम भरा" अनुमान देता है जो रहस्य लीक कर सकता है।
  2. "प्राइवेसी डायल" (ब्लेंडर का नॉब):

    • सिस्टम में एक डायल है जिसे ϵ\epsilon (एप्सिलॉन) कहा जाता है।
    • डायल को पूरा नीचे घुमाने पर (Low ϵ\epsilon): ब्लेंडर दोनों अनुमानों को इतनी गहराई से मिलाता है कि "जोखिम भरा" रहस्य "सुरक्षित" अनुमान द्वारा लगभग पूरी तरह से दबा दिया जाता है। रोबोट "एक मरीज" कह सकता है बजाय "मिसेज स्मिथ" के। यह बहुत निजी है, लेकिन कहानी थोड़ी सामान्य लग सकती है।
    • डायल को ऊपर घुमाने पर (High ϵ\epsilon): ब्लेंडर "जोखिम भरे" अनुमान को अधिक मात्रा में बाहर आने देता है। रोबोट "मिसेज स्मिथ" कह सकता है यदि यह संदर्भ में फिट बैठता है। कहानी बेहतर लगती है, लेकिन इस बात की थोड़ी संभावना रहती है कि कोई रहस्य निकल जाए।
  3. गारंटी:

    • DP-FUSION का जादू यह है कि यह गणितीय रूप से सिद्ध करता है कि कोई भी हैकर चाहे कितनी भी कोशिश क्यों न करे, उनकी सफलता की संभावना इस डायल पर सेट की गई सेटिंग द्वारा सख्ती से सीमित है। भले ही हैकर को पता हो कि ब्लेंडर कैसे काम करता है, वे रहस्य का पता नहीं लगा सकते।

यह मौजूदा तरीकों से बेहतर क्यों है?

पेपर अन्य विधियों के साथ DP-FUSION की तुलना करता है:

  • "स्क्रबर" (NER): यह ब्लैक मार्कर से रहस्यों को काटने जैसा है। यह सुरक्षित है, लेकिन यह टेक्स्ट में बदसूरत छेद छोड़ देता है, जिससे इसे पढ़ना कठिन हो जाता है (कम उपयोगिता)।
  • "पैराफ्रेसर" (प्रॉम्प्ट इंजीनियरिंग): यह रोबोट को "इसे अच्छे से फिर से लिखने" के लिए कहने जैसा है। यह सुनने में अच्छा लगता है, लेकिन रोबोट अक्सर अनजाने में रहस्य प्रकट कर देता है क्योंकि उसे सावधानी बरतने के लिए मजबूर नहीं किया गया था।
  • DP-FUSION: यह सबसे सटीक संतुलन है। यह टेक्स्ट के प्रवाह को सुचारू रखता है (उच्च गुणवत्ता) और गणितीय रूप से गारंटी देता है कि रहस्य छिपे रहेंगे।

परिणाम

शोधकर्ताओं ने वास्तविक कानूनी और चिकित्सा दस्तावेज़ों पर इसका परीक्षण किया। उन्होंने पाया कि:

  • गुणवत्ता: DP-FUSION द्वारा उत्पन्न टेक्स्ट अन्य गोपनीयता विधियों की तुलना में बहुत अधिक स्वाभाविक और पठनीय था। वास्तव में, यह अगली सर्वश्रेष्ठ गोपनीयता विधि से 6 गुना बेहतर था (परप्लेक्सिटी के संदर्भ में, जो टेक्स्ट के भ्रमित होने का एक माप है)।
  • सुरक्षा: यहाँ तक कि जब हैकर्स ने छिपे हुए नामों या तिथियों का अनुमान लगाने की कोशिश की, तो वे लगभग उतना ही असफल रहे जितना कि वे रैंडम अनुमान लगाते समय होते।
  • बोनस सुरक्षा: यह विधि "जेलब्रेक" हमलों को रोकने में भी मदद करती है, जहाँ हैकर्स रोबोट को उसके नियमों को अनदेखा करने के लिए बहलाने की कोशिश करते हैं। संदिग्ध इनपुट को "संवेदनशील टोकन" के रूप में मानकर, ब्लेंडर उनके प्रभाव को कम कर देता है, जिससे रोबोट सुरक्षित रहता है।

संक्षेप में

DP-FUSION संवेदनशील दस्तावेज़ों का सारांश बनाने के लिए AI का उपयोग करने का एक नया तरीका है। यह एक स्मार्ट ब्लेंडर की तरह कार्य करता है जो टेक्स्ट के "सुरक्षित" संस्करण को "वास्तविक" संस्करण के साथ मिलाता है, जिसे एक प्राइवेसी डायल द्वारा नियंत्रित किया जाता है। यह सुनिश्चित करता है कि नाम या तारीख जैसे रहस्य गणितीय रूप से छिपे रहें, जबकि परिणामी कहानी उच्च-गुणवत्ता वाली और पढ़ने में आसान बनी रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →