← नवीनतम पेपर
💬 NLP

MAPLE: Metadata Augmented Private Language Evolution

यह शोध पत्र MAPLE का प्रस्ताव करता है, जो एक नवीन ढांचा है जो इनिशियलाइजेशन बाधाओं को दूर करने के लिए डिफरेंशियल प्राइवेट टैबुलर मेटाडेटा और इन-कॉन्टेक्स्ट लर्निंग का लाभ उठाकर API-एक्सेसिबल LLMs के लिए डिफरेंशियल प्राइवेट लैंग्वेज इवोल्यूशन को बढ़ाता है, जिससे मौजूदा तरीकों की तुलना में बेहतर प्राइवेसी-यूटिलिटी ट्रेड-ऑफ, तेज़ कन्वर्जेंस और कम API लागत प्राप्त होती है।

मूल लेखक: Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz

प्रकाशित 2026-03-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान किताबों का पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो लगभग सब कुछ जानता है। आप अपने नोट्स के एक गुप्त, निजी संग्रह (आपके निजी डेटा) के आधार पर कहानियों का एक नया सेट लिखना चाहते हैं। हालाँकि, आप अपने नोट्स को सीधे कॉपी नहीं कर सकते क्योंकि इससे आपके रहस्य लीक हो सकते हैं। आप यह भी नहीं कर सकते कि लाइब्रेरी को अपने आंतरिक नियमों को बदलने के लिए कहें ताकि वह आपके नोट्स से सीख सके, क्योंकि लाइब्रेरी एक कंपनी के स्वामित्व वाला "ब्लैक बॉक्स" है, और वे आपको उसके पुर्जों को छूने की अनुमति नहीं देंगे।

यह समस्या है जिसे MAPLE हल करता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए।

समस्या: "अनुवाद में खो जाने वाला" अनुमान लगाने का खेल

पहले, प्राइवेट इवोल्यूशन (PE) नामक एक विधि थी। इसे "टेलीफोन" के खेल के एक ट्विस्ट की तरह समझें।

  1. शुरुआत: आप लाइब्रेरी से कहते हैं, "कुछ भी के बारे में मुझे एक कहानी लिखकर दो।" लाइब्रेरी एक सामान्य कहानी निकालती है (शायद पिज्जा के बारे में)।
  2. इवोल्यूशन (विकास): आप अपने गुप्त नोट्स देखते हैं (जो, मान लीजिए, जापानी रेस्तरां के बारे में हैं)। आप लाइब्रेरी से कहते हैं, "वह पिज्जा वाली कहानी बहुत अलग है। इसे मेरे नोट्स की तरह बनाने के लिए फिर से लिखो।"
  3. लूप (चक्र): लाइब्रेरी फिर से कोशिश करती है। आप देखते हैं, सुधार करते हैं, और फिर से पूछते हैं।

खामी: यदि आपके गुप्त नोट्स जापानी रेस्तरां के बारे में हैं और लाइब्रेरी एक कहानी के साथ शुरू होती है जो पिज्जा के बारे में है, तो लाइब्रेरी गलत ग्रह से शुरुआत कर रही है। "पिज्जा" से "सुशी" तक पहुँचने के लिए उसे हजारों छोटे, महंगे समायोजन करने होंगे। इसमें बहुत समय लगता है, बहुत पैसा खर्च होता है (API कॉल), और अंतिम परिणाम अभी भी थोड़ा अजीब हो सकता है।

समाधान: MAPLE (द "मेटाडेटा जीपीएस")

लेखकों ने महसूस किया कि समस्या "टेलीफोन" का खेल नहीं थी; समस्या शुरुआती बिंदु थी। उन्हें खेल शुरू होने से पहले लाइब्रेरी को एक बेहतर मानचित्र देने की आवश्यकता थी।

उन्होंने MAPLE (मेटाडेटा ऑगमेंटेड प्राइवेट लैंग्वेज इवोल्यूशन) बनाया। यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "चीट शीट" (मेटाडेटा एक्सट्रैक्शन)

लाइब्रेरी को केवल एक खाली पन्ना देने के बजाय, वे पहले आपके गुप्त नोट्स को देखते हैं और एक संरचित चीट शीट (मेटाडेटा) बनाते हैं।

  • उदाहरण: कल्पना कीजिए कि आपके गुप्त नोट्स 1,000 रेसिपी का एक बिखरा हुआ ढेर हैं। लाइब्रेरी को वह बिखरा हुआ ढेर दिखाने के बजाय, आप उन्हें जल्दी से एक व्यवस्थित स्प्रेडशीट में व्यवस्थित करते हैं: "50% इटालियन हैं, 30% मैक्सिकन हैं, 20% वीगन हैं, औसत खाना पकाने का समय 30 मिनट है।"
  • महत्वपूर्ण बिंदु: वे इसे निजी तौर पर करते हैं। वे एक विशेष प्राइवेसी शील्ड (डिफरेंशियल प्राइवेसी) का उपयोग करते हैं ताकि स्प्रेडशीट ऐसी हो कि कोई भी इसे रिवर्स-इंजीनियर करके आपके मूल व्यंजनों को न देख सके, लेकिन उसका सामान्य "स्वाद" बना रहे।

2. "संदर्भ संकेत" (इन-कॉन्टेक्स्ट लर्निंग)

वे केवल स्प्रेडशीट ही नहीं देते; वे लाइब्रेरी को कुछ उदाहरण जोड़े भी देते हैं।

  • उदाहरण: वे लाइब्रेरी से कहते हैं: "यहाँ टैको (उदाहरण) के लिए एक रेसिपी है और यहाँ उसका चीट शीट एंट्री (वीगन, मैक्सिकन) है। अब, इस नए चीट शीट एंट्री (इटालियन, पास्ता) को देखो और एक ऐसी कहानी लिखो जो उस वाइब (vibe) में फिट बैठे।"
  • यह लाइब्रेरी की उस क्षमता का उपयोग करता है जिससे वह बिना अपने दिमाग को फिर से प्रशिक्षित किए, उदाहरणों से तुरंत सीख सकती है।

3. "स्मार्ट स्टार्ट" (इनिशियलाइजेशन)

अब जब वे लाइब्रेरी से "टेलीफोन" गेम शुरू करने के लिए कहते हैं, तो वे यह नहीं कहते "कुछ भी लिखो।" वे कहते हैं:

"इस चीट शीट (ज्यादातर इटालियन, कुछ वीगन) और इन उदाहरणों के आधार पर, एक ऐसी कहानी लिखो जो इस प्रोफाइल में फिट बैठती हो।"

परिणाम: लाइब्रेरी "पिज्जा" से शुरू नहीं करती है। यह "पास्ता" से शुरू होती है। यह पहले से ही 90% रास्ते पर है!

यह क्यों मायने रखता है (लाभ)

  • गति: क्योंकि लाइब्रेरी लक्ष्य के करीब से शुरू होती है, इसे हजारों सुधार करने की आवश्यकता नहीं होती है। इसे सटीक परिणाम प्राप्त करने में कम कदम लगते हैं।
  • पैसा: हर बार जब आप लाइब्रेरी को कहानी फिर से लिखने के लिए कहते हैं, तो इसमें पैसा खर्च होता है। कम कदम उठाकर, MAPLE बहुत सारा पैसा बचाता है।
  • गुणवत्ता: अंतिम कहानियाँ आपके गुप्त नोट्स के बहुत अधिक सटीक होती हैं क्योंकि लाइब्रेरी दिशा का अनुमान लगाने में "खो" नहीं जाती है।
  • गोपनीयता: पूरी प्रक्रिया सुरक्षित है। चीट शीट गोपनीयता-सुरक्षित है, और अंतिम कहानियाँ किसी के साथ भी साझा करने के लिए सुरक्षित हैं।

बड़ी तस्वीर

MAPLE को एक अंधे कलाकार को पेंटिंग शुरू करने से पहले परिदृश्य का विस्तृत विवरण देने के रूप में समझें, बजाय इसके कि उन्हें अंदाज़ा लगाने दें और फिर हज़ार बार कहें "नहीं, वह पेड़ नहीं, वह कार है।"

यह स्ट्रक्चर्ड डेटा (वह व्यवस्थित स्प्रेडशीट) और क्रिएटिव टेक्स्ट (कहानी) के बीच के अंतर को पाटता है, जिससे हमें उच्च-गुणवत्ता वाला, निजी डेटा उत्पन्न करने की अनुमति मिलती है, बिना उस सुपर-कंप्यूटर के मालिक बने या गोपनीयता के नियमों को तोड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →