← नवीनतम पेपर
🤖 machine learning

Towards Differentially Private Reinforcement Learning with General Function Approximation

यह शोधपत्र सामान्य फलन सन्निकटन (general function approximation) के साथ विभेदक रूप से निजी ऑनलाइन सुदृढीकरण शिक्षण (differentially private online reinforcement learning) के लिए प्रथम सैद्धांतिक गारंटी प्रस्तुत करता है, जो बैच किए गए नीति अपडेट और एक्सपोनेंशियल मैकेनिज्म के एक नवीन संयोजन के माध्यम से O~(K3/5)\widetilde{O}(K^{3/5}) रिग्रेट बाउंड प्राप्त करता है और साथ ही पूर्व रैखिक सेटिंग्स में अंतराल को स्पष्ट करता है।

मूल लेखक: Yi He, Xingyu Zhou

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi He, Xingyu Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखा रहे हैं। रोबोट अलग-अलग चालें चलकर, यह देखकर कि क्या होता है, और अंक (इनाम) प्राप्त करके सीखता है। समय के साथ, वह बेहतर होता जाता है। यह रीइन्फोर्समेंट लर्निंग (RL) है।

हालाँकि, वास्तविक दुनिया में, यह रोबोट केवल एक गेम नहीं खेल रहा है; यह आपके साथ बातचीत कर रहा है। शायद यह एक चैटबॉट है जो आपकी पसंद सीख रहा है, या एक मेडिकल एआई (AI) जो मरीजों का इलाज करने का तरीका सीख रहा है। हर बार जब रोबोट आपके साथ बातचीत करता है, तो वह आपके रहस्यों के बारे में कुछ सीखता है: आपका स्वास्थ्य इतिहास, आपकी व्यक्तिगत पसंद, या आपके निजी विचार।

समस्या क्या है? मानक सीखने के तरीके एक ऐसे शिक्षक की तरह हैं जो व्हाइटबोर्ड पर हर छात्र के नाम के साथ उनकी गलतियाँ लिख देता है। अंततः, कोई भी बोर्ड को देख सकता है और ठीक से पता लगा सकता है कि किसने कौन सी गलती की थी। यह एक प्राइवेसी लीक (गोपनीयता का उल्लंघन) है।

बड़ी चुनौती: प्राइवेसी बनाम सीखने की गति

वैज्ञानिक इस समस्या को डिफरेंशियल प्राइवेसी (DP) की एक अवधारणा का उपयोग करके ठीक करने की कोशिश कर रहे हैं। DP को शिक्षक के नोट्स में थोड़ा सा "स्टैटिक" या "शोर" (noise) जोड़ने के रूप में सोचें ताकि कोई यह न बता सके कि विशेष रूप से किस छात्र ने क्या किया, लेकिन पूरी कक्षा सामूहिक रूप से सही उत्तर सीख सके।

लेकिन यहाँ एक पेंच है: यदि आप गोपनीयता की रक्षा के लिए बहुत अधिक शोर जोड़ते हैं, तो रोबोट बहुत धीरे सीखता है। यदि आप बहुत कम शोर जोड़ते हैं, तो वह तेजी से सीखता है लेकिन रहस्य लीक कर देता है।

लंबे समय तक, वैज्ञानिक केवल बहुत सरल खेलों (जैसे कुछ वर्गों वाला एक ग्रिड) या बहुत सरल नियमों (लीनियर) वाले खेलों के लिए यह सिद्ध कर सके कि यह प्राइवेसी ट्रिक काम करती है। लेकिन आधुनिक एआई (जैसे कि आज के चैटबॉट्स) जटिल, नॉन-लीनियर (गैर-रैखिक) खेल खेलते हैं। पुराने गणित जटिल परिदृश्यों के लिए काम नहीं करते थे।

यह पेपर क्या करता है

यह पेपर सबसे पहले यह सिद्ध करता है कि आप उपयोगकर्ता के रहस्यों को सुरक्षित रखते हुए, सीखने की गति से बहुत अधिक समझौता किए बिना, रोबोट को जटिल खेल सिखा सकते हैं।

उन्होंने इसे तीन तरकीबों का उपयोग करके किया है:

1. "बैचिंग" रणनीति (ग्रुप फोटो)

कल्पना कीजिए कि रोबोट हर एक छात्र के बोलने के बाद कक्षा की एक फोटो लेकर सीखता है। यदि आप प्राइवेसी की रक्षा करना चाहते हैं, तो आपको हर बार फोटो को धुंधला (blur) करना होगा। 1,000 फोटो को धुंधला करना बहुत मेहनत का काम है और यह फोटो की गुणवत्ता को खराब कर देता है।

इसके बजाय, यह पेपर सुझाव देता है: एक पूरा समूह (एक "बैच") होने तक प्रतीक्षा करें और फिर एक फोटो लें।

  • यह कैसे काम करता है: रोबोट उपयोगकर्ताओं के साथ कुछ समय तक बातचीत करता है, सारा डेटा एकत्र करता है, और फिर पूरे समूह के लिए एक बार अपनी रणनीति अपडेट करता है।
  • लाभ: आपको "प्राइवेसी नॉइज़" (गोपनीयता का शोर) केवल कुछ ही बार जोड़ना पड़ता है (प्रति बैच एक बार), जिससे सीखने की गति बहुत तेज रहती है जबकि गोपनीयता भी बनी रहती है।

2. "एक्सपोनेंशियल मैकेनिज्म" (भारित लॉटरी)

आमतौर पर, जब एक रोबोट सीखता है, तो वह अब तक मिली सबसे अच्छी चाल चुनता है। लेकिन सबसे अच्छी चाल चुनना प्राइवेसी के लिए खतरनाक है क्योंकि यह प्रकट करता है कि डेटा वास्तव में कैसा दिखता था।

इसके बजाय, यह पेपर एक भारित लॉटरी (Weighted Lottery) का उपयोग करता है:

  • कल्पना कीजिए कि रोबमान के पास संभावित रणनीतियों की एक सूची है।
  • यह कुछ अतिरिक्त टिकट "सर्वश्रेष्ठ" रणनीतियों को देता है, लेकिन यह कुछ "ठीक-ठाक" रणनीतियों को भी टिकट देता है।
  • फिर यह इन टिकटों के आधार पर यादृच्छिक रूप से (randomly) एक रणनीति चुनता है।
  • परिणाम: रोबोट अभी भी अधिकांश समय एक बहुत अच्छी रणनीति चुनता है, लेकिन क्योंकि यह एक लॉटरी है, इसलिए कोई बाहरी व्यक्ति 100% निश्चित नहीं हो सकता कि किस विशिष्ट डेटा पॉइंट के कारण रोबोट ने वह रणनीति चुनी। यह यह अनुमान लगाने जैसा है कि कौन सा टिकट जीता है बिना यह जाने कि किसने टिकट खरीदा है।

3. "स्कोरकार्ड" (भ्रमित करने वाले नियमों का अंत)

अतीत में, जटिल खेलों को निजी तौर पर सिखाने के लिए, वैज्ञानिकों ने एक "कॉन्फिडेंस मैप" (एक जटिल नियम पुस्तिका जिसमें लिखा हो "मैं इस बारे में 90% आश्वस्त हूँ") बनाने की कोशिश की थी। इन मानचित्रों को प्राइवेसी शोर के साथ सुरक्षित रखना कठिन होता है।

यह पेपर मानचित्र को छोड़ देता है। इसके बजाय, यह एक सरल स्कोरकार्ड का उपयोग करता है:

  • यह प्रत्येक संभावित रणनीति को एक स्कोर देता है कि उसने कितना अच्छा प्रदर्शन किया और उसने कितनी खोज (exploration) की।
  • फिर यह इन स्कोरों पर भारित लॉटरी (चरण 2 से) चलाता है।
  • यह बहुत सरल है और इसे सुरक्षित रखना आसान है।

परिणाम: यह कितना तेज़ है?

यह पेपर गणितीय रूप से सिद्ध करता है कि यह तरीका काम करता है।

  • गति: रोबोट लगभग उतनी ही तेजी से सीखता है जितनी तेजी से सर्वश्रेष्ठ गैर-निजी रोबोट सीखते हैं। यदि रोबोट KK राउंड खेलता है, तो उसकी "गलतियाँ" लगभग K3/5K^{3/5} की दर से बढ़ती हैं (जो कुल राउंड की संख्या से बहुत कम है)।
  • तुलना: यह वही गति रिकॉर्ड है जो पहले केवल सरल, लीनियर खेलों के लिए संभव था। अब, यह जटिल, सामान्य खेलों के लिए भी काम करता है।

"लीनियर" दावों पर एक नोट

यह पेपर कुछ हालिया अध्ययनों की गलती की ओर भी इशारा करता है। कुछ अन्य शोधकर्ताओं ने दावा किया कि वे सरल खेलों के लिए (रणनीति को बहुत कम बार अपडेट करके) प्राइवेसी के साथ सीखने को और भी तेज़ (K\sqrt{K} की गति से) बना सकते हैं। इस पेपर के लेखक इस अध्ययन में एक खामी पाते हैं: उनके द्वारा जोड़ा गया प्राइवेसी शोर वास्तव में उनके "दुर्लभ अपडेट" वाले तर्क को तोड़ देता है। इसलिए, इस प्रकार की प्राइवेट लर्निंग के लिए K3/5K^{3/5} की गति वर्तमान में सबसे अच्छी सिद्ध गति है।

सारांश

साधारण शब्दों में: इस पेपर ने AI एजेंटों को जटिल कार्य (जैसे चैटबॉट्स या मेडिकल एडवाइजर्स) सिखाने का एक नया तरीका बनाया है जो उपयोगकर्ता की गोपनीयता का सम्मान करता है। यह ऐसा इसलिए करता है क्योंकि यह AI को अपडेट करने से पहले बातचीत को समूहों में इकट्ठा करता है, एक कठोर नियम के बजाय नई रणनीतियों को चुनने के लिए यादृच्छिक लॉटरी का उपयोग करता है, और यह सिद्ध करता है कि यह तरीका गणितीय रूप से सुरक्षित और कुशल है। यह हमें जासूसी किए बिना हमसे सीखने वाले AI बनाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →