← नवीनतम पेपर
🤖 machine learning

Gradient Transformer: Learning to Generate Updates for LLMs

यह शोधपत्र ग्रेडिएंट ट्रांसफॉर्मर (Gradient Transformer) को प्रस्तुत करता है, जो एक डेटा-मुक्त नॉलेज डिस्टिलेशन फ्रेमवर्क है जो सीमित कंप्यूटेशनल संसाधनों वाले संगठनों को निजी डेटा पर फाइन-ट्यून किए गए छोटे भाषा मॉडलों (tiny language models) के अपडेट वेक्टर्स को रूपांतरित करके प्रभावी एलएलएम (LLM) अपडेट वेक्टर्स उत्पन्न करने में सक्षम बनाता है, जिससे संवेदनशील जानकारी को उजागर किए बिना सुरक्षित, बहु-संगठनात्मक सहयोग सुगम होता है।

मूल लेखक: Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे व्यवसाय के मालिक हैं जो अपने विशिष्ट, निजी ग्राहक डेटा का उपयोग करने के लिए एक सुपर-स्मार्ट एआई असिस्टेंट (एक "लार्ज लैंग्वेज मॉडल" या "LLM") का उपयोग करना चाहते हैं। लेकिन एक पेंच है: आप इस विशाल एआई को अपने रहस्य सिखाने के लिए आवश्यक भारी कंप्यूटर शक्ति का खर्च नहीं उठा सकते, और आप गोपनीयता कानूनों के कारण अपना निजी डेटा किसी अजनबी के क्लाउड पर नहीं भेज सकते।

दूसरी ओर, आप अपने स्वयं के कंप्यूटर पर एक बहुत ही छोटे, हल्के एआई ("TinyLM") को प्रशिक्षित करने का खर्च उठा सकते हैं। लेकिन यह छोटा एआई अपने दम पर भारी काम करने के लिए पर्याप्त स्मार्ट नहीं है।

समस्या: आपके पास एक छोटा, स्मार्ट-लेकिन-छोटा एआई है जो आपके रहस्यों को जानता है, और एक विशाल, शक्तिशाली एआई है जो कुछ नहीं जानता। आपको विशाल एआई को वह सिखाना है जो छोटे वाले ने सीखा है, बिना कभी अपने निजी डेटा को विशाल एआई को दिखाए।

समाधान: "ग्रेडिएंट ट्रांसफार्मर" (The Gradient Transformer)
लेखकों ने एक चतुर मध्यस्थ बनाया है जिसे ग्रेडिएंट ट्रांसफार्मर कहा जाता है। इसे एक "लर्निंग अपडेट्स" (सीखने के अपडेट्स) के लिए सार्वभौमिक अनुवादक के रूप में सोचें।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "लर्निंग नोट्स" (अपडेट वेक्टर्स)

जब आप अपने निजी डेटा पर अपने छोटे एआई को प्रशिक्षित करते हैं, तो वह केवल "सीखता" नहीं है; वह अपने आंतरिक मस्तिष्क की वायरिंग में विशिष्ट, सूक्ष्म समायोजन करता है। शोध पत्र इन समायोजनों को "अपडेट वेक्टर्स" (update vectors) कहता है।

  • उपमा: कल्पना करें कि आपका छोटा एआई एक पाठ्यपुस्तक पर नोट्स ले रहा छात्र है। "अपडेट वेक्टर" वह विशिष्ट सुधारों की सूची है जो छात्र सही उत्तर पाने के लिए हाशिए (margins) में लिखता है। यह स्वयं पाठ्यपुस्तक (आपका निजी डेटा) नहीं है; यह केवल वे बदलाव हैं जो छात्र ने अपने मस्तिष्क में किए हैं।

2. अनुवादक (The Gradient Transformer)

लेखकों ने एक विशेष एआई अनुवादक (ग्रेडिएंट ट्रांसफार्मर) बनाया है। यह अनुवादक सार्वजनिक डेटा (जैसे ओपन-सोर्स पाठ्यपुस्तकें) पर प्रशिक्षित किया गया है ताकि वह एक "छात्र के नोट्स" और एक "प्रोफेसर के नोट्स" के बीच के संबंध को समझ सके।

  • यह कैसे सीखता है: शोधकर्ताओं ने सार्वजनिक डेटा लिया, उस पर एक छोटा एआई और एक विशाल एआई प्रशिक्षित किया, और देखा कि उनके "नोट्स" (अपडेट वेक्टर्स) में क्या अंतर था। उन्होंने अनुवादक को सिखाया: "जब एक छोटा एआई यह विशिष्ट परिवर्तन करता है, तो विशाल एआई को वह विशिष्ट संबंधित परिवर्तन करने की आवश्यकता होती है।"
  • जादू: अनुवादक सीखने के पैटर्न को सीखता है, डेटा की सामग्री को नहीं।

3. स्थानांतरण (निजी डेटा लीक नहीं होता)

अब, आपके व्यवसाय पर वापस आते हैं:

  1. आप अपने निजी डेटा पर अपने छोटे एआई को प्रशिक्षित करते हैं।
  2. आप अपने छोटे एआई से "नोट्स" (अपडेट वेक्टर्स) निकालते हैं।
  3. आप केवल नोट्स सेवा प्रदाता को भेजते हैं। आप अपना निजी डेटा नहीं भेजते हैं।
  4. सेवा प्रदाता आपके "नोट्स" को ग्रेडिएंट ट्रांसफार्मर में फीड करता है।
  5. अनुवादक तुरंत विशाल एआई के लिए नोट्स का एक नया सेट तैयार करता है। ये नोट्स विशाल एआई को बताते हैं कि उसे अपने मस्तिष्क को कैसे समायोजित करना है ताकि वह ठीक वैसा ही हो सके जैसा आपके छोटे एआई ने सीखा था, लेकिन इसे विशाल आकार में स्केल किया गया है।
  6. विशाल एआई इन नए नोट्स का उपयोग करके खुद को अपडेट करता है।

यह एक बड़ी बात क्यों है?

  • गोपनीयता सर्वोपरि: विशाल एआई आपके निजी डेटा को कभी नहीं देखता। वह केवल सीखने के गणितीय "आकार" को देखता है, वास्तविक सामग्री को नहीं।
  • लागत प्रभावी: आपको विशाल एआई को प्रशिक्षित करने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है। आपको केवल एक छोटे कंप्यूटर की आवश्यकता है जिससे आप छोटे एआई को प्रशिक्षित कर सकें।
  • टीम वर्क: यदि दस अलग-अलग कंपनियों के पास अपने निजी डेटा पर प्रशिक्षित अपने स्वयं के छोटे एआई हैं, तो वे सभी अपने नोट्स को अनुवादक को भेज सकते हैं। अनुवादक उन्हें एक सुपर-विशाल एआई बनाने के लिए संयोजित कर सकता है जो उन सभी दस कंपनियों के सामूहिक ज्ञान को जानता हो, बिना किसी कंपनी द्वारा अपने रहस्यों को साझा किए।

परिणाम

शोधकर्ताओं ने गणित की समस्याओं, सामान्य समझ (common sense reasoning), और बातचीत का सारांश निकालने जैसे कार्यों पर इसका परीक्षण किया।

  • अकेला छोटा एआई ठीक था लेकिन बहुत अच्छा नहीं था।
  • सीधे प्रशिक्षित विशाल एआई (यदि आप इसे वहन कर सकते) सबसे अच्छा था।
  • ग्रेडिएंट ट्रांसफार्मर ने छोटे एआई के "नोट्स" को लिया और उन्हें एक ऐसे विशाल एआई में बदल दिया जो लगभग उतना ही अच्छा प्रदर्शन करता है जितना कि यदि उसे सीधे निजी डेटा पर प्रशिक्षित किया गया होता, लेकिन बिना कभी डेटा देखे।

वास्तव में, जब छोटे एआई को सख्त गोपनीयता सुरक्षा (डेटा को छिपाने के लिए शोर/noise जोड़ना) के साथ प्रशिक्षित किया गया था, तब भी अनुवादक विशाल एआई के लिए उच्च-गुणवत्ता वाले अपडेट उत्पन्न करने में सक्षम था, जो यह साबित करता है कि यह सुरक्षित और मजबूत है।

संक्षेप में: ग्रेडिएंट ट्रांसफार्मर एक जादुई पुल है जो एक छोटे, निजी एआई को एक विशाल, सार्वजनिक एआई को यह सिखाने की अनुमति देता है कि वह कैसे स्मार्ट बने, बिना कभी उन रहस्यों को उजागर किए जो उसने सीखे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →