← नवीनतम पेपर
📊 statistics

Synthetic Data for any Differentiable Target

यह शोधपत्र डेटासेट पॉलिसी ग्रेडिएंट (DPG) प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो सटीक डेटा एट्रिब्यूशन का उपयोग करके सिंथेटिक डेटा जनरेटरों को अनुकूलित करती है ताकि सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से लक्षित भाषा मॉडलों के गुणों को सटीक रूप से नियंत्रित और आकार दिया जा सके, यहाँ तक कि उन उद्देश्यों के लिए भी जो जनरेटर के प्रॉम्प्ट्स में स्पष्ट रूप से मौजूद नहीं होते हैं।

मूल लेखक: Tristan Thrush, Sung Min Park, Herman Brunborg, Luke Bailey, Marcel Roed, Neil Band, Christopher Potts, Tatsunori Hashimoto

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tristan Thrush, Sung Min Park, Herman Brunborg, Luke Bailey, Marcel Roed, Neil Band, Christopher Potts, Tatsunori Hashimoto

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (जेनरेटर) हैं जो एक ऐसा केक (टारगेट मॉडल) बनाने की कोशिश कर रहे हैं जिसका स्वाद बिल्कुल उस गुप्त रेसिपी जैसा हो जो आपके दिमाग में है। आमतौर पर, शेफ बस रैंडम सामग्री डाल देते हैं और उम्मीद करते हैं कि सब ठीक हो जाएगा। लेकिन यह पेपर इस तरह से खाना पकाने का एक क्रांतिकारी नया तरीका पेश करता है: "फ्लेवर-फीडबैक लूप" (Flavor-Feedback Loop)।

यहाँ बताया गया है कि यह कैसे काम करता है, कुछ रचनात्मक उपमाओं (analogies) का उपयोग करके।

1. समस्या: अंधेरे में खाना बनाना

सामान्यतः, यदि आप चाहते हैं कि कोई मॉडल एक विशिष्ट ट्रिक सीखे (जैसे स्पेनिश बोलना या एक गुप्त कोड छिपाना), तो आपको मैन्युअल रूप से हजारों उदाहरण लिखने होंगे। यह एक कुत्ते को "बैठो!" चिल्लाकर सिखाने जैसा है और यह उम्मीद करना कि वह अंततः समझ जाएगा।

यदि आप इन उदाहरणों को बनाने के लिए रीइन्फोर्समेंट लर्निंग (रिवॉर्ड्स से सीखने का मानक तरीका) का उपयोग करने का प्रयास करते, तो आपको पूरे केक के बेक होने तक इंतजार करना पड़ता, फिर पूरे केक को चखना पड़ता, और फिर कहना पड़ता, "यह बैच अच्छा था, वह वाला बुरा था।" लेकिन चूंकि आप प्रति बैच केवल एक बार ही केक चख सकते हैं, इसलिए आपको बहुत कम फीडबैक मिलता है। यह रेडियो के नॉब को हर घंटे केवल एक बार घुमाने और संगीत बेहतर होने का इंतजार करने जैसा है। यह बहुत धीमा और महंगा है।

2. समाधान: "फ्लेवर-फीडबैक लूप" (DPG)

लेखकों ने डेटासेट पॉलिसी ग्रेडिएंट (DPG) नामक एक विधि बनाई है। इसे ऐसे समझें जैसे शेफ को एक जादुई चखने वाला चम्मच दिया गया है जो केक ओवन में जाने से पहले ही उसकी हर एक सामग्री को चख सकता है।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

  • शेफ (जेनरेटर): AI सिंथेटिक टेक्स्ट उदाहरणों (जैसे अलग-अलग तरीकों से लिखे गए विकिपीडिया लेख) की एक सूची बनाता है।
  • चखने वाला चम्मच (मेटाग्रेडिएंट): अंतिम केक बनने का इंतजार करने के बजाय, सिस्टम केक के एक छोटे से टुकड़े को बनाने का अनुकरण (simulate) करता है जिसमें केवल एक सामग्री होती है। यह पूछता है: "यदि मैं इस विशिष्ट वाक्य को ट्रेनिंग डेटा में जोड़ दूँ, तो यह अंतिम परिणाम में कितना सुधार करेगा?"
  • स्कोर: यह "टेस्ट टेस्ट" हर एक वाक्य को एक स्कोर देता है।
  • फीडबैक: शेफ को हर उस वाक्य के लिए रिवॉर्ड मिलता है जिसका स्वाद अच्छा होता है। यदि कोई वाक्य अंतिम मॉडल को गुप्त ट्रिक सीखने में मदद करता है, तो शेफ को उच्च स्कोर मिलता है और वह उस तरह के अधिक वाक्य लिखना सीख जाता है।

3. जादुई करतब (उन्होंने क्या हासिल किया)

पेपर दिखाता है कि यह "फ्लेवर-फीडबैक लूप" इतना शक्तिशाली है कि शेफ को अजीब, छिपे हुए गुणों वाले केक बनाने के लिए मजबूर किया जा सकता है, भले ही उसे ऐसा करने के लिए कभी कहा न गया हो।

  • QR कोड केक: लेखकों ने सिस्टम को एक विशिष्ट गणितीय पैटर्न के लिए ऑप्टिमाइज़ करने के लिए कहा। परिणाम क्या हुआ? शेफ ने विकिपीडिया लेखों की एक सूची बनाई जो, जब एक मॉडल को ट्रेन करने के काम आती है, तो मॉडल के आंतरिक "ब्रेन वेट्स" (brain weights) को भौतिक रूप से एक स्कैन करने योग्य QR कोड में व्यवस्थित कर देती है। यह एक ऐसा केक बनाने जैसा है जहाँ स्प्रिंकल्स (sprinkles), एक विशिष्ट कोण से देखने पर, एक बारकोड बनाते हैं।
  • "67" वाला केक: उन्होंने सिस्टम से मॉडल के दिमाग में संख्या "67" को एम्बेड करने के लिए कहा। शेफ ने ऐसे लेख लिखना सीखा जिन्हें प्रोसेस करने पर मॉडल के आंतरिक नंबर "67" लिखने के लिए संरेखित (align) हो जाते।
  • भाषा परिवर्तन: उन्होंने मॉडल को स्पेनिश के लिए अपने "भाषा भ्रम" (language confusion) स्कोर को कम करने के लिए कहा। भले ही शेफ को केवल अंग्रेजी लेखों को फिर से लिखने के लिए दिया गया था, शेफ ने उन्हें पूरी तरह से स्पांइश में लिखना सीख लिया, क्योंकि "टेस्ट टेस्ट" पर उच्च स्कोर पाने का यही एकमात्र तरीका था।
  • गुप्त UUID: उन्होंने मॉडल को एक विशिष्ट, रैंडम नंबर स्ट्रिंग (UUID) को पहचानने के लिए कहा। शेफ ने उस सटीक स्ट्रिंग वाले टेक्स्ट को उत्पन्न करना सीखा, भले ही स्ट्रिंग का निर्देशों में कभी उल्लेख नहीं किया गया था।

4. गुप्त सामग्री: "Adam" ऑप्टिमाइज़र

पेपर ने एक महत्वपूर्ण विवरण खोजा: इस लूप के भीतर इस जादू को सफल बनाने के लिए, "बेकिंग प्रक्रिया" को Adam नामक एक विशिष्ट प्रकार के ओवन का उपयोग करने की आवश्यकता है। यदि वे एक मानक ओवन (SGD) का उपयोग करते, तो जादू काम नहीं करता। यह महसूस करने जैसा है कि एक सूफ़ले (soufflé) बनाने के लिए, आपको अनिवार्य रूप से एक कन्वेक्शन ओवन का उपयोग करना होगा; एक साधारण ओवन काम नहीं करेगा। यह सुझाव देता है कि मॉडल जिस तरह से सीखता है (ऑप्टिमाइज़र), वह डेटा स्वयं जितना महत्वपूर्ण है, उतना ही महत्वपूर्ण है।

यह क्यों मायने रखता है (दोधारी तलवार)

अच्छा: यह AI सुरक्षा और कस्टमाइजेशन के लिए एक सुपरपावर है। हम सैद्धांतिक रूप से ऐसा ट्रेनिंग डेटा जेनरेट कर सकते हैं जो मॉडल्स को अधिक ईमानदार, अधिक रचनात्मक, या बेहतर गणित सिखा सके, बिना लाखों उदाहरणों को हाथ से तैयार किए।

बुरा: यह हैकर्स के लिए भी एक सुपरपावर है। यदि कोई हमलावर इस पद्धति का उपयोग कर सकता है, तो वे ऐसा "जहरीला" (poisoned) ट्रेनिंग डेटा जेनरेट कर सकते हैं जो पूरी तरह से सामान्य दिखता है (जैसे बिल्ली के बारे में विकिपीडिया लेख), लेकिन गुप्त रूप से मॉडल को सुरक्षा नियमों को अनदेखा करने, निजी डेटा लीक करने, या बाद में बुरा व्यवहार करने के लिए सिखाता है। यह एक स्वादिष्ट कुकी के अंदर छिपी हुई ज़हरीली गोली जैसा है।

निष्कर्ष

यह पेपर साबित करता है कि अब हम केवल ट्रेनिंग डेटा को बदलकर AI मॉडल्स के "DNA" को सटीक रूप से इंजीनियर कर सकते हैं। हमें मॉडल के कोड या उसके आर्किटेक्चर को बदलने की आवश्यकता नहीं है; हमें बस उसे सही "सिंथेटिक भोजन" खिलाने की आवश्यकता है, और मॉडल बिल्कुल वैसे ही विकसित होगा जैसा हम चाहते हैं—भले ही हम चाहते हों कि वह अपने दिमाग में QR कोड छिपाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →