← नवीनतम पेपर
💬 NLP

Learning to Self-Evolve

यह शोध पत्र लर्निंग टू सेल्फ-इवॉल्व (LSE) को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो बड़े भाषा मॉडलों को परीक्षण के समय अपने स्वयं के संदर्भों को पुनरावृत्ति से परिष्कृत करने के लिए प्रशिक्षित करता है, जिससे एक 4B-पैरामीटर वाला मॉडल जटिल तर्क कार्यों पर काफी बड़े मॉडलों और मौजूदा अनुकूलन विधियों से बेहतर प्रदर्शन करने में सक्षम होता है।

मूल लेखक: Xiaoyin Chen, Canwen Xu, Yite Wang, Boyi Liu, Zhewei Yao, Yuxiong He

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyin Chen, Canwen Xu, Yite Wang, Boyi Liu, Zhewei Yao, Yuxiong He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़ी जिद्दी सहायक है। आप उसे एक काम देते हैं, वह अपना सर्वश्रेष्ठ प्रयास करता है, और फिर आप उससे कहते हैं, "हे, वह हिस्सा अच्छा था, लेकिन वह हिस्सा भ्रमित करने वाला था।"

आर्टिफिशियल इंटेलिजेंस की दुनिया में, अधिकांश मॉडल उन सहायकों की तरह हैं जो आपकी प्रतिक्रिया सुनते हैं, विनम्रता से सिर हिलाते हैं, और फिर अगले कार्य के शुरू होते ही उसे तुरंत भूल जाते हैं। वे स्थिर (static) हैं; वे केवल अधिक काम करके समय के साथ "स्मार्ट" नहीं होते हैं। वे केवल अपने शुरुआती प्रशिक्षण स्कूल के दौरान स्मार्ट होते हैं, और एक बार स्नातक होने के बाद, वे हमेशा के लिए वैसे ही रहते हैं।

यह पेपर एक नया फ्रेमवर्क पेश करता है जिसे लर्निंग टू सेल्फ-इवॉल्व (LSE) कहा जाता है। इसे उस सहायक को एक नई सुपरपावर सिखाने के रूप में समझें: अपनी गलतियों के आधार पर अपने स्वयं के निर्देश मैनुअल (instruction manual) को फिर से लिखने की क्षमता।

यह कैसे काम करता है, यहाँ रोजमर्रा के उदाहरणों के साथ समझाया गया है:

1. समस्या: "रिसेट बटन" (The "Reset Button")

कल्पना कीजिए कि एक शेफ एक हजार भोजन बनाता है। हर भोजन के बाद, ग्राहक फीडबैक देता है: "बहुत नमकीन है," "थोड़ा लहसुन चाहिए।"

  • पुराना AI: शेफ फीडबैक को एक नोटबुक में लिखता है, लेकिन फिर अगला भोजन बनाने से पहले उस नोटबुक को फेंक देता है। अगला भोजन बिल्कुल उसी तरह बनाया जाता है जैसे पहला वाला था, चाहे फीडबैक कुछ भी रहा हो।
  • लक्ष्य: हम एक ऐसा शेफ चाहते हैं जो नोटबुक को पढ़े, अगले भोजन से पहले रेसिपी को बदले, और हर बार बेहतर होता जाए।

2. समाधान: "लर्निंग टू सेल्फ-इवॉल्व" (LSE)

शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जहाँ AI केवल यह "अनुमान" नहीं लगाता कि उसे अपने निर्देशों में कैसे सुधार करना चाहिए; बल्कि वह खुद को एक मास्टर एडिटर बनने के लिए प्रशिक्षित (train) करता है।

  • "एडिट" प्रक्रिया: AI के दिमाग (इसके जटिल गणितीय भार/weights) को बदलने के बजाय, LSE संदर्भ (context) (प्रॉम्प्ट या निर्देश मैनुअल) को बदलता है। यह शेफ के दिमाग को फिर से वायर करने के बजाय रेसिपी कार्ड को एडिट करने जैसा है।
  • रिवॉर्ड सिस्टम (द "स्कोरकार्ड"): यही असली जादू है। आमतौर पर, आप एक AI को तब पुरस्कृत करते हैं जब वह उच्च स्कोर प्राप्त करता है (जैसे, "आपने 90% सही किया!")।
    • खामी: यदि AI के पास एक खराब रेसिपी (20% स्कोर) है और वह इसे थोड़ा बेहतर बनाता है (30%), तो एक मानक रिवॉर्ड सिस्टम इसे अनदेखा कर सकता है क्योंकि 30% अभी भी कम है। लेकिन यदि AI के पास एक परफेक्ट रेसिपी (90%) है और वह गलती से इसे खराब कर देता है (80%), तो उसे भारी दंड मिलता है।
    • LSE का समाधान: LSE सुधार (improvement) को पुरस्कृत करता है। यह पूछता है: "क्या आपने रेसिपी को उस स्थिति से बेहतर बनाया है जो इसे छूने से पहले थी?"
    • उपमा: एक गोल्फ कोच की कल्पना करें। एक मानक कोच केवल आपको तभी प्रशंसा देता है जब आप "पार" (Par) स्कोर करते हैं। एक LSE कोच आपको तब प्रशंसा देता है जब आप अपने पिछले राउंड की तुलना में दो स्ट्रोक कम कर लेते हैं, भले ही आपका स्कोर अभी भी "बोगी" (Bogey) ही क्यों न हो। यह AI को केवल परफेक्ट होने के बजाय बेहतर होने पर ध्यान केंद्रित करना सिखाता है।

3. "ट्री" रणनीति: गलत रास्ते पर न चलें

यदि आप एक के बाद एक रेसिपी को संपादित करते रहते हैं, तो आप एक गलत बदलाव करके एक अच्छी रेसिपी को अनजाने में खराब कर सकते हैं। यह एक रास्ते पर चलने और बाद में यह महसूस करने जैसा है कि आपने गलत मोड़ ले लिया है।

  • ट्री सर्च (The Tree Search): LSE एक "ट्री-गाइडेड" दृष्टिकोण का उपयोग करता है। एक 'चूज़-योर-ओन-एडवेंचर' (choose-your-own-adventure) किताब की कल्पना करें।
    • AI एक बदलाव आज़माता है (शाखा A)।
    • AI एक अलग बदलाव आज़माता है (शाखा B)।
    • यह दोनों का परीक्षण करता है। यदि शाखा A तबाही की ओर ले जाती है, तो सिस्टम वहां अटका नहीं रहता। यह "बैकट्रैक" करता है और शाखा B को आज़माता है।
    • यह सभी अच्छे रास्तों का एक नक्शा रखता है, यह सुनिश्चित करता है कि यह कभी भी खराब निर्देशों के "डेड एंड" (बंद गली) में न फंसे।

4. बड़ा सरप्राइज: छोटा ही शक्तिशाली है

इस पेपर का सबसे रोमांचक हिस्सा इसका परिणाम है।

  • उन्होंने एक अपेक्षाकृत छोटे AI मॉडल (4 बिलियन पैरामीटर्स) का उपयोग किया।
  • उन्होंने इस "सेल्फ-इवॉल्व" पद्धति का उपयोग करके इसे प्रशिक्षित किया।
  • परिणाम: इस छोटे, प्रशिक्षित मॉडल ने विशाल, सुपर-स्मार्ट मॉडल्स (जैसे GPT-5 और Claude Sonnet) को हरा दिया जो सेल्फ-इवॉल्व करने के लिए प्रशिक्षित नहीं थे

उपमा: यह एक छोटे, अच्छी तरह से प्रशिक्षित प्रशिक्षु (apprentice) की तरह है जो अपनी गलतियों से सीखना जानता है, और एक विशाल, अप्रशिक्षित जीनियस को हरा देता है जो बदलने से इनकार करता है। प्रशिक्षु इसलिए जीतता है क्योंकि उसके पास सुधार करने का कौशल है, न कि केवल कच्ची बुद्धिमत्ता।

यह क्यों मायने रखता है?

वर्तमान में, यदि आप चाहते हैं कि कोई AI किसी विशिष्ट कार्य (जैसे SQL कोड लिखना या चिकित्सा संबंधी प्रश्नों के उत्तर देना) में बेहतर हो, तो आपको पूरे मॉडल को शुरू से फिर से प्रशिक्षित करना पड़ता है, जो महंगा और धीमा है।

LSE के साथ, आप एक छोटे मॉडल को ले सकते हैं, उसे अपने स्वयं के फीडबैक से सीखना सिखा सकते हैं, और उसे चलते-फिरते अनुकूलित (adapt) होने दे सकते हैं। यह "स्व-सुधार" को एक भाग्यशाली दुर्घटना से बदलकर एक सीखी जा सकने वाली स्किल में बदल देता है।

संक्षेप में:
यह पेपर AI मॉडल्स को अपना सबसे अच्छा आलोचक बनना सिखाता है। उन्हें ठीक करने के लिए किसी इंसान के इंतजार करने के बजाय, वे अपनी गलतियों को देखना, अपने निर्देशों को फिर से लिखना और हर बार काम करते समय बेहतर होना सीखते हैं। और सबसे अच्छी बात? इसे करने के लिए आपको विशाल मस्तिष्क की आवश्यकता नहीं है; आपको बस विकसित होने का तरीका जानने के लिए सही प्रशिक्षण की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →