INFUSER: Influence-Guided Self-Evolution Improves Reasoning
INFUSER एक इटरेटिव को-ट्रेनिंग फ्रेमवर्क है जो एक जनरेटर और सॉल्वर का उपयोग करके अनस्ट्रक्चर्ड दस्तावेज़ों से तर्क क्षमताओं को विकसित करने के लिए एक इन्फ्लुएंस-गाइडेड रिवॉर्ड सिग्नल और एक नवीन DuGRPO एल्गोरिदम का उपयोग करता है, जो एक एडेप्टिव करिकुलम को क्यूरेट करता है और चुनौतीपूर्ण बेंचमार्क पर मौजूदा सेल्फ-इवोल्यूशन बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ INFUSER पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों (analogies) के माध्यम से समझाया गया है।
मुख्य विचार: एक रोबोट को खुद को सिखाना सिखाना
कल्पना कीजिए कि आपके पास एक बुद्धिमान छात्र (Solver) है जो गणित और विज्ञान में अच्छा है लेकिन वह और भी बेहतर बनना चाहता है। आमतौर पर, सीखने के लिए इस छात्र को एक शिक्षक की आवश्यकता होती है जो उसे अभ्यास के प्रश्न (practice problems) दे सके। लेकिन एक मानव शिक्षक को ढूंढना जो परफेक्ट अभ्यास प्रश्न बना सके, महंगा और धीमा काम है।
INFUSER एक नई विधि है जहाँ छात्र स्वयं को सिखाता है, लेकिन एक विशेष मोड़ के साथ: वह केवल कठिन प्रश्न ही नहीं बनाता; बल्कि वह ऐसे प्रश्न बनाता है जो उसके वर्तमान कौशल स्तर के लिए उपयोगी (useful) हों।
दो पात्र: "क्विज़ मास्टर" और "छात्र"
यह सिस्टम एक ही AI मॉडल के दो संस्करणों का उपयोग करता है जो मिलकर काम करते हैं:
- जेनेरेटर (क्विज़ मास्टर - The Quiz Master): यह AI अनव्यवस्थित पाठ्यपुस्तकों और नोट्स के एक विशाल पुस्तकालय (जिसे "डॉक्यूमेंट पूल" कहा जाता है) को पढ़ता है। इसका काम जो कुछ भी वह पढ़ता है, उसके आधार पर एक क्विज़ प्रश्न और एक "गोल्डन उत्तर" लिखना है।
- सॉल्वर (छात्र - The Student): यह AI उन प्रश्नों के उत्तर देने का प्रयास करता है जो क्विज़ मास्टर ने लिखे हैं। यदि वह उन्हें सही हल करता है, तो उसे इनाम मिलता है और वह सीखता है।
पुराने तरीकों के साथ समस्या
स्वयं-सिखाने (self-teaching) के पिछले प्रयासों में दो मुख्य कमियाँ थीं:
- "भ्रम" का जाल (The "Hallucination" Trap): कुछ विधियाँ AI को शून्य से प्रश्न बनाने की अनुमति देती हैं। यदि AI गलत है, तो वह खुद को गलत तथ्य सिखाता है (जैसे कि एक छात्र किसी फर्जी इतिहास की किताब को रट ले)।
- "कठिनाई" का जाल (The "Hardness" Trap): अन्य विधियों ने AI को सबसे कठिन प्रश्न बनाने के लिए प्रेरित किया। लेकिन एक प्रश्न इसलिए "कठिन" हो सकता है क्योंकि वह भ्रमित करने वाला, खराब तरीके से लिखा गया, या गलत उत्तर वाला हो। यदि छात्र एक भ्रमित करने वाले प्रश्न को हल करने की कोशिश करता है, तो वह वास्तव में सीखता नहीं है; वह केवल निराश हो जाता है।
INFUSER का समाधान: "कोच का प्रभाव स्कोर" (The "Coach's Influence Score")
INFUSER क्विज़ मास्टर को ग्रेड देने का एक चतुर तरीका पेश करता है। यह पूछने के बजाय कि "क्या यह प्रश्न कठिन है?" यह पूछता है, "क्या इस प्रश्न को हल करने से वास्तव में छात्र को उन चीजों में बेहतर होने में मदद मिलेगी जिनकी हमें परवाह है?"
यह यहाँ कैसे काम करता है, चरण-दर-चरण:
- लक्ष्य (The Target): टीम के पास "गोल्ड स्टैंडर्ड" प्रश्नों का एक छोटा सेट है (जैसे कि एक फाइनल परीक्षा) जो वास्तविक दुनिया का प्रतिनिधित्व करते हैं। आइए इसे Dev Set कहें।
- दिशा (The Direction): क्विज़ मास्टर नया प्रश्न लिखने से पहले, सिस्टम गोल्ड स्टैंडर्ड परीक्षा की जाँच करता है ताकि यह देखा जा सके कि सुधार के लिए छात्र को किस दिशा में जाने की आवश्यकता है। (उदाहरण के लिए: "छात्र रासायनिक अभिक्रियाओं (chemical reactions) की गणना करने में कमजोर है, इसलिए हमें इस दिशा में आगे बढ़ने की आवश्यकता है।")
- क्विज़ मास्टर का काम: क्विज़ मास्टर एक पाठ्यपुस्तक पढ़ता है और एक प्रश्न लिखता है।
- "इन्फ्लुएंस स्कोर" (The "Influence Score"): सिस्टम छात्र द्वारा इस नए प्रश्न का उत्तर देने का अनुकरण (simulate) करता है। फिर यह एक स्कोर की गणना करता है जिसे इन्फ्लुएंस स्कोर कहा जाता है।
- उदाहरण: कल्पना कीजिए कि एक व्यक्तिगत ट्रेनर (सिस्टम) एक कोच (क्विज़ मास्टर) को वर्कआउट डिजाइन करते हुए देख रहा है। ट्रेनर को केवल इस बात की परवाह नहीं है कि वर्कआउट कितना कठिन है। वे यह देखते हैं: "क्या यह विशिष्ट व्यायाम धावक के कमजोर घुटने को ठीक करने में मदद करेगा?"
- यदि नया प्रश्न छात्र को गोल्ड स्टैंडर्ड परीक्षा में सुधार करने में मदद करता है, तो क्विज़ मास्टर को उच्च स्कोर मिलता है।
- यदि प्रश्न भ्रमित करने वाला या अप्रासंगिक है, तो क्विज़ मास्टर को कम स्कोर मिलता है।
- लूप (The Loop): क्विज़ मास्टर बेहतर प्रश्न लिखने के लिए सीखता है ताकि उच्च स्कोर प्राप्त किया जा सके, और छात्र उन्हें हल करके सीखता है। वे एक साथ विकसित होते हैं।
गुप्त नुस्खा: "DuGRPO"
पेपर में DuGRPO नामक एक तकनीकी ट्रिक का उल्लेख है। इसे क्विज़ मास्टर को ग्रेड देने के एक विशेष तरीके के रूप में समझें।
- आमतौर पर, यदि प्रश्नों का एक समूह बहुत समान स्कोर रखता है, तो यह बताना कठिन होता है कि कौन सा बेहतर है।
- DuGRPO एक स्मार्ट रेफरी की तरह है जो पूरे समूह के आधार पर स्कोरिंग को समायोजित करता है। यह सुनिश्चित करता है कि भले ही सभी प्रश्न "ठीक" हों, फिर भी सिस्टम उनमें से उन प्रश्नों को चुन सके जो थोड़े अधिक सहायक हैं, जिससे प्रशिक्षण अटकने या शोर (noise) से बच सके।
उन्होंने क्या पाया?
शोधकर्ताओं ने इसका परीक्षण Qwen3 (एक स्मार्ट AI) नामक मॉडल पर किया।
- प्रतियोगिता से बेहतर: INFUSER ने कठिन गणित और विज्ञान बेंचमार्क पर अन्य स्व-सिखाने वाली विधियों को भारी अंतर (20% से अधिक सुधार) से पीछे छोड़ दिया।
- छोटा बनाम बड़ा: INFUSER (एक सह-विकसित क्विज़ मास्टर के साथ) का उपयोग करने वाला एक 8-बिलियन-पैरामीटर वाला मॉडल, एक स्थिर (static) प्रश्नों के सेट का उपयोग करने वाले 32-बिलian-पैरामीटर वाले फ्रीज्ड मॉडल की तुलना में गणित और कोडिंग में बेहतर प्रदर्शन करता है। यह साबित करता है कि एक साथ विकसित होने की प्रक्रिया केवल एक बड़े मस्तिष्क होने से अधिक महत्वपूर्ण है।
- गुणवत्ता नियंत्रण: जैसे-जैसे प्रशिक्षण आगे बढ़ा, क्विज़ मास्टर द्वारा लिखे गए प्रश्न अधिक तार्किक, स्व-निहित और तथ्यात्मक रूप से सही होते गए। वे "भ्रमित करने वाले रूप से कठिन" होने के बजाय "वास्तव में चुनौतीपूर्ण" बन गए।
सारांश
INFUSER एक स्व-सुधार प्रणाली है जहाँ एक AI शिक्षक और छात्र दोनों के रूप में कार्य करता है। शिक्षक को कठिन प्रश्न बनाने के लिए नहीं, बल्कि ऐसे प्रश्न बनाने के लिए पुरस्कृत किया जाता है जो छात्र को सही दिशा में ले जाते हैं ताकि वह वास्तविक दुनिया की समस्याओं को हल कर सके। कोच के प्रभाव स्कोर (coach's influence score) का उपयोग करके शिक्षक को निर्देशित करके, यह सिस्टम पाठ्यपुस्तकों के एक अव्यवस्थित पुस्तकालय को एक आदर्श, व्यक्तिगत पाठ्यक्रम में बदल देता है जो AI को पहले से कहीं बेहतर तर्क करने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।