← नवीनतम पेपर
📊 statistics

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

INFUSER एक इटरेटिव को-ट्रेनिंग फ्रेमवर्क है जो एक जनरेटर और सॉल्वर का उपयोग करके अनस्ट्रक्चर्ड दस्तावेज़ों से तर्क क्षमताओं को विकसित करने के लिए एक इन्फ्लुएंस-गाइडेड रिवॉर्ड सिग्नल और एक नवीन DuGRPO एल्गोरिदम का उपयोग करता है, जो एक एडेप्टिव करिकुलम को क्यूरेट करता है और चुनौतीपूर्ण बेंचमार्क पर मौजूदा सेल्फ-इवोल्यूशन बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ INFUSER पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों (analogies) के माध्यम से समझाया गया है।

मुख्य विचार: एक रोबोट को खुद को सिखाना सिखाना

कल्पना कीजिए कि आपके पास एक बुद्धिमान छात्र (Solver) है जो गणित और विज्ञान में अच्छा है लेकिन वह और भी बेहतर बनना चाहता है। आमतौर पर, सीखने के लिए इस छात्र को एक शिक्षक की आवश्यकता होती है जो उसे अभ्यास के प्रश्न (practice problems) दे सके। लेकिन एक मानव शिक्षक को ढूंढना जो परफेक्ट अभ्यास प्रश्न बना सके, महंगा और धीमा काम है।

INFUSER एक नई विधि है जहाँ छात्र स्वयं को सिखाता है, लेकिन एक विशेष मोड़ के साथ: वह केवल कठिन प्रश्न ही नहीं बनाता; बल्कि वह ऐसे प्रश्न बनाता है जो उसके वर्तमान कौशल स्तर के लिए उपयोगी (useful) हों।

दो पात्र: "क्विज़ मास्टर" और "छात्र"

यह सिस्टम एक ही AI मॉडल के दो संस्करणों का उपयोग करता है जो मिलकर काम करते हैं:

  1. जेनेरेटर (क्विज़ मास्टर - The Quiz Master): यह AI अनव्यवस्थित पाठ्यपुस्तकों और नोट्स के एक विशाल पुस्तकालय (जिसे "डॉक्यूमेंट पूल" कहा जाता है) को पढ़ता है। इसका काम जो कुछ भी वह पढ़ता है, उसके आधार पर एक क्विज़ प्रश्न और एक "गोल्डन उत्तर" लिखना है।
  2. सॉल्वर (छात्र - The Student): यह AI उन प्रश्नों के उत्तर देने का प्रयास करता है जो क्विज़ मास्टर ने लिखे हैं। यदि वह उन्हें सही हल करता है, तो उसे इनाम मिलता है और वह सीखता है।

पुराने तरीकों के साथ समस्या

स्वयं-सिखाने (self-teaching) के पिछले प्रयासों में दो मुख्य कमियाँ थीं:

  • "भ्रम" का जाल (The "Hallucination" Trap): कुछ विधियाँ AI को शून्य से प्रश्न बनाने की अनुमति देती हैं। यदि AI गलत है, तो वह खुद को गलत तथ्य सिखाता है (जैसे कि एक छात्र किसी फर्जी इतिहास की किताब को रट ले)।
  • "कठिनाई" का जाल (The "Hardness" Trap): अन्य विधियों ने AI को सबसे कठिन प्रश्न बनाने के लिए प्रेरित किया। लेकिन एक प्रश्न इसलिए "कठिन" हो सकता है क्योंकि वह भ्रमित करने वाला, खराब तरीके से लिखा गया, या गलत उत्तर वाला हो। यदि छात्र एक भ्रमित करने वाले प्रश्न को हल करने की कोशिश करता है, तो वह वास्तव में सीखता नहीं है; वह केवल निराश हो जाता है।

INFUSER का समाधान: "कोच का प्रभाव स्कोर" (The "Coach's Influence Score")

INFUSER क्विज़ मास्टर को ग्रेड देने का एक चतुर तरीका पेश करता है। यह पूछने के बजाय कि "क्या यह प्रश्न कठिन है?" यह पूछता है, "क्या इस प्रश्न को हल करने से वास्तव में छात्र को उन चीजों में बेहतर होने में मदद मिलेगी जिनकी हमें परवाह है?"

यह यहाँ कैसे काम करता है, चरण-दर-चरण:

  1. लक्ष्य (The Target): टीम के पास "गोल्ड स्टैंडर्ड" प्रश्नों का एक छोटा सेट है (जैसे कि एक फाइनल परीक्षा) जो वास्तविक दुनिया का प्रतिनिधित्व करते हैं। आइए इसे Dev Set कहें।
  2. दिशा (The Direction): क्विज़ मास्टर नया प्रश्न लिखने से पहले, सिस्टम गोल्ड स्टैंडर्ड परीक्षा की जाँच करता है ताकि यह देखा जा सके कि सुधार के लिए छात्र को किस दिशा में जाने की आवश्यकता है। (उदाहरण के लिए: "छात्र रासायनिक अभिक्रियाओं (chemical reactions) की गणना करने में कमजोर है, इसलिए हमें इस दिशा में आगे बढ़ने की आवश्यकता है।")
  3. क्विज़ मास्टर का काम: क्विज़ मास्टर एक पाठ्यपुस्तक पढ़ता है और एक प्रश्न लिखता है।
  4. "इन्फ्लुएंस स्कोर" (The "Influence Score"): सिस्टम छात्र द्वारा इस नए प्रश्न का उत्तर देने का अनुकरण (simulate) करता है। फिर यह एक स्कोर की गणना करता है जिसे इन्फ्लुएंस स्कोर कहा जाता है।
    • उदाहरण: कल्पना कीजिए कि एक व्यक्तिगत ट्रेनर (सिस्टम) एक कोच (क्विज़ मास्टर) को वर्कआउट डिजाइन करते हुए देख रहा है। ट्रेनर को केवल इस बात की परवाह नहीं है कि वर्कआउट कितना कठिन है। वे यह देखते हैं: "क्या यह विशिष्ट व्यायाम धावक के कमजोर घुटने को ठीक करने में मदद करेगा?"
    • यदि नया प्रश्न छात्र को गोल्ड स्टैंडर्ड परीक्षा में सुधार करने में मदद करता है, तो क्विज़ मास्टर को उच्च स्कोर मिलता है।
    • यदि प्रश्न भ्रमित करने वाला या अप्रासंगिक है, तो क्विज़ मास्टर को कम स्कोर मिलता है।
  5. लूप (The Loop): क्विज़ मास्टर बेहतर प्रश्न लिखने के लिए सीखता है ताकि उच्च स्कोर प्राप्त किया जा सके, और छात्र उन्हें हल करके सीखता है। वे एक साथ विकसित होते हैं।

गुप्त नुस्खा: "DuGRPO"

पेपर में DuGRPO नामक एक तकनीकी ट्रिक का उल्लेख है। इसे क्विज़ मास्टर को ग्रेड देने के एक विशेष तरीके के रूप में समझें।

  • आमतौर पर, यदि प्रश्नों का एक समूह बहुत समान स्कोर रखता है, तो यह बताना कठिन होता है कि कौन सा बेहतर है।
  • DuGRPO एक स्मार्ट रेफरी की तरह है जो पूरे समूह के आधार पर स्कोरिंग को समायोजित करता है। यह सुनिश्चित करता है कि भले ही सभी प्रश्न "ठीक" हों, फिर भी सिस्टम उनमें से उन प्रश्नों को चुन सके जो थोड़े अधिक सहायक हैं, जिससे प्रशिक्षण अटकने या शोर (noise) से बच सके।

उन्होंने क्या पाया?

शोधकर्ताओं ने इसका परीक्षण Qwen3 (एक स्मार्ट AI) नामक मॉडल पर किया।

  • प्रतियोगिता से बेहतर: INFUSER ने कठिन गणित और विज्ञान बेंचमार्क पर अन्य स्व-सिखाने वाली विधियों को भारी अंतर (20% से अधिक सुधार) से पीछे छोड़ दिया।
  • छोटा बनाम बड़ा: INFUSER (एक सह-विकसित क्विज़ मास्टर के साथ) का उपयोग करने वाला एक 8-बिलियन-पैरामीटर वाला मॉडल, एक स्थिर (static) प्रश्नों के सेट का उपयोग करने वाले 32-बिलian-पैरामीटर वाले फ्रीज्ड मॉडल की तुलना में गणित और कोडिंग में बेहतर प्रदर्शन करता है। यह साबित करता है कि एक साथ विकसित होने की प्रक्रिया केवल एक बड़े मस्तिष्क होने से अधिक महत्वपूर्ण है।
  • गुणवत्ता नियंत्रण: जैसे-जैसे प्रशिक्षण आगे बढ़ा, क्विज़ मास्टर द्वारा लिखे गए प्रश्न अधिक तार्किक, स्व-निहित और तथ्यात्मक रूप से सही होते गए। वे "भ्रमित करने वाले रूप से कठिन" होने के बजाय "वास्तव में चुनौतीपूर्ण" बन गए।

सारांश

INFUSER एक स्व-सुधार प्रणाली है जहाँ एक AI शिक्षक और छात्र दोनों के रूप में कार्य करता है। शिक्षक को कठिन प्रश्न बनाने के लिए नहीं, बल्कि ऐसे प्रश्न बनाने के लिए पुरस्कृत किया जाता है जो छात्र को सही दिशा में ले जाते हैं ताकि वह वास्तविक दुनिया की समस्याओं को हल कर सके। कोच के प्रभाव स्कोर (coach's influence score) का उपयोग करके शिक्षक को निर्देशित करके, यह सिस्टम पाठ्यपुस्तकों के एक अव्यवस्थित पुस्तकालय को एक आदर्श, व्यक्तिगत पाठ्यक्रम में बदल देता है जो AI को पहले से कहीं बेहतर तर्क करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →