← नवीनतम पेपर
💬 NLP

InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning

InftyThink+ एक एंड-टू-एंड सुदृढीकरण शिक्षण (reinforcement learning) फ्रेमवर्क है जो रणनीतिक सारांशीकरण और मॉडल-नियंत्रित पुनरावृत्ति सीमाओं के माध्यम से पुनरावृत्तीय तर्क को अनुकूलित करता है, जो पारंपरिक लॉन्ग चेन-ऑफ-थॉट विधियों की तुलना में सटीकता, दक्षता और सामान्यीकरण में महत्वपूर्ण सुधार करता है।

मूल लेखक: Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़े, अविश्वसनीय रूप से कठिन पहेली को हल करने की कोशिश कर रहे हैं। आपके पास एक शानदार सहायक (AI) है जो बहुत बुद्धिमान है लेकिन उसकी याददाश्त बहुत कम है और यदि वह एक साथ बहुत सारे टुकड़ों को अपने दिमाग में रखने की कोशिश करता है, तो वह थक जाता है।

यहाँ समस्या दी गई है जिसे यह शोध पत्र संबोधित करता है:

  • पुराना तरीका (वैनिला रीजनिंग): आप सहायक से पूरी पहेली को एक ही बार में हल करने के लिए कहते हैं। वे सोचना शुरू करते हैं, "चरण 1, चरण 2, चरण 3..." और चलते जाते हैं। लेकिन क्योंकि उनकी याददाश्त सीमित है, वे चरण 100 पर काम करते समय चरण 1 में जो किया था उसे भूल जाते हैं। इसके अलावा, वे जितना लंबा सोचते हैं, कंप्यूटर के लिए उनके विचारों को प्रोसेस करना उतना ही धीमा और महंगा होता जाता है। वे काम पूरा करने से पहले ही अपनी मेमोरी खत्म कर सकते हैं, या वे अपने ही विचारों की लंबी सूची से भ्रमित हो सकते हैं।
  • नया तरीका (InftyThink+): एक लंबे, निर्बाध विचार के बजाय, सहायक पहेली को छोटे अध्यायों में तोड़ देता है। कुछ चरणों के बाद, वे रुकते हैं, एक सारांश (summary) लिखते हैं कि उन्होंने अब तक क्या पता लगाया है, और फिर अपने बिखरे हुए, विस्तृत नोट्स को फेंक देते हैं। फिर वे केवल उस सारांश और मूल पहेली का उपयोग करके अगला अध्याय शुरू करते हैं। यह उनकी याददाश्त को ताज़ा रखता है और कंप्यूटर को तेज़ रखता है।

बड़ी नवीनता: सहायक को यह तय करना सिखाना कि कब रुकना है

यह शोध पत्र एक नई प्रणाली पेश करता है जिसे InftyThink+ कहा जाता है।

"अध्याय" पद्धति के पिछले प्रयास इस तरह के थे जैसे एक शिक्षक जो सहायक को हर 500 शब्दों के बाद रुकने के लिए मजबूर करता है, चाहे कुछ भी हो। कभी-कभी सहायक एक शानदार विचार के बीच में ही होता था और उसे बीच में ही रोक दिया जाता था; अन्य मामलों में वे बहुत जल्दी रुक जाते थे। उन्हें यह भी नहीं पता था कि एक अच्छा सारांश कैसे लिखा जाए।

InftyThink+ सुदृढीकरण लर्निंग (Reinforcement Learning - RL) का उपयोग करता है ताकि सहायक को अनुभव और त्रुटि (trial and error) के माध्यम से तीन महत्वपूर्ण कौशल सिखाए जा सकें, जैसे कि टॉफी/ट्रीट देकर एक कुत्ते को प्रशिक्षित करना:

  1. सारांश कब लिखें: क्या मुझे सारांश लिखने के लिए अभी रुकना चाहिए, या आगे बढ़ना चाहिए? AI यह सीखता है कि उसे ठीक तभी रुकना चाहिए जब उसने सबसे महत्वपूर्ण जानकारी को पकड़ लिया हो, न कि केवल तब जब कोई टाइमर बजता है।
  2. क्या सुरक्षित रखें: अगले चरण के लिए कौन से विवरण महत्वपूर्ण हैं? AI यह सीखता है कि एक ऐसा सारांश कैसे लिखा जाए जो महत्वपूर्ण सुरागों को रखे और फालतू की बातों को हटा दे।
  3. कैसे जारी रखें: मुझे सारांश से कहानी कैसे आगे उठानी है? AI यह सीखता है कि वह अपने ही सारांश को कैसे पढ़े और बिना भटके तर्क को सहजता से कैसे जारी रखे।

यह कैसे काम करता है (प्रशिक्षण प्रक्रिया)

शोध पत्र एक दो-चरणीय प्रशिक्षण विधि का वर्णन करता है:

  1. "कोल्ड स्टार्ट" (फॉर्मेट सीखना): सबसे पहले, वे AI को खेल के बुनियादी नियम सिखाते हैं। वे उसे उदाहरण दिखाते हैं कि कैसे एक पहेली लिखनी है, कैसे रुकना है, सारांश लिखना है, और फिर से शुरू करना है। यह एक छात्र को निबंध लिखने के लिए कहने से पहले उसे निबंध का प्रारूप सिखाने जैसा है।
  2. "सुदृढीकरण लर्निंग" (रणनीति सीखना): एक बार जब AI प्रारूप जान जाता है, तो वे उसे स्वतंत्र छोड़ देते हैं।
    • यदि AI पहेली को सही ढंग से हल करता है, तो उसे एक "ट्रीट" (इनाम) मिलता है।
    • यदि वह इसे जल्दी और कुशलता से हल करता है, तो उसे एक अतिरिक्त ट्रीट मिलता है।
    • यदि वह एक बुरा सारांश लिखता है या गलत समय पर रुक जाता है, तो उसे कोई ट्रीट नहीं मिलता।
    • हजारों प्रयासों के बाद, AI एक आदर्श रणनीति समझ जाता है: "मुझे यहाँ रुकना चाहिए, इस तरह का सारांश लिखना चाहिए, और फिर इस तरह आगे बढ़ना चाहिए ताकि मुझे सबसे अधिक ट्रीट मिल सकें।"

परिणाम: तेज़, स्मार्ट और मजबूत

इस शोध पत्र ने कठिन गणितीय समस्याओं (जैसे AIME प्रतियोगिता) पर इसका परीक्षण किया। उन्होंने पाया:

  • स्मार्टर (अधिक बुद्धिमान): AI समस्याओं को हल करने में काफी बेहतर हो गया। एक कठिन टेस्ट पर, इसकी सटीकता पुराने तरीके की तुलना में 21% बढ़ गई। इसने उन समस्याओं को हल किया जिन्हें पुराना तरीका पूरा भी नहीं कर सका।
  • फास्टर (तेज़): क्योंकि AI एक 100 पन्नों के इतिहास को याद रखने की कोशिश नहीं कर रहा था, इसलिए उसने समस्याओं को बहुत तेज़ी से हल किया। कुछ मामलों में, यह मानक पद्धति की तुलना में 30% से 40% तेज़ था।
  • अधिक कुशल: प्रशिक्षण स्वयं भी तेज़ था। कंप्यूटर को AI को सिखाने के लिए बहुत अधिक भारी काम नहीं करना पड़ा, जिसका अर्थ है कि शोधकर्ता कम ऊर्जा और समय में बेहतर मॉडल प्रशिक्षित कर सके।

निष्कर्ष (The Bottom Line)

InftyThink+ को एक AI को बेहतर प्रोजेक्ट मैनेजर बनाने के रूप में समझें। किसी प्रोजेक्ट के पूरे इतिहास को अपने दिमाग में रखने की कोशिश करने के बजाय (जिससे वे क्रैश हो सकते हैं या भूल सकते हैं), यह रुकना, एक स्पष्ट "स्टेटस रिपोर्ट" (सारांश) लिखना और फिर उस रिपोर्ट के आधार पर आगे बढ़ना सीखता है। यह सीखकर कि उसे यह रिपोर्ट कब लिखनी है और उसमें क्या डालना है, AI एक जीनियस समस्या-समाधानकर्ता और एक अत्यधिक कुशल कार्यकर्ता दोनों बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →