← नवीनतम पेपर
💻 computer science

Reinforced Graph of Thoughts: RL-Driven Adaptive Prompting for LLMs

यह शोध पत्र रिइन्फोर्स्ड ग्राफ ऑफ थॉट्स (RGoT) का प्रस्ताव करता है, जो एक स्वचालित ढांचा है जो ग्राफ ऑफ थॉट्स प्रॉम्प्टिंग में ऑपरेशन्स के ग्राफ को गतिशील रूप से अनुकूलित करने के लिए रिइन्फोर्समेंट लर्निंग का उपयोग करता है, जिससे जटिल समस्या-समाधान कार्यों को बेहतर ढंग से संभालने के लिए मैन्युअल रूप से परिभाषित संरचनाओं की कठोरता को दूर किया जा सके।

मूल लेखक: Manuel Noah Riesen, Peter Alfred von Niederhäusern

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Manuel Noah Riesen, Peter Alfred von Niederhäusern

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन कभी-कभी बिखरा हुआ सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिखने में तो माहिर है लेकिन जटिल गणित या अव्यवस्थित डेटा को व्यवस्थित करने में संघर्ष करता है। यदि आप उनसे बस "इसे हल करें" कहेंगे, तो वे भ्रमित हो सकते हैं और गलतियाँ कर सकते हैं, खासकर यदि समस्या बहुत बड़ी हो।

उनकी मदद के लिए, शोधकर्ता उन्हें एक "रेसिपी" या चरण-दर-चरण योजना देते हैं।

  • चेन ऑफ थॉट (Chain of Thought): निर्देशों की एक सीधी रेखा की तरह: "A करें, फिर B, फिर C।"
  • ट्री ऑफ थॉट्स (Tree of Thoughts): एक पारिवारिक पेड़ (family tree) की तरह जहाँ सहायक अलग-अलग शाखाओं को आजमाता है, देखता है कि कौन सी अच्छी दिख रही है, और यदि वह किसी मृत अंत (dead end) पर पहुँच जाता है तो वापस पीछे हट जाता है।
  • ग्राफ ऑफ थॉट्स (Graph of Thoughts - GoT): सबसे उन्नत संस्करण। एक सबवे मैप (मेट्रो मैप) की कल्पना करें। सहायक समस्या को अलग-अलग लाइनों में विभाजित कर सकता है, उन्हें अलग से हल कर सकता है, और फिर परिणामों को वापस एक साथ जोड़ सकता है। यह बड़े कार्यों के लिए बेहतरीन है, लेकिन इसका उपयोग करना कठिन है। आपको, यानी इंसान को, सहायक के काम शुरू करने से पहले पूरा सबवे मैप खुद बनाना पड़ता है। यदि आप गलत मैप बनाते हैं, तो सहायक विफल हो जाता है।

समस्या: "स्थिर मानचित्र" (The "Static Map")

मूल "ग्राफ ऑफ थॉट्स" एक कठोर, पहले से बने हुए सबवे मैप की तरह है। यह तब पूरी तरह से काम करता है जब समस्या बिल्कुल वैसी ही हो जैसी आपने उम्मीद की थी। लेकिन यदि समस्या बड़ी या अधिक जटिल हो जाती है (जैसे संख्याओं की एक सूची जो आपकी सोच से दोगुनी लंबी है), तो आपका निश्चित मैप टूट जाता है। सहायक खो जाता है क्योंकि मैप ने नए आकार का अनुमान नहीं लगाया था।

समाधान: रीइन्फोर्स्ड ग्राफ ऑफ थॉट्स (RGoT)

इस पेपर के लेखक, मैनुअल नोआ रीसन और पीटर अल्फ्रेड वॉन निडरहौसेन ने RGoT नामक एक प्रणाली बनाई है। यहाँ आप मैप नहीं बनाते, बल्कि उन्होंने सहायक को एक GPS दिया है जो चलते समय सीखता है

यह कैसे काम करता है, एक सरल उदाहरण से समझते हैं:

"जोड़ने" का खेल (The "Summing" Game)
कल्पना कीजिए कि कार्य संख्याओं की एक बहुत लंबी सूची को जोड़ना है।

  1. पुराना तरीका: आप सहायक को कहते हैं, "इन संख्याओं को जोड़ो।" यदि सूची में 5 संख्याएँ हैं, तो वे इसे कर लेते हैं। यदि इसमें 50 हैं, तो वे भ्रमित हो जाते हैं और गलत उत्तर देते हैं।
  2. RGoT का तरीका: इस प्रणाली के पास बुनियादी चालों का एक टूलबॉक्स है:
    • स्प्लिट (Split): बड़ी सूची को दो छोटी सूचियों में काटें।
    • सम (Sum): एक छोटी सूची को जोड़ें।
    • मर्ज (Merge): दो छोटे परिणामों को एक बड़े परिणाम में मिलाएं।

यह तय करने के बजाय कि कब विभाजित करना है या मिलाना है, सिस्टम एक रीइन्फोर्समेंट लर्निंग (RL) एजेंट का उपयोग करता है। इस एजेंट को एक वीडियो गेम कैरेक्टर की तरह समझें जो एक लेवल को जीतने की कोशिश कर रहा है।

  • खेल: "लेवल" संख्याओं की सूची है।
  • चालें: कैरेक्टर "Split," "Sum," "Merge," या "Stop" चुन सकता है।
  • रिवॉर्ड (Reward): यदि अंतिम उत्तर सही है, तो उसे अंक मिलते हैं। यदि वह विफल होता है, तो उसके अंक कट जाते हैं।

सीखने का जादू
शुरुआत में, एजेंट को कुछ भी पता नहीं होता। वह एक बार में 100 संख्याओं की सूची को जोड़ने की कोशिश कर सकता है और विफल हो सकता है। लेकिन क्योंकि वह एक "खेल" (रीइन्फोर्समेंट लर्निंग का उपयोग करके) खेल रहा है, वह अपनी गलतियों से सीखता है।

  • उसे एहसास होता है: "हे, जब सूची बहुत बड़ी होती है, तो अगर मैं एक साथ जोड़ने की कोशिश करता हूँ, तो मुझे पेनल्टी मिलती है। लेकिन अगर मैं पहले Split करूँ, फिर छोटे हिस्सों को Sum करूँ, और अंत में उन्हें Merge करूँ, तो मुझे बहुत बड़ा रिवॉर्ड मिलता है!"
  • समय के साथ, एजेंट अपने आप एक "सबवे मैप" (ऑपरेशन्स का ग्राफ) बनाना सीख जाता है, जो समस्या के आकार के अनुसार पूरी तरह से अनुकूलित होता है।

उन्होंने वास्तव में क्या किया

शोधकर्ताओं ने कई कार्यों पर इसका परीक्षण किया:

  1. सूचियों को जोड़ना: संख्याओं को जोड़ना।
  2. सूचियों को सॉर्ट करना: संख्याओं को क्रम में रखना।
  3. कीवर्ड्स की गिनती: टेक्स्ट में कोई शब्द कितनी बार आता है, यह ढूंढना।
  4. दस्तावेजों को मर्ज करना: बिना जानकारी दोहराए कई टेक्स्ट को एक में मिलाना।

उन्होंने केवल वास्तविक AI मॉडल का उपयोग प्रशिक्षण (training) के लिए नहीं किया (क्योंकि यह बहुत महंगा और धीमा होता)। इसके बजाय, उन्होंने एक सिमुलेशन बनाया। उन्होंने गणना की कि AI के 10 आइटम, 20 आइटम, 50 आइटम आदि की सूची पर गलती करने की कितनी संभावना है, और उस जानकारी को गेम में प्रोग्राम कर दिया। एजेंट ने इस सिमुलेशन में सीखा, और फिर उन्होंने वास्तविक AI पर इसका परीक्षण किया।

परिणाम

पेपर का दावा है कि:

  • अनुकूलन क्षमता (Adaptability): एजेंट ने समस्या कितनी कठिन थी, इसके आधार पर अपनी रणनीति को स्वचालित रूप से बदलना सीख लिया। यदि सूची छोटी थी, तो उसने साधारण जोड़ किया। यदि सूची बहुत बड़ी थी, तो उसने पहले उसे विभाजित करने का निर्णय लिया।
  • बुनियादी चीजों से बेहतर: एजेंट ने जटिल समस्याओं को केवल एक बार में "करने" (Input-Output विधि) की तुलना में बहुत अधिक विश्वसनीयता के साथ हल किया।
  • सामान्यीकरण (Generalization): यहाँ तक कि जब उन्होंने एजेंट को ऐसी सूची दी जिसे उन्होंने प्रशिक्षण के दौरान कभी नहीं देखा था (जैसे कि 30 तक की सूचियों पर अभ्यास करने के बाद 60 आइटमों की सूची), तब भी उसने एक अच्छी रणनीति बना ली।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर जटिल समस्या समाधान को स्वचालित बनाने का एक तरीका प्रस्तुत करता है। एक मानव विशेषज्ञ को यह जानने की आवश्यकता नहीं है कि किसी जटिल कार्य को ठीक से कैसे संरचित किया जाए, बल्कि सिस्टम एक "लर्निंग एजेंट" का उपयोग करता है जो किसी भी दिए गए समस्या के आकार के लिए सबसे अच्छा चरण-दर-चरण प्लान (ग्राफ) खुद तैयार करता है। यह एक कठोर, मैनुअल प्रक्रिया को एक लचीली, स्वयं-समायोजित प्रक्रिया में बदल देता है।

नोट: यह पेपर पूरी तरह से इन विशिष्ट कार्यों (गणित, सॉर्टिंग, गिनती, मर्जिंग) पर केंद्रित है और यह दावा नहीं करता है कि यह विधि चिकित्सा निदान, कानूनी सलाह या अन्य वास्तविक दुनिया के अनुप्रयोगों के लिए काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →