Structure-Augmented Reasoning Generation
यह शोध पत्र स्ट्रक्चर-ऑगमेंटेड रीजनिंग जनरेशन (SARG) को प्रस्तुत करता है, जो एक मॉड्यूलर पोस्ट-रिट्रीवल फ्रेमवर्क है जो अनस्ट्रक्चर्ड रिट्रीव्ड डॉक्यूमेंट्स को स्पष्ट नॉलेज ग्राफ और रीजनिंग चेन्स में बदलकर लार्ज लैंग्वेज मॉडल्स की मल्टी-हॉप रीजनिंग क्षमताओं को बढ़ाता है, जिससे बिना किसी कस्टम रिट्रिवर या फाइन-ट्यूनिंग की आवश्यकता के तथ्यात्मक सटीकता, रीजनिंग कोहेरेंस और व्याख्यात्मकता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास 50 अलग-अलग समाचार पत्रों की कतरनों (जिसे रिट्रीव्ड डॉक्यूमेंट्स कहा जाता है) का एक ढेर है जो आपके प्रश्न का उत्तर हो सकते हैं।
एक मानक एआई सिस्टम (जिसे RAG कहा जाता है) में, कंप्यूटर बस उन सभी 50 कतरनों को एक विशाल ढेर में डाल देता है और जासूस (जिसे लार्ज लैंग्वेज मॉडल कहा जाता है) से कहता है: "इस पूरे कचरे को पढ़ो और मुझे उत्तर बताओ।"
समस्या यह है कि जासूस अभिभूत (overwhelmed) हो जाता है। सुराग बिखरे हुए होते हैं। एक सुराग पेज 1 पर है, अगला पेज 40 पर है, और वे अप्रासंगिक विज्ञापनों और मौसम की रिपोर्टों से अलग हो जाते हैं। जासूस कनेक्शन को समझने में चूक सकता है, भ्रमित हो सकता है, या केवल अनुमान लगा सकता है। यही वह "लॉस्ट-इन-द-मिडल" (Lost-in-the-Middle) समस्या है।
SARG (स्ट्रक्चर-ऑगमेंटेड रीजनिंग जनरेशन) ऐसा है जैसे उस जासूस को पढ़ने शुरू करने से पहले एक आवर्धक लेंस (magnifying glass) और एक व्हाइटबोर्ड दे दिया गया हो।
यहाँ बताया गया है कि SARG कैसे काम करता है, जिसे एक सरल कहानी में तोड़कर समझाया गया है:
1. "स्मार्ट फ़िल्टर" (एक्सट्रैक्शन/निष्कर्षण)
हर एक समाचार पत्र की कतरन के हर एक शब्द को पढ़ने के बजाय, SARG एक सुपर-फास्ट संपादक की तरह काम करता है। यह 50 कतरनों को स्कैन करता है और केवल उन्हीं कारण संबंधी संबंधों (causal links) को निकालता है जो महत्वपूर्ण हैं।
- उपमा: कल्पना कीजिए कि कतरनें लेगो (LEGO) ब्रिक्स का एक बिखरा हुआ बॉक्स हैं। SARG उस बॉक्स को नहीं रखता; यह ब्रिक्स को छाँटता है और केवल उन्हें ही रखता है जो वास्तव में दो चीजों को आपस में जोड़ते हैं (जैसे, "बारिश के कारण ज़मीन गीली होती है")। यह उन ब्रिक्स को फेंक देता है जो केवल विवरण मात्र हैं (जैसे, "आसमान नीला है")।
- परिणाम: अब आपके पास "कारण → प्रभाव" के संबंधों की एक साफ सूची है, न कि टेक्स्ट का एक अस्त-व्यस्त ढेर।
2. "मैप मेकर" (ग्राफ कंस्ट्रक्शन/ग्राफ निर्माण)
SARG उन "कारण → प्रभाव" लिंक को लेता है और उन्हें एक मैप (मानचित्र) के रूप में व्हाइटबोर्ड पर खींचता है (एक नॉलेज ग्राफ)।
- उपमा: यदि कतरन A कहती है, "ससेप्टिबिलिटी जीन (Susceptibility genes) बीमारी X को ट्रिगर करते हैं," और कतरन B कहती है, "बीमारी X के लिए शुरुआती निदान (Early Diagnosis) आवश्यक है," तो SARG उन्हें जोड़ने के लिए एक रेखा खींचता है।
- अब, कागज के एक सपाट ढेर के बजाय, आपके पास एक रोडमैप है। आप देख सकते हैं कि पॉइंट A (प्रश्न) से पॉइंट B (उत्तर) तक कैसे पहुँचा जाए।
3. "जीपीएस नेविगेटर" (ट्रैवर्सल/पारगमन)
जब आप कोई प्रश्न पूछते हैं, तो SARG पूरे मैप को नहीं देखता। यह एक जीपीएस की तरह काम करता है।
- उपमा: यदि आप पूछते हैं, "जीन उपचार को कैसे प्रभावित करते हैं?", तो जीपीएस जानता है कि "उपचार" से "निदान" की ओर और फिर "जीन" की ओर पीछे की ओर (backward) कैसे जाना है। यह उन रास्तों को अनदेखा कर देता है जो डेड एंड (बंद रास्तों) या अप्रासंगिक विषयों की ओर ले जाते हैं।
- यह आपके प्रश्न का उत्तर देने के लिए आवश्यक घटनाओं की विशिष्ट श्रृंखला (chain of events) को खोज लेता है, और शोर (noise) को नजरअंदाज कर देता है।
4. "स्टोरीटेलर" (जनरेशन/उत्पत्ति)
अंत में, SARG जासूस को मैप पर सटीक मार्ग के साथ-साथ वे मूल समाचार पत्र की कतरनें भी सौंप देता है जो प्रत्येक चरण को सिद्ध करती हैं।
- उपमा: यह कहने के बजाय कि, "यहाँ कागजों का एक ढेर है, अब इसे समझ लो," SARG कहता है: "यह रहा रास्ता: जीन के कारण बीमारी होती है → बीमारी के लिए निदान की आवश्यकता होती है → निदान से उपचार की ओर ले जाता है। यहाँ वे विशिष्ट पृष्ठ हैं जो प्रत्येक चरण को सिद्ध करते हैं। अब, उत्तर लिखें।"
- यह एआई को एक तार्किक पथ का पालन करने के लिए मजबूर करता है, जिससे उसके लिए 'हैलुसिनेट' करना (मनगढ़ंत बातें बनाना) या खो जाना बहुत कठिन हो जाता है।
यह एक बड़ी बात क्यों है?
- शुरुआत में भारी काम नहीं: अन्य विधियाँ प्रश्न पूछने से पहले ही पूरी लाइब्रेरी का एक मैप बनाने की कोशिश करती हैं। इसमें कई दिन लग जाते हैं और यदि नए किताबें आती हैं तो इसे अपडेट करना कठिन होता है। SARG केवल उन विशिष्ट पृष्ठों का उपयोग करके तुरंत (on the fly) मैप बनाता है जिन्हें एआई ने प्रासंगिक पाया है। यह पूरे देश का नक्शा बनाने के बजाय उस पड़ोस का नक्शा बनाने जैसा है जिसमें आप वर्तमान में चल रहे हैं।
- यह पारदर्शी है: क्योंकि SARG आपको अपना "चेन ऑफ थॉट" (मैप रूट) दिखाता है, इसलिए आप देख सकते हैं कि एआई ने वह उत्तर क्यों दिया। आप मैप की जांच कर सकते हैं और कह सकते हैं, "हाँ, यह तर्क सही है।"
- यह बेहतर काम करता है: वित्त (बिटकॉइन की कीमतें) और चिकित्सा (दुर्लभ बीमारियां) से संबंधित परीक्षणों में, SARG ने जटिल, बहु-चरणीय पहेलियों को मानक एआई की तुलना में बहुत बेहतर तरीके से हल किया, जो अक्सर बिखरी हुई जानकारी से भ्रमित हो जाता है।
संक्षेप में: SARG एआई को "पूरी लाइब्रेरी पढ़ने" के बजाय, उत्तर लिखने से पहले तार्किक रूप से बिंदुओं को जोड़ने (connect the dots) की शिक्षा देता है। यह सुरागों के एक अस्त-व्यस्त ढेर को एक स्पष्ट, चरण-दर-चरण कहानी में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।