← नवीनतम पेपर
💬 NLP

Self-Correcting RAG: Enhancing Faithfulness via MMKP Context Selection and NLI-Guided MCTS

यह शोध पत्र सेल्फ-करेक्टिंग RAG का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो संदर्भ चयन को एक बहु-आयामी मल्टीपल-चॉइस नैपसैक समस्या के रूप में पुनर्गठित करके और जनरेट किए गए उत्तरों को गतिशील रूप से मान्य करने के लिए NLI-निर्देशित मोंटे कार्लो ट्री सर्च का उपयोग करके जटिल तर्क कार्यों में निष्ठा (faithfulness) को बढ़ाता है, जिससे सटीकता में उल्लेखनीय सुधार होता है और मतिभ्रम (hallucinations) कम होता है।

मूल लेखक: Shijia Xu, Zhou Wu, Xiaolong Jia, Yu Wang, Kai Liu, April Xiaowen Dong

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shijia Xu, Zhou Wu, Xiaolong Jia, Yu Wang, Kai Liu, April Xiaowen Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े भुलक्कड़ जासूस (Large Language Model) हैं जो एक जटिल रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास परामर्श करने के लिए किताबों का एक विशाल पुस्तकालय है (Internet/Database), लेकिन आप एक बार में केवल कुछ ही पन्ने अपनी जेब में रख सकते हैं (Token Budget)।

समस्या क्या है? जब आप अपने जासूस को एक पेचीदा मामला सुलझाने के लिए कहते हैं, तो अक्सर दो चीजें गलत होती हैं:

  1. खराब पैकिंग (Bad Packing): आप एक ही चीज़ के बारे में तीन पन्ने उठा लेते हैं और उस एक पन्ने को छोड़ देते जिसमें वास्तव में सुराग छिपा होता है।
  2. अंधाधुंध अनुमान (Wild Guessing): सही पन्ने होने के बावजूद, आपका जासूस "भ्रमित" (hallucinate) हो सकता है क्योंकि वह कहानी को जल्दी से खत्म करने के लिए बहुत उत्सुक है।

यह पेपर इन दो समस्याओं को ठीक करने के लिए Self-Correcting RAG नामक एक नई प्रणाली पेश करता है। इसे अपने जासूस को एक स्मार्ट लाइब्रेरियन (Smart Librarian) और एक सख्त संपादक (Strict Editor) देने के रूप में समझें।

भाग 1: स्मार्ट लाइब्रेरियन (MMKP Context Selection)

समस्या:
आमतौर पर, जब आप कोई प्रश्न पूछते हैं, तो कंप्यूटर बस सबसे अधिक "प्रासंगिक" (relevant) शीर्ष 3 दस्तावेज़ उठा लेता है। कल्पना कीजिए कि आप पूछते हैं, "उस कंपनी की स्थापना किसने की जिसने DeepMind को खरीदा?"

  • कंप्यूटर DeepMind के शानदार AI गेम्स (AlphaGo, आदि) के बारे में 3 लेख ढूँढता है।
  • वह चौथे लेख को अनदेखा कर देता जिसमें वास्तव में CEO का नाम दिया गया है क्योंकि वह "कीवर्ड-हैवी" होने के मामले में थोड़ा कम है।
  • परिणाम: आपके जासूस के पास ढेर सारा फालतू सामान है और कोई उत्तर नहीं है।

समाधान (Knapsack Analogy):
लेखक दस्तावेज़ चयन को हाइकिंग ट्रिप के लिए बैकपैक पैक करने की तरह मानते हैं।

  • आपके पास वजन की एक सख्त सीमा है (Token Budget)।
  • आपके पास कई वस्तुएं हैं (दस्तावेज़)।
  • कुछ वस्तुएं डुप्लिकेट हैं (एक ही रास्ते के तीन नक्शे)।
  • कुछ वस्तुएं आवश्यक हैं (एक कंपास, एक पानी की बोतल)।

केवल "सबसे भारी" वस्तुओं (सबसे अधिक प्रासंगिक) को उठाने के बजाय, यह प्रणाली Multi-Dimensional Multiple-Choice Knapsack Problem (MMKP) नामक एक गणितीय पहेली को हल करती है।

  • यह समान दस्तावेज़ों को एक साथ समूहित करता है (जैसे सभी नक्शों को समूहित करना)।
  • यह सिस्टम को प्रत्येक समूह से केवल एक वस्तु चुनने के लिए मजबूर करता है ताकि दोहराव से बचा जा सके।
  • यह सुनिश्चित करता है कि बैकपैक में वजन की सीमा के भीतर सबसे अधिक विविध और उपयोगी जानकारी हो।

संक्षेप में: स्मार्ट लाइब्रेरियन यह सुनिश्चित करता है कि आपका जासूस एक ही सुराग की तीन प्रतियों के बजाय अद्वितीय, उच्च-मूल्य वाले सुरागों का मिश्रण लेकर चले।

भाग 2: सख्त संपादक (NLI-Guided MCTS)

समस्या:
सही सुराग होने के बाद भी, आपका जासूस अभी भी आत्मविश्वासी और गलत हो सकता है। वह कह सकता है, "मुझे यकीन है कि CEO लैरी पेज हैं!" सिर्फ इसलिए क्योंकि वह प्रसिद्ध हैं, भले ही दस्तावेज़ कुछ और कहते हों। यह एक भ्रम (hallucination) है।

समाधान (Tree Search Analogy):
एक सामान्य चैटबॉट की तरह एक सीधी रेखा में उत्तर लिखने के बजाय, यह प्रणाली Monte Carlo Tree Search (MCTS) का उपयोग करती है। कल्पना कीजिए कि जासूस एक "चुनें-अपनी-अपनी-मंजिल" (choose-your-own-adventure) वाली किताब की खोज कर रहा है।

  1. शाखाओं का विस्तार (Branching Out): जासूस एक वाक्य लिखता है। फिर, वह रुकता है और पूछता है, "क्या होगा अगर मैं कुछ और कहता?" वह उत्तर के लिए कई संभावित रास्तों (शाखाओं) की खोज करता है।
  2. तथ्य-जांचकर्ता (The Fact-Checker - NLI): हर कदम पर, एक "सख्त संपादक" (एक Natural Language Inference मॉडल) जाँचता है: "क्या यह वाक्य हमारे पास मौजूद दस्तावेज़ों के साथ तार्किक रूप से मेल खाता है?"
    • यदि जासूस कहता है, "लैरी पेज CEO थे," और दस्तावेज़ कहते हैं "शमिट CEO थे," तो संपादक मेज थपथपाकर चिल्लाता है: "विरोधाभास!" (CONTRADICTION!) और उस शाखा को काट देता है।
    • यदि जासूस कहता है, "शमिट CEO थे," और दस्तावेज़ इससे सहमत होते हैं, तो संपादक अंगूठा दिखाकर कहता है: "अनुमानित/पुष्टि" (ENTAILMENT!) और उस पथ को बढ़ने देता है।
  3. स्व-सुधार (Self-Correction): सिस्टम कई रास्तों की खोज करता है, उन रास्तों को खत्म कर देता है जो सबूतों का खंडन करते हैं, और उस पथ को विकसित करता है जो तथ्यों के प्रति सबसे अधिक वफादार है।

संक्षेप में: सख्त संपादक यह सुनिश्चित करता है कि जासूस किसी भी उत्तर पर प्रतिबद्ध होने से पहले सबूतों के विरुद्ध अपने काम की दोबारा जाँच करे, जिससे मनगढ़ंत कहानियों को हटाया जा सके।

भव्य परिणाम

स्मार्ट लाइब्रेरियन (जो सुरागों का एक आदर्श बैकपैक पैक करता है) और सख्त संपादक (जो कहानी के हर कदम की जाँच करता है) को मिलाकर, यह प्रणाली इसमें बहुत बेहतर हो जाती है:

  • जटिल तर्क (Complex Reasoning): ऐसी पहेलियाँ सुलझाना जिनमें कई दस्तावेज़ों के बीच कड़ियों को जोड़ने की आवश्यकता होती है।
  • सटीकता (Accuracy): जासूस को मनगढ़ंत बातें बनाने से रोकना।

इस पेपर ने छह अलग-अलग "रहस्य" डेटासेट्स पर इसका परीक्षण किया। परिणाम क्या रहा? नए सिस्टम ने पिछले तरीकों की तुलना में जटिल पहेलियों को काफी बेहतर तरीके से सुलझाया और बहुत कम गलतियाँ कीं। यह आपके जासूस को एक ऐसे नौसिखिए से एक अनुभवी पेशेवर में अपग्रेड करने जैसा है जो अंदाज़ा लगाने के बजाय अपने नोट्स की जाँच करता है और बोलने से पहले सोचता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →