← नवीनतम पेपर
🤖 AI

Shapley Context Pruning: A Cooperative Game Perspective for Context Reranking and Pruning

यह शोध पत्र शैपली कॉन्टेक्स्ट प्रूनिंग (SCP) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में संदर्भ को कुशलतापूर्वक पुनर्व्यवस्थित और छंटनी करने के लिए सहकारी गेम थ्योरी और डीप सेट्स आर्किटेक्चर को लागू करता है, जो एक गणितीय रूप से कठोर, स्केलेबल और व्याख्यात्मक दृष्टिकोण प्रदान करता है जो प्रतिस्पर्धी डाउनस्ट्रीम QA प्रदर्शन प्राप्त करता है।

मूल लेखक: Yanqiao Chen, Dongsheng Hou, Yuhan Rui, Zhen Cao, Yepang Liu

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yanqiao Chen, Dongsheng Hou, Yuhan Rui, Zhen Cao, Yepang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पहेली को हल करने की कोशिश कर रहे हैं, लेकिन आपके पास कुछ स्पष्ट टुकड़ों के बजाय, हजारों टुकड़ों वाला एक विशाल, अराजक डिब्बा है। कुछ टुकड़े बिल्कुल वही हैं जिनकी आपको तस्वीर पूरी करने के लिए आवश्यकता है, जबकि अधिकांश टुकड़े केवल रंगीन कचरा, डुप्लिकेट या किसी पूरी तरह से अलग पहेली के हिस्से हैं। यह आधुनिक आर्टिफिशियल इंटेलिजेंस (AI) की दैनिक वास्तविकता है जब वह बहुत सारी टेक्स्ट जानकारी का उपयोग करके प्रश्नों के उत्तर देने का प्रयास करता है। AI, जिसे लार्ज लैंग्वेज मॉडल (LLM) कहा जाता है, अविश्वसनीय रूप से स्मार्ट है, लेकिन यदि आप इसे एक बार में बहुत अधिक जानकारी देते हैं, तो यह अभिभूत हो जाता है। यह भ्रमित होने लगता है, महत्वपूर्ण विवरणों को छोड़ देता है, या सन्नाटे को भरने के लिए चीजें बनाना भी शुरू कर देता है। वैज्ञानिक इसे "हैलुसिनेशन" (hallucination) कहते हैं।

इसे ठीक करने के लिए, शोधकर्ता 'रिट्रीवल-ऑगमेंटेड जनरेशन' (RAG) नामक एक प्रणाली का उपयोग करते हैं। इसे एक ऐसे लाइब्रेरियन के रूप में सोचें जो पहले प्रासंगिक पुस्तकों का एक ढेर ढूंढता है (रिट्रीवल/प्राप्ति) और फिर उन्हें पढ़ने के लिए AI को देता है। लेकिन यहाँ एक पेच है: वह पुस्तकों का ढेर अक्सर अभी भी बहुत बड़ा होता है। AI को बोरिंग, बेकार पन्नों को जल्दी से फेंकने और केवल सबसे महत्वपूर्ण वाक्यों को रखने के तरीके की आवश्यकता होती है। इसे "कॉन्टेक्स्ट प्रूनिंग" (context pruning) कहा जाता है। अब तक, इसे करने के अधिकांश तरीके अनुमान लगाने वाले खेल की तरह थे—वे सरल नियमों का उपयोग करते थे या इस बात की नकल करने की कोशिश करते थे कि मनुष्य कैसे पढ़ते हैं, लेकिन उनमें यह समझाने का कोई ठोस, गणितीय तरीका नहीं था कि एक विशिष्ट वाक्य क्यों महत्वपूर्ण था। वे बिना किसी स्पष्ट सिद्धांत के केवल "काफी अच्छे" अनुमान थे।

यह शोध पत्र इस अनुमान लगाने वाले खेल को हल करने का एक चतुर नया तरीका पेश करता है, जिसे शापली कॉन्टेक्स्ट प्रूनिंग (SCP) कहा जाता है। लेखकों ने अनुमान लगाना बंद करने और सहयोग के खेल को शुरू करने का निर्णय लिया। वे टेक्स्ट के प्रत्येक वाक्य को एक टीम में एक "खिलाड़ी" के रूप में देखते हैं। इस खेल में, लक्ष्य यह पता लगाना है कि प्रत्येक खिलाड़ी टीम की सफलता में कितना योगदान देता है। यदि एक वाक्य अपने आप में बेकार है लेकिन दूसरे वाक्य के साथ जुड़ने पर अत्यंत महत्वपूर्ण हो जाता है (जैसे दो विचारों को जोड़ने वाला एक पुल), तो सिस्टम को उस टीमवर्क को पहचानने की आवश्यकता होती है। यह शोध पत्र शापली वैल्यू (Shapley value) नामक एक गणितीय अवधारणा का उपयोग करता है, जो गेम थ्योरी से आती है और सभी खिलाड़ियों के बीच "पुरस्कार" (एक सही उत्तर) को उनके वास्तविक योगदान के आधार पर निष्पक्ष रूप से विभाजित करने के लिए डिज़ाइन की गई है।

शोधकर्ताओं ने एक हल्का, तेज़ कंप्यूटर प्रोग्राम बनाया है जो इस खेल के लिए एक रेफरी के रूप में कार्य करता है। वाक्यों के हर संभावित संयोजन को पढ़ने के बजाय (जिसमें अनंत समय लगेगा), यह स्टार खिलाड़ियों का तेजी से अनुमान लगाने के लिए मोंटे-कार्लो सैंपलिंग (Monte-Carlo sampling) नामक एक स्मार्ट सैंपलिंग ट्रिक का उपयोग करता है। उन्होंने पाया कि यह तरीका अविश्वसनीय रूप से कुशल है, जो भारी काम करने के लिए केवल लगभग 3 मिलियन पैरामीटर्स वाले एक बहुत छोटे मॉडल का उपयोग करता है (जो AI मानकों के लिए बहुत छोटा है)। जब उन्होंने कठिन प्रश्नों पर परीक्षण किया जिनमें कई तथ्यों को जोड़ने की आवश्यकता होती है, तो उनके तरीके ने पुराने, भारी तरीकों की तुलना में सबसे महत्वपूर्ण जानकारी को बेहतर ढंग से बनाए रखा। इसने केवल अनुमान नहीं लगाया; इसने यह सुनिश्चित करने के लिए औपचारिक सैद्धांतिक त्रुटि सीमाएं (formal theoretical error bounds) प्रदान कीं कि किन वाक्यों को "टीम कैप्टन" के रूप में चुना गया था, वह गणितीय रूप से कठोर और विश्वसनीय था।

यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण एक बड़ी प्रगति है क्योंकि यह कॉन्टेक्स्ट प्रूनिंग को एक अव्यवस्थित, परीक्षण-और-त्रुटि प्रक्रिया से एक संरचित, निष्पक्ष और व्याख्या योग्य प्रणाली में बदल देता है। हालांकि यह अभी भी हर स्थिति के लिए पूर्ण होने का दावा नहीं करता है, प्रयोगों से पता चलता है कि यह AI को केंद्रित और सटीक रखने के लिए बहुत अच्छा काम करता है, भले ही टेक्स्ट लंबा और जटिल हो। यह AI को स्मार्ट चश्मे देने जैसा है जो तुरंत कहानी के सबसे महत्वपूर्ण हिस्सों को हाइलाइट कर देते हैं, जिससे यह सुनिश्चित होता है कि वह शोर में खो न जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →