← नवीनतम पेपर
💻 computer science

SPIRE: Structure-Preserving Interpretable Retrieval of Evidence

SPIRE एक अर्ध-संरचित (semi-structured) HTML दस्तावेज़ों के लिए एक संरचना-संरक्षण (structure-preserving) रिट्रीवल फ्रेमवर्क है जो वृक्ष-संरचित उप-दस्तावेजों (tree-structured subdocuments) को इंडेक्स करने और वैश्विक एवं स्थानीय संदर्भ तंत्र (global and local contextualization mechanisms) लागू करने द्वारा उद्धरण की गुणवत्ता और व्याख्यात्मकता में सुधार करता है, जो प्रश्न-उत्तर कार्यों में पारंपरिक फ्लैट-चंक (flat-chunk) बेसलाइन से बेहतर प्रदर्शन करता है।

मूल लेखक: Mike Rainey, Umut Acar, Muhammed Sezer

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mike Rainey, Umut Acar, Muhammed Sezer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय में एक विशिष्ट तथ्य खोजने की कोशिश कर रहे हैं, लेकिन लाइब्रेरियन का एक अजीब नियम है: वे आपको केवल किताबों से फटे हुए एकल वाक्य देते हैं, जिसमें कोई पेज नंबर, कोई अध्याय शीर्षक या कोई संदर्भ नहीं होता।

यदि वाक्य है "यह सबसे अच्छा समय था," तो आपको पता ही नहीं चलेगा कि यह ए टेल ऑफ टू सिटीज से है, किसी इतिहास की किताब से है, या किसी रेसिपी (नुस्खे) से। यदि वाक्य है "उत्तर 42 है," तो आपको पता नहीं चलेगा कि वह किस प्रश्न का उत्तर दे रहा है। यह बिल्कुल वही समस्या है जिसका सामना वर्तमान AI सर्च इंजन (RAG) जटिल वेब पेजों (HTML) के साथ करते हैं। वे सब कुछ एक लंबी, बिखरी हुई टेक्स्ट चंक्स (टुकड़ों) की सूची में बदल देते हैं, जिससे वह संरचना खो जाती है जो जानकारी को अर्थपूर्ण बनाती है।

SPIRE (स्ट्रक्चर-प्रिजर्विंग इंटरप्रिटेबल रिट्रीवल ऑफ एविडेंस) एक नया सिस्टम है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "फ्लैट" लाइब्रेरी

वर्तमान AI सिस्टम वेबसाइट को टेप की एक लंबी पट्टी की तरह मानते हैं। वे टेप को AI को खिलाने के लिए समान आकार के टुकड़ों (चंक्स) में काट देते हैं।

  • समस्या: यदि आप टेप को किसी सूची, तालिका (टेबल) या वाक्य के ठीक बीच में काट देते हैं, तो वह टुकड़ा बेकार हो जाता है। अपने रो (row) और कॉलम (column) हेडर के बिना एक टेबल सेल उस पहेली के टुकड़े की तरह है जिस पर कोई चित्र नहीं है। हेडिंग के बिना एक बुलेट पॉइंट भ्रमित करने वाला होता है।

2. समाधान: "ट्री" (वृक्ष) मैप

SPIRE दस्तावेजों को टेप की एक पट्टी के रूप में नहीं, बल्कि एक फैमिली ट्री (वंशवृक्ष) के रूप में मानता है।

  • अवधारणा: प्रत्येक टेक्स्ट का एक विशिष्ट "पता" (एक पाथ) होता है। उसे पता होता है कि वह किस "कमरे" (सेक्शन) में है, उसका "पैरेंट" (हेडिंग) कौन है, और उसके पास कौन से "सिब्लिंग्स" (अन्य लिस्ट आइटम्स) हैं।
  • लाभ: एक रैंडम चंक उठाने के बजाय, SPIRE पेड़ में एक विशिष्ट "नोड" को पकड़ता है और जानता है कि अपने आसपास के परिवेश को कैसे पुनर्गठित करना है।

3. दो-चरणीय जादू का खेल

SPIRE जगह बर्बाद किए बिना आपको सटीक उत्तर देने के लिए एक चतुर दो-चरणीय प्रक्रिया का उपयोग करता है।

चरण A: "ग्लोबल" संदर्भ (द फ्रेम)

जब सिस्टम एक प्रासंगिक वाक्य पाता है, तो वह केवल आपको वाक्य नहीं दिखाता। वह पहले पूछता है: "इस तस्वीर के चारों ओर का फ्रेम क्या है?"

  • उपमा: कल्पना करें कि आप भीड़ में किसी व्यक्ति की फोटो पाते हैं। यदि आप केवल व्यक्ति को दिखाते हैं, तो आपको पता नहीं चलेगा कि वे कौन हैं। SPIRE स्वचालित रूप से "फ्रेम" जोड़ देता है: पेज का शीर्षक (Title), सेक्शन हेडर (जैसे "मुख्य निष्कर्ष"), और लिस्ट स्ट्रक्चर
  • क्यों महत्वपूर्ण है: यह सुनिश्चित करता है कि भले ही आप केवल एक वाक्य पढ़ें, आप जानते हैं कि वह कहाँ से आया है और वह किस श्रेणी में आता है। यह जार पर लेबल लगाने जैसा है ताकि आप जान सकें कि यह "जैम" है न कि "जेली"।

चरण B: "लोकल" संदर्भ (द नेबरहुड)

एक बार जब सिस्टम के पास फ्रेम किया हुआ वाक्य आ जाता है, तो वह तुरंत आस-पास के पड़ोस को देखता है।

  • उपमा: यदि आप सड़क पर एक विशिष्ट घर की तलाश कर रहे हैं, तो आप केवल घर का नंबर नहीं चाहते; आप घर और उसके बगल के दो घरों को भी देखना चाहते हैं ताकि आप सुनिश्चित हो सकें कि आप सही ब्लॉक में हैं।
  • फ़िल्टर: SPIRE दृश्य को विस्तारित करता है ताकि इसमें आस-पास का पैराग्राफ या लिस्ट आइटम्स शामिल हो सकें। फिर, यह अनावश्यक बातों को हटाने के लिए एक स्मार्ट AI "एडिटर" का उपयोग करता है। यह केवल उन हिस्सों को रखता है जो वास्तव में आपके प्रश्न का उत्तर देने में मदद करते हैं, यह सुनिश्चित करते हुए कि अंतिम उत्तर संक्षिप्त लेकिन पूर्ण हो।

4. "बजट" की उपमा

कल्पना कीजिए कि आपके पास एक बैकपैक है जिसमें वजन की एक सख्त सीमा (टोकन बजट) है।

  • पुराना तरीका: आप 5 भारी, बड़े बक्से (टेक्स्ट के बड़े चंक्स) पैक करते हैं। आप केवल 2 ही ले जा सकते हैं और उनमें अप्रासंगिक जानकारी हो सकती है।
  • SPIRE का तरीका: आप 20 हल्के, सटीक आइटम (वाक्य) पैक करते हैं। क्योंकि SPIRE जानता है कि "फ्रेम" (टाइटल और हेडर) को सभी आइटम्स के बीच कैसे साझा किया जाए, इसलिए आपको हर बार भारी फ्रेम ले जाने की आवश्यकता नहीं है। आप इसे एक बार ले जाते हैं, और यह आपके सभी आइटम्स पर लागू हो जाता है।
  • परिणाम: आप वजन की सीमा तोड़े बिना अपने बैकपैक में बहुत अधिक उपयोगी जानकारी समाहित कर सकते हैं।

5. अंतिम परिणाम: "साइटेशन" (उद्धरण)

जब SPIRE आपको उत्तर देता है, तो वह केवल यह नहीं कहता कि "यहाँ टेक्स्ट है।" वह आपको एक सटीक साइटेशन देता है।

  • उपमा: यह कहने के बजाय कि "मुझे एक किताब में एक कोट मिला," यह कहता है, "पेज 42, अध्याय 3, पैराग्राफ 2, बुलेट पॉइंट B पर मुझे यह उद्धरण मिला।"
  • क्योंकि यह "ट्री स्ट्रक्चर" को बनाए रखता है, आप उस साइटेशन पर क्लिक कर सकते हैं और मूल दस्तावेज़ में ठीक उसी स्थान पर जा सकते हैं, जहाँ लेखक ने इसे इच्छित संदर्भ (शीर्षक, हेडर, टेबल) के साथ रखा था।

सारांश

SPIRE एक सुपर-स्मार्ट लाइब्रेरियन की तरह है जो किताबों के पन्ने फाड़ने से इनकार करता है। इसके बजाय, वे आपको आवश्यक पैराग्राफ खोजने के लिए एक मानचित्र का उपयोग करते हैं, संदर्भ समझने के लिए स्वचालित रूप से अध्याय का शीर्षक और सेक्शन हेडर जोड़ते हैं, और फिर अनावश्यक चीजों को हटा देते हैं ताकि आपको केवल सबसे प्रासंगिक जानकारी मिले। यह AI के उत्तरों को अधिक सटीक, अधिक विश्वसनीय और समझने में बहुत आसान बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →