← नवीनतम पेपर
💬 NLP

Contexts are Never Long Enough: Structured Reasoning for Scalable Question Answering over Long Document Sets

SLIDERS एक ऐसा फ्रेमवर्क है जो विशाल दस्तावेज़ संग्रहों पर स्केलेबल प्रश्न-उत्तर सक्षम बनाता है, जो महत्वपूर्ण जानकारी को एक सुसंगत रिलेशनल डेटाबेस में निकालकर, सीमित LLM कॉन्टेक्स्ट विंडोज़ पर निर्भर रहने के बजाय SQL के माध्यम से संरचित तर्क (structured reasoning) की अनुमति देता है।

मूल लेखक: Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जिसे एक विशाल रहस्य सुलझाने का काम सौंपा गया है। इस रहस्य को सुलझाने के लिए, आपके पास केवल एक नोटबुक नहीं है; आपके पास एक विशाल हवेली के हजारों अलग-अलग कमरों में बिखरे हुए लाखों कागजों के ढेरों टुकड़े हैं।

समस्या: "कागज के टुकड़ों का ढेर" (The "Pile of Scraps" Dilemma)

वर्तमान AI (जैसे ChatGPT) एक बहुत छोटी डेस्क वाले जासूस की तरह है। आप कागज के कुछ टुकड़े रख सकते हैं, उन्हें पढ़ सकते हैं और एक प्रश्न का उत्तर दे सकते हैं। लेकिन यदि आप उन सभी 10 मिलियन टुकड़ों को एक साथ डेस्क पर डाल देते हैं, तो डेस्क ढह जाएगी, कागज उड़ जाएंगे, और जासूस घबरा जाएगा।

भले ही AI एक समय में एक टुकड़ा पढ़ने और उसका सारांश लिखने की चतुराई करे, लेकिन वह "एग्रीगेशन बॉटलनेक" (Aggregation Bottleneck) का सामना करता है। यह ऐसा है जैसे आपने एक टुकड़ा पढ़ा जिसमें लिखा था "संदिग्ध लंबा है" और दूसरा जिसमें लिखा था "संदिग्ध के बाल लाल हैं," लेकिन जब तक आप 1,000वां टुकड़ा पढ़ लेते हैं, तब तक आप पहले दो को भूल चुके होते हैं या आप एक ऐसे टुकड़े से भ्रमित हो जाते हैं जो कहता है "संदंदी छोटा है" (जो वास्तव में किसी और व्यक्ति के बारे में था)।

समाधान: SLIDERS (द मास्टर लाइब्रेरियन)

स्टैनफोर्ड के शोधकर्ताओं ने SLIDERS बनाया है। बिखरे हुए टुकड़ों के ढेर को साधारण सारांश बनाने के बजाय, SLIDERS एक मास्टर लाइब्रेरियन की तरह काम करता है जो उन लाखों कागजों के टुकड़ों को एक व्यवस्थित, खोजने योग्य डिजिटल फाइलिंग कैबिनेट (एक डेटाबेस) में बदल देता है।

यहाँ बताया गया है कि SLIDERS कैसे काम करता है, चरण-दर-चरण:

1. कॉन्टेक्स्टुअलाइज्ड चंकिंग (स्मार्ट सॉर्टिंग)
कागजों को बेतरतीब ढंग से बीच से फाड़ने के बजाय, SLIDERS "हेडर्स" और "टाइटल्स" को देखता है। यह सुनिश्चित करता है कि यदि कोई वाक्य किसी टेबल का हिस्सा है, तो वह पूरी टेबल एक साथ रहे। यह ऐसा है जैसे आप एक नक्शे को ठीक वहीं से आधा न काट दें जहाँ उसका लेजेंड (संकेत) दिया गया हो।

2. स्कीमा इंडक्शन (ब्लूप्रिंट)
फाइलिंग शुरू करने से पहले, लाइब्रेरियन एक प्रणाली तय करता है। यदि प्रश्न "कंपनी के मुनाफे" के बारे में है, तो लाइब्रेरियन विशिष्ट फोल्डर बनाएगा लेबल वाले: कंपनी का नाम, वर्ष, कुल राजस्व, और मुद्रा। यह सुनिश्चित करता है कि हर जानकारी एक विशिष्ट, अनुमानित स्लॉट में जाए।

3. स्ट्रक्चर्ड एक्सट्रैक्शन (डेटा एंट्री क्लर्क)
AI कागजों के टुकड़ों के माध्यम से जाता है और एक पैराग्राफ लिखने के बजाय, एक फॉर्म भरता है। यह सिर्फ यह नहीं कहता कि "कंपनी ने बहुत पैसा कमाया"; बल्कि यह लिखता है: कंपनी: Apple | वर्ष: 2023 | लाभ: $97B | मुद्रा: USD। यह प्रत्येक प्रविष्टि के लिए एक "रसीद" (प्रोवेनेंस) भी रखता है, ताकि यह साबित कर सके कि वह जानकारी कागज के किस टुकड़े से आई है।

4. डेटा रीकंसीलिएशन (फैक्ट-चेकर)
यही असली सफलता का मंत्र है। कभी-कभी एक टुकड़ा कहता है "Apple का मुनाफा $97B था" और दूसरा कहता है "Apple ने $97,000,000,000 कमाए।" एक सामान्य AI को लग सकता है कि ये दो अलग चीजें हैं। SLIDERS के पास एक "रीकंसीलिएशन एजेंट" होता है जो इन दोनों को देखता है, महसूस करता है कि ये एक ही हैं, और उन्हें एक साफ, सटीक रिकॉर्ड में मिला देता है। यह संघर्षों को सुलझाता है, डुप्लिकेट्स को हटाता है, और खाली जगहों को भरता है।

5. SQL रीजनिंग (एक्सपर्ट रिसर्चर)
अंत में, जब आप "किस कंपनी का कर्ज 2022 में सबसे कम था?" जैसा प्रश्न पूछते हैं, तो AI अब दस्तावेजों को "पढ़ता" नहीं है। यह सीधे फाइलिंग कैबिनेट को एक सटीक कमांड (SQL) भेजता है: "हे, 'Debt' कॉलम को देखो, '2022' के लिए फ़िल्टर करो, और सबसे कम संख्या बताओ।" डेटाबेस तुरंत और सटीक उत्तर देता है।

यह एक बड़ी बात क्यों है?

  • यह स्केलेबल है: क्योंकि यह एक डेटाबेस का उपयोग करता है, इससे कोई फर्क नहीं पड़ता कि आपके पास 1,000 दस्तावेज़ हैं या 1,000,000। "डेस्क" कभी भी बहुत भीड़भाड़ वाली नहीं होती।
  • यह सटीक है: यह "भ्रमित" (hallucinate) नहीं होता या दूर की जानकारी से उलझता नहीं है क्योंकि यह केवल टेक्स्ट के आधार पर अनुमान लगाने के बजाय स्ट्रक्चर्ड डेटा पर गणित और तर्क का उपयोग कर रहा है।
  • यह ऑडिटेबल है: यदि AI आपको कोई उत्तर देता है, तो आप "रसीदों" के माध्यम से मूल दस्तावेज़ के सटीक पृष्ठ और पंक्ति तक वापस जा सकते हैं। यह केवल "मुझ पर विश्वास करो" नहीं है; यह "यहाँ प्रमाण है" है।

संक्षेप में: SLIDERS बिखरे हुए अव्यवस्थित टेक्स्ट के ढेर को एक हाई-स्पीड, अत्यंत सटीक, खोजने योग्य विश्वकोश में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →