← नवीनतम पेपर
💬 NLP

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

यह शोध पत्र FT-RAG प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो तालिकाओं को प्रविष्टि-स्तर की सिमेंटिक इकाइयों में विभाजित करता है और जटिल तालिका तर्क (टेबल रीजनिंग) में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करने के लिए स्ट्रक्चरल नेबर एक्सपेंशन का उपयोग करता है, जिसे नए प्रस्तावित Multi-Table-RAG-Lib बेंचमार्क द्वारा समर्थित किया गया है।

मूल लेखक: Zebin Guo, Weidong Geng, Ruichen Mao

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zebin Guo, Weidong Geng, Ruichen Mao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल केस को सुलझाने की कोशिश कर रहे हैं। आपका सबूत केवल बिखरे हुए नोट्स का ढेर नहीं है; यह हजारों स्प्रेडशीट्स (टेबल्स) और लंबी रिपोर्टों (टेक्स्ट) से भरी एक विशाल फाइलिंग कैबिनेट है।

वर्तमान AI जासूस (लार्ज लैंग्वेज मॉडल्स) लंबी रिपोर्टों को पढ़ने में बहुत अच्छे हैं, लेकिन जब वे स्प्रेडशीट्स पर पहुँचते हैं, तो वे भ्रमित हो जाते हैं। वे अक्सर एक पूरी स्प्रेडशीट को एक ही, अस्त-व्यस्त पैराग्राफ की तरह देखते हैं, या वे इसे एक लिस्ट में बदलने की कोशिश करते हैं। इससे वे विशिष्ट सेल में छिपे सूक्ष्म और महत्वपूर्ण विवरणों को 놓 (miss) कर देते हैं, जैसे कि किसी विशिष्ट पंक्ति और कॉलम में कोई विशिष्ट संख्या। वे सही विषय तो ढूंढ सकते हैं, लेकिन गलत संख्या उठा सकते हैं।

यह शोध पत्र FT-RAG (फाइन-ग्रेन्ड टेबल-अवेयर रिट्रीवल-ऑगमेंटेड जनरेशन) पेश करता है, जो एक नया सिस्टम है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसका सरल अवधारणाओं में विवरण यहाँ दिया गया है:

1. समस्या: "पूरा पाई" बनाम "एक टुकड़ा"

एक पारंपरिक AI के बारे में सोचें जो एक टेबल को ऐसे पढ़ता है जैसे कोई एक ही बार में पूरा पिज्जा खाने की कोशिश कर रहा हो। वे पूरे पिज्जा को बिना स्वाद लिए निगल लेते हैं (पूरा टेबल)। यदि आप पूछते हैं, "मार्च में लाभ क्या था?" और AI केवल पूरा "वित्तीय रिपोर्ट" वाला पेज उठा लेता है, तो उसे यह अनुमान लगाने के लिए संघर्ष करना पड़ता है कि कौन सी संख्या लाभ की है और कौन सी लागत की। यह अव्यवस्थित है और गलतियों की संभावना अधिक है।

2. समाधान: FT-RAG का "लेगो" दृष्टिकोण

FT-RAG खेल बदल देता है क्योंकि यह AI के देखने से पहले ही टेबल को उसके सबसे छोटे, सबसे सार्थक टुकड़ों में तोड़ देता है।

  • चरण 1: माइक्रो-स्कैनिंग (एंट्री-लेवल डिकंपोजिशन)
    टेबल को एक बड़े ब्लॉक के रूप में देखने के बजाय, FT-RG इसे व्यक्तिगत "सेल ग्रुप्स" में तोड़ देता है। कल्पना करें कि आप स्प्रेडशीट के हर एक वर्ग को एक सुरक्षात्मक बुलबुले में लपेट रहे हैं। उस बुलबुले के अंदर, AI केवल संख्या "500" नहीं देखता; वह "500," प्लस कॉलम हेडर "राजस्व (Revenue)," रो हेडर "Q1," और डॉक्यूमेंट टाइटल "2024 वार्षिक रिपोर्ट" भी देखता है। वह बिल्कुल जानता है कि वह संख्या कहाँ रहती है।

  • चरण 2: "SAT" मैप बनाना (स्ट्रक्चर्ड ग्राफ)
    एक बार जब डेटा इन छोटे बुलबुलों में टूट जाता है, तो FT-RAG एक विशाल, व्यवस्थित मानचित्र बनाता है जिसे SAT ग्राफ कहा जाता है।

    • S (Subject/विषय): यह किसके बारे में है? (जैसे, "कंपनी A")
    • A (Attribute/विशेषता): हम क्या माप रहे हैं? (जैसे, "राजस्व")
    • T (Temporal/समय): यह कब हुआ था? (जैसे, "2024")

    इस मैप को एक सबवे सिस्टम की तरह समझें। पूरे दस्तावेज़ (शहर) में बिना किसी दिशा के भटकने के बजाय, AI एक ट्रेन पर चढ़ता है जो सीधे "कंपनी A" से "राजस्व" और फिर "2024" तक जाती है। यह डॉट्स को तार्किक रूप से जोड़ता है, यह सुनिश्चित करता है कि जो संख्या वह ढूंढ रहा है वह वास्तव में सही समय और सही कंपनी से जुड़ी है।

  • चरण 3: "पड़ोसी" की जाँच (स्ट्रक्चरल नेबर एक्सपेंशन)
    कभी-कभी, उत्तर केवल एक संख्या नहीं होता; यह एक ट्रेंड (प्रवृत्ति) होता है। यदि आप पूछते हैं, "राजस्व में कैसे वृद्धि हुई?", तो AI को 2023 और 2024 का डेटा देखने की आवश्यकता होगी। FT-RAG में एक विशेष फीचर है जो मैप पर अपने "पड़ोसियों" की स्वचालित रूप से जाँच करता है। यदि इसे 2024 का डेटा मिलता है, तो यह तुरंत उसके बगल वाले 2023 के डेटा को भी निकाल लेता है, ठीक वैसे ही जैसे एक जासूस पूरी तस्वीर पाने के लिए संदिग्ध के पड़ोसी के अलबी (alibi) की जाँच करता है।

  • चरण 4: सामग्रियों को मिलाना (मल्टी-मोडल फ्यूजन)
    टेबल्स अक्सर शुष्क होते हैं और उनमें संदर्भ (context) की कमी होती है। रिपोर्ट के आसपास के टेक्स्ट के आधार पर एक संख्या एक रिपोर्ट में "लाभ" और दूसरी में "हानि" हो सकती है। FT-RAG मैप पर पाए गए सटीक नंबर को लेता है और यह समझाने के लिए कि वह नंबर क्यों महत्वपूर्ण है, रिपोर्ट से पास के वाक्यों को भी साथ ले आता है। यह हार्ड डेटा (टेबल) को कहानी (टेक्स्ट) के साथ जोड़ देता है ताकि AI पूर्ण संदर्भ समझ सके।

3. नया प्रशिक्षण मैदान: Multi-Table-RAG-Lib

लेखकों ने महसूस किया कि इस नए जासूस को टेस्ट करने के लिए उन्हें पहले से मौजूद परीक्षणों से कठिन टेस्ट की आवश्यकता है। अधिकांश टेस्ट केवल एक सिंगल टेबल के बारे में सरल प्रश्न पूछते हैं (जैसे "आइटम X की कीमत क्या है?")।

उन्होंने एक नई, विशाल लाइब्रेरी बनाई जिसे Multi-Table-RAG-Lib कहा जाता है।

  • चुनौती: इस लाइब्रेरी में लगभग 10,000 प्रश्न हैं जिनके लिए AI को कई अलग-अलग टेबल्स के बीच कूदने और उस डेटा को टेक्स्ट के साथ मिलाने की आवश्यकता होती है।
  • लक्ष्य: यह AI को एक साधारण सर्च इंजन होने के बजाय, एकीकरण (integration) का मास्टर बनने के लिए मजबूर करता है।

4. परिणाम: एक स्पष्ट विजय

जब उन्होंने FT-RAG को अन्य शीर्ष AI सिस्टमों के खिलाफ टेस्ट किया:

  • सटीकता (Accuracy): इसने अन्य सभी की तुलना में बहुत अधिक बार सही विशिष्ट डेटा पॉइंट (सेल) खोजे। इसने सही सेल खोजने की क्षमता में लगभग 60% का सुधार किया।
  • सत्यता (Truthfulness): जब AI ने उत्तर जेनरेट किया, तो इसकी संभावना बहुत अधिक थी कि वह वास्तविक संख्याओं को सही ढंग से बताएगा (सटीक मान सटीकता में 62% का सुधार)।
  • निरंतरता (Consistency):적으로: यह केवल भाग्यशाली नहीं था; इसने सभी प्रकार के कठिन, मल्टी-टेबल प्रश्नों में लगातार प्रतिस्पर्धा को पछाड़ दिया।

सारांश

संक्षेप में, FT-RAG एक जासूस को एक ऐसे व्यक्ति से अपग्रेड करने जैसा है जो सुराग खोजने के लिए पूरी फाइल फोल्डर को पढ़ने की उम्मीद करता है, बजाय एक ऐसे फोरेंसिक विशेषज्ञ के जिसके पास हर एक सबूत का हाई-टेक मैप है, उसे पता है कि वे कैसे जुड़ते हैं, और वह संख्याओं का अर्थ समझने के लिए तुरंत आसपास की कहानी को भी साथ ले सकता है। यह AI को भ्रमित होने या अनुमान लगाने से रोकता है और उसके उत्तरों को डेटा की सटीक, संरचित वास्तविकता पर आधारित होने के लिए मजबूर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →