FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning
यह शोध पत्र FT-RAG प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो तालिकाओं को प्रविष्टि-स्तर की सिमेंटिक इकाइयों में विभाजित करता है और जटिल तालिका तर्क (टेबल रीजनिंग) में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करने के लिए स्ट्रक्चरल नेबर एक्सपेंशन का उपयोग करता है, जिसे नए प्रस्तावित Multi-Table-RAG-Lib बेंचमार्क द्वारा समर्थित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल केस को सुलझाने की कोशिश कर रहे हैं। आपका सबूत केवल बिखरे हुए नोट्स का ढेर नहीं है; यह हजारों स्प्रेडशीट्स (टेबल्स) और लंबी रिपोर्टों (टेक्स्ट) से भरी एक विशाल फाइलिंग कैबिनेट है।
वर्तमान AI जासूस (लार्ज लैंग्वेज मॉडल्स) लंबी रिपोर्टों को पढ़ने में बहुत अच्छे हैं, लेकिन जब वे स्प्रेडशीट्स पर पहुँचते हैं, तो वे भ्रमित हो जाते हैं। वे अक्सर एक पूरी स्प्रेडशीट को एक ही, अस्त-व्यस्त पैराग्राफ की तरह देखते हैं, या वे इसे एक लिस्ट में बदलने की कोशिश करते हैं। इससे वे विशिष्ट सेल में छिपे सूक्ष्म और महत्वपूर्ण विवरणों को 놓 (miss) कर देते हैं, जैसे कि किसी विशिष्ट पंक्ति और कॉलम में कोई विशिष्ट संख्या। वे सही विषय तो ढूंढ सकते हैं, लेकिन गलत संख्या उठा सकते हैं।
यह शोध पत्र FT-RAG (फाइन-ग्रेन्ड टेबल-अवेयर रिट्रीवल-ऑगमेंटेड जनरेशन) पेश करता है, जो एक नया सिस्टम है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसका सरल अवधारणाओं में विवरण यहाँ दिया गया है:
1. समस्या: "पूरा पाई" बनाम "एक टुकड़ा"
एक पारंपरिक AI के बारे में सोचें जो एक टेबल को ऐसे पढ़ता है जैसे कोई एक ही बार में पूरा पिज्जा खाने की कोशिश कर रहा हो। वे पूरे पिज्जा को बिना स्वाद लिए निगल लेते हैं (पूरा टेबल)। यदि आप पूछते हैं, "मार्च में लाभ क्या था?" और AI केवल पूरा "वित्तीय रिपोर्ट" वाला पेज उठा लेता है, तो उसे यह अनुमान लगाने के लिए संघर्ष करना पड़ता है कि कौन सी संख्या लाभ की है और कौन सी लागत की। यह अव्यवस्थित है और गलतियों की संभावना अधिक है।
2. समाधान: FT-RAG का "लेगो" दृष्टिकोण
FT-RAG खेल बदल देता है क्योंकि यह AI के देखने से पहले ही टेबल को उसके सबसे छोटे, सबसे सार्थक टुकड़ों में तोड़ देता है।
चरण 1: माइक्रो-स्कैनिंग (एंट्री-लेवल डिकंपोजिशन)
टेबल को एक बड़े ब्लॉक के रूप में देखने के बजाय, FT-RG इसे व्यक्तिगत "सेल ग्रुप्स" में तोड़ देता है। कल्पना करें कि आप स्प्रेडशीट के हर एक वर्ग को एक सुरक्षात्मक बुलबुले में लपेट रहे हैं। उस बुलबुले के अंदर, AI केवल संख्या "500" नहीं देखता; वह "500," प्लस कॉलम हेडर "राजस्व (Revenue)," रो हेडर "Q1," और डॉक्यूमेंट टाइटल "2024 वार्षिक रिपोर्ट" भी देखता है। वह बिल्कुल जानता है कि वह संख्या कहाँ रहती है।चरण 2: "SAT" मैप बनाना (स्ट्रक्चर्ड ग्राफ)
एक बार जब डेटा इन छोटे बुलबुलों में टूट जाता है, तो FT-RAG एक विशाल, व्यवस्थित मानचित्र बनाता है जिसे SAT ग्राफ कहा जाता है।- S (Subject/विषय): यह किसके बारे में है? (जैसे, "कंपनी A")
- A (Attribute/विशेषता): हम क्या माप रहे हैं? (जैसे, "राजस्व")
- T (Temporal/समय): यह कब हुआ था? (जैसे, "2024")
इस मैप को एक सबवे सिस्टम की तरह समझें। पूरे दस्तावेज़ (शहर) में बिना किसी दिशा के भटकने के बजाय, AI एक ट्रेन पर चढ़ता है जो सीधे "कंपनी A" से "राजस्व" और फिर "2024" तक जाती है। यह डॉट्स को तार्किक रूप से जोड़ता है, यह सुनिश्चित करता है कि जो संख्या वह ढूंढ रहा है वह वास्तव में सही समय और सही कंपनी से जुड़ी है।
चरण 3: "पड़ोसी" की जाँच (स्ट्रक्चरल नेबर एक्सपेंशन)
कभी-कभी, उत्तर केवल एक संख्या नहीं होता; यह एक ट्रेंड (प्रवृत्ति) होता है। यदि आप पूछते हैं, "राजस्व में कैसे वृद्धि हुई?", तो AI को 2023 और 2024 का डेटा देखने की आवश्यकता होगी। FT-RAG में एक विशेष फीचर है जो मैप पर अपने "पड़ोसियों" की स्वचालित रूप से जाँच करता है। यदि इसे 2024 का डेटा मिलता है, तो यह तुरंत उसके बगल वाले 2023 के डेटा को भी निकाल लेता है, ठीक वैसे ही जैसे एक जासूस पूरी तस्वीर पाने के लिए संदिग्ध के पड़ोसी के अलबी (alibi) की जाँच करता है।चरण 4: सामग्रियों को मिलाना (मल्टी-मोडल फ्यूजन)
टेबल्स अक्सर शुष्क होते हैं और उनमें संदर्भ (context) की कमी होती है। रिपोर्ट के आसपास के टेक्स्ट के आधार पर एक संख्या एक रिपोर्ट में "लाभ" और दूसरी में "हानि" हो सकती है। FT-RAG मैप पर पाए गए सटीक नंबर को लेता है और यह समझाने के लिए कि वह नंबर क्यों महत्वपूर्ण है, रिपोर्ट से पास के वाक्यों को भी साथ ले आता है। यह हार्ड डेटा (टेबल) को कहानी (टेक्स्ट) के साथ जोड़ देता है ताकि AI पूर्ण संदर्भ समझ सके।
3. नया प्रशिक्षण मैदान: Multi-Table-RAG-Lib
लेखकों ने महसूस किया कि इस नए जासूस को टेस्ट करने के लिए उन्हें पहले से मौजूद परीक्षणों से कठिन टेस्ट की आवश्यकता है। अधिकांश टेस्ट केवल एक सिंगल टेबल के बारे में सरल प्रश्न पूछते हैं (जैसे "आइटम X की कीमत क्या है?")।
उन्होंने एक नई, विशाल लाइब्रेरी बनाई जिसे Multi-Table-RAG-Lib कहा जाता है।
- चुनौती: इस लाइब्रेरी में लगभग 10,000 प्रश्न हैं जिनके लिए AI को कई अलग-अलग टेबल्स के बीच कूदने और उस डेटा को टेक्स्ट के साथ मिलाने की आवश्यकता होती है।
- लक्ष्य: यह AI को एक साधारण सर्च इंजन होने के बजाय, एकीकरण (integration) का मास्टर बनने के लिए मजबूर करता है।
4. परिणाम: एक स्पष्ट विजय
जब उन्होंने FT-RAG को अन्य शीर्ष AI सिस्टमों के खिलाफ टेस्ट किया:
- सटीकता (Accuracy): इसने अन्य सभी की तुलना में बहुत अधिक बार सही विशिष्ट डेटा पॉइंट (सेल) खोजे। इसने सही सेल खोजने की क्षमता में लगभग 60% का सुधार किया।
- सत्यता (Truthfulness): जब AI ने उत्तर जेनरेट किया, तो इसकी संभावना बहुत अधिक थी कि वह वास्तविक संख्याओं को सही ढंग से बताएगा (सटीक मान सटीकता में 62% का सुधार)।
- निरंतरता (Consistency):적으로: यह केवल भाग्यशाली नहीं था; इसने सभी प्रकार के कठिन, मल्टी-टेबल प्रश्नों में लगातार प्रतिस्पर्धा को पछाड़ दिया।
सारांश
संक्षेप में, FT-RAG एक जासूस को एक ऐसे व्यक्ति से अपग्रेड करने जैसा है जो सुराग खोजने के लिए पूरी फाइल फोल्डर को पढ़ने की उम्मीद करता है, बजाय एक ऐसे फोरेंसिक विशेषज्ञ के जिसके पास हर एक सबूत का हाई-टेक मैप है, उसे पता है कि वे कैसे जुड़ते हैं, और वह संख्याओं का अर्थ समझने के लिए तुरंत आसपास की कहानी को भी साथ ले सकता है। यह AI को भ्रमित होने या अनुमान लगाने से रोकता है और उसके उत्तरों को डेटा की सटीक, संरचित वास्तविकता पर आधारित होने के लिए मजबूर करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।