← नवीनतम पेपर
💻 computer science

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

यह शोधपत्र LFRAG का प्रस्ताव करता है, जो एक अभिनव ढांचा (framework) है जो लेआउट-जागरूक विभाजन (layout-aware segmentation) और सिमेंटिक-लेआउट फ्यूजन का उपयोग करके मोटे-स्तर के पेज-स्तरीय से सूक्ष्म-स्तर के ब्लॉक-स्तरीय पुनर्प्राप्ति (retrieval) में स्थानांतरित होकर मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन को बढ़ाता है, जिससे नए पेश किए गए LFDocQA बेंचमार्क पर अत्याधुनिक प्रदर्शन और महत्वपूर्ण दक्षता लाभ प्राप्त होता है।

मूल लेखक: Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

प्रकाशित 2026-05-25
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किताबों के एक विशाल पुस्तकालय में एक विशिष्ट वाक्य खोजने की कोशिश कर रहे हैं, लेकिन पन्नों के टेक्स्ट को पढ़ने के बजाय, आप पन्नों की तस्वीरें देख रहे हैं।

पुराना तरीका: "पूरा पेज" वाली समस्या
वर्तमान में, अधिकांश AI सिस्टम जो दस्तावेजों में जानकारी खोजने में आपकी मदद करते हैं, वे एक अनाड़ी लाइब्रेरियन की तरह काम करते हैं। जब आप कोई प्रश्न पूछते हैं, तो वे शेल्फ से पूरा का पूरा पन्ना उठाकर आपको थमा देते हैं।

  • समस्या: यदि आप 300 शब्दों वाले एक पेज के बीच में स्थित एक छोटे से चार्ट के बारे में पूछते हैं, तो AI आपको पूरा पेज दे देता है। अब आपको उस एक वाक्य को खोजने के लिए 290 अप्रासंगिक शब्दों के बीच से रास्ता बनाना होगा। यह धीमा है, कंप्यूटर की ऊर्जा बर्बाद करता है, और अक्सर AI को भ्रमित कर देता है, जिससे वह "हैलुसिनेट" (मनगढ़ंत बातें बनाना) करने लगता है क्योंकि वह बहुत अधिक शोर (noise) के बीच फंसा होता है।
  • उपमा: यह वैसा ही है जैसे आप किसी दोस्त से पूछें, "मौसम कैसा है?" और वह आपको पूरा अखबार थमा दे, जिसमें खेल, कॉमिक्स और शेयर बाजार का सेक्शन भी शामिल हो, सिर्फ इसलिए क्योंकि मौसम की रिपोर्ट पेज 4 पर है।

नया समाधान: LFRAG ( "स्मार्ट कैंची")
यह पेपर एक नया सिस्टम पेश करता है जिसे LFRAG (लेआउट-ओरिएंटेड फाइन-ग्रेन्ड रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है। LFRAG को एक ऐसी कैंची और समझ रखने वाले लाइब्रेरियन के रूप में सोचें जो यह जानता है कि एक पेज कैसे व्यवस्थित होता है।

  1. पेज को "सिमेंटिक ब्लॉक्स" में काटना:
    पूरा पेज थमाने के बजाय, LFRAG पहले दस्तावेज़ के लेआउट (शीर्षक, टेबल और चित्र कहाँ हैं) को देखता है। यह पेज को तार्किक "ब्लॉक्स" में काट देता है।
  • उपमा: एक पिज्जा की कल्पना करें। पुराना तरीका आपको पूरा पिज्जा देता है। LFRAG टॉपिंग्स के आधार पर पिज्जा को स्लाइस में काटता है। यदि आप पेपरोनी चाहते हैं, तो यह आपको केवल पेपरोनी वाला स्लाइस देता है, न कि पूरा पिज्जा जिसमें वह क्रस्ट और चीज़ भी हो जिसकी आपको आवश्यकता नहीं है।
  1. "पड़ोस" को समझना:
    कभी-कभी, एक चित्र और उसका कैप्शन कागज के अलग-अलग टुकड़े होते हैं, लेकिन वे एक साथ जुड़े होते हैं। LFRAG इन संबंधित टुकड़ों को काटने से पहले उन्हें वापस जोड़ने में स्मार्ट है। यह जानता है कि एक "फिगर" (चित्र) और उसके ठीक नीचे का टेक्स्ट एक ही इकाई है।
  • उपमा: यह जानता है कि "शीर्षक" और उसके नीचे का "पैराग्राफ" एक परिवार की तरह हैं, इसलिए वह उन्हें एक ही ब्लॉक में रखता है, बल्कि उन्हें अलग-अलग नहीं करता।
  1. "लेट इंटरैक्शन" सर्च:
    जब आप कोई प्रश्न पूछते हैं, तो LFRAG केवल शब्दों को नहीं देखता; यह दस्तावेज़ के आकार और संरचना को भी देखता है। यह आपके प्रश्न को उस विशिष्ट "स्लाइस" (ब्लॉक) से मिलाता है जिसमें उत्तर मौजूद है।
  • उपमा: पूरे पुस्तकालय में अपना प्रश्न चिल्लाने के बजाय, यह सीधे उस विशिष्ट पिज्जा स्लाइस के कान में फुसफुसाता है जिसमें उत्तर है।

परिणाम: तेज़, स्मार्ट, सस्ता
लेखकों ने इस नए सिस्टम का परीक्षण एक विशाल नए डेटासेट पर किया (जिसे LFDocQA कहा जाता है), जो एक विशाल लाइब्रेरी की तरह है जिसमें इंसानों द्वारा "कट-आउट" किए गए उत्तरों को चिह्नित किया गया है।

  • सटीकता (Accuracy): LFRAG ने पुराने "पूरे पेज" वाले तरीकों की तुलना में जानकारी को बहुत बेहतर तरीके से खोजा। यह बिना पूरे ढेर को खोदे, घास के ढेर में से सुई खोजने जैसा था।
  • दक्षता (Efficiency): क्योंकि यह केवल प्रासंगिक "स्लाइस" को ही उत्तर लिखने वाले AI के पास भेजता है, इसलिए यह 73% कम कंप्यूटर पावर (टोकन) का उपयोग करता है और उत्तर 3.6 गुना तेजी से तैयार करता है।
  • गुणवत्ता (Quality): उत्तर अधिक सटीक थे क्योंकि AI अप्रासंगिक टेक्स्ट से विचलित नहीं हुआ।

सारांश में
LFRAG खेल को "मुझे पूरा पेज दो" से बदलकर "मुझे सटीक पैराग्राफ या चार्ट दो" में बदल देता है। दस्तावेजों के दृश्य लेआउट का सम्मान करके और उन्हें सार्थक टुकड़ों में काटकर, यह AI रीडिंग को तेज़, सस्ता और बहुत अधिक सटीक बनाता है, बिना पूरे पेज के शोर में खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →