← नवीनतम पेपर
💬 NLP

Attention Grounded Enhancement for Visual Document Retrieval

यह शोध पत्र AGREE का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स से क्रॉस-मोडल अटेंशन का लाभ उठाकर प्रॉक्सी सुपरविजन के रूप में विजुअल डॉक्यूमेंट रिट्रीवर्स को सूक्ष्म, रीजन-लेवल प्रासंगिकता सीखने के लिए निर्देशित करता है, जिससे ग्लोबल-सुपरविजन-ओनली बेसलाइन्स की तुलना में जटिल, नॉन-एक्सट्रैक्टिव क्वेरीज पर प्रदर्शन में उल्लेखनीय सुधार होता है।

मूल लेखक: Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

प्रकाशित 2026-05-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दस्तावेजों के एक विशाल, बिखरे हुए पुस्तकालय में एक विशिष्ट पृष्ठ खोज रहे हैं। कुछ पृष्ठ केवल टेक्स्ट (पाठ) हैं, लेकिन कई "विजुअल डॉक्यूमेंट्स" (दृश्य दस्तावेज़) हैं जो चार्ट, टेबल, फोटो और टेक्स्ट के जटिल मिश्रण से भरे हुए हैं।

समस्या: "सार" बनाम "विवरण"
वर्तमान सर्च इंजन इन दस्तावेजों के लिए एक ऐसे लाइब्रेरियन की तरह हैं जो केवल किताब के पीछे लिखे सारांश को पढ़ता है। वे आपको बता सकते हैं, "हाँ, यह किताब उस विषय के बारे में है जिसके बारे में आपने पूछा है," लेकिन उन्हें यह नहीं पता होता कि कौन सा विशिष्ट पैराग्राफ या कौन सा चार्ट उत्तर रखता है।

क्योंकि वे केवल "बड़ी तस्वीर" (ग्लोबल रेलेवेंस) देखते हैं, इसलिए उन्हें अक्सर धोखा दिया जा सकता है। यदि आप एक कठिन प्रश्न पूछते जिसमें दो ऐसे विचारों को जोड़ने की आवश्यकता है जो एक-दूसरे के पास नहीं हैं (जैसे किसी शब्द "बॉटलनेक" को आरेख में छिपे एक प्रतीक से जोड़ना), तो लाइब्रेरियन इसे पूरी तरह से मिस कर सकता है। वे सटीक कीवर्ड मिलान खोजने पर बहुत अधिक निर्भर करते हैं, जैसे कोई कुत्ता चोंचले वाले खिलौने के पीछे भाग रहा हो, बजाय इसके कि वे वास्तविक अर्थ को समझें।

समाधान: AGREE (एक "सुपर-टीचर" लाइब्रेरियन)
इस पेपर के लेखक एक नई प्रशिक्षण विधि प्रस्तावित करते हैं जिसे AGREE (अटेंशन-ग्राउंडेड रिट्रीवर एन्हांसमेंट) कहा जाता है।

AGREE को एक सुपर-स्मार्ट, हाइपर-ऑब्जर्वेंट टीचर (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल, या MLLM) को लाइब्रेरियन को प्रशिक्षित करने के लिए नियुक्त करने के रूप में सोचें।

यह प्रशिक्षण कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

  1. शिक्षक की "नज़र" (The Teacher's "Gaze"): जब शिक्षक एक प्रश्न और एक दस्तावेज़ देखता है, तो वे केवल यह नहीं कहते कि "हाँ, यह प्रासंगिक है।" वे पृष्ठ के उन सटीक स्थानों की ओर इशारा करते हैं जो महत्वपूर्ण हैं।
    • उपमा: कल्पना करें कि शिक्षक एक लेजर पॉइंटर का उपयोग कर रहे हैं। यदि आप पूछते हैं, "छिपा हुआ प्रतीक कहाँ है?" तो शिक्षक केवल सिर हिलाते नहीं हैं; वे उस छोटे से प्रतीक पर लेजर चमकाते हैं, भले ही वह छोटा हो, और साथ ही उसके पास के टेक्स्ट पर भी, जो उसकी व्याख्या करता है। वे स्पष्ट मिलानों और सूक्ष्म, छिपे हुए कनेक्शनों दोनों को हाईलाइट करते हैं।
  2. "हीट मैप" का सबक (The "Heat Map" Lesson): शिक्षक एक "हीट मैप" (एक विजुअल गाइड जो दिखाता है कि वे कहाँ देख रहे हैं) बनाते हैं। यह मैप लाइब्रेरियन को बताता है: "इस चार्ट के इस विशिष्ट कोने पर ध्यान दें, और इस टेबल के इस विशिष्ट शब्द पर ध्यान दें।"
  3. प्रशिक्षण (The Training): लाइब्रेरियन (सर्च इंजन) को फिर इस हीट मैप से सीखने के लिए मजबूर किया जाता है। केवल यह सीखने के बजाय कि "किताब A एक मैच है," लाइब्रेरियन सीखता है, "उत्तर खोजने के लिए, मुझे विशेष रूप से ऊपर-दाएं कोने और नीचे-बाएं टेक्स्ट को देखना चाहिए।"
  4. परिणाम (The Result): लाइब्रेरियन पूरी किताब के आधार पर अनुमान लगाना बंद कर देता है और यह समझने लगता है कि एक पेज क्यों प्रासंगिक है। वे उन "अदृश्य" सुरागों को पहचानने में माहिर हो जाते हैं जो प्रश्न को उत्तर से जोड़ते हैं।

यह क्यों महत्वपूर्ण है
पेपर ने इसे ViDoRe V2 नामक एक बहुत ही कठिन बेंचमार्क पर टेस्ट किया है, जो तर्क (reasoning) की मांग करने वाले पेचीदा प्रश्नों से भरा है, न कि केवल कीवर्ड मैचिंग से।

  • AGREE से पहले: लाइब्रेरियन एक ऐसे छात्र की तरह था जिसने विषय सूची (table of contents) को रट लिया था लेकिन उसके अंदर के विशिष्ट तथ्यों को नहीं ढूंढ सकता था।
  • AGREE के बाद: लाइब्रेरियन एक जासूस बन गया। वे उत्तर ढूंढ सकते थे भले ही प्रश्न दस्तावेज़ के शब्दों से अलग शब्दों का उपयोग करता हो (उदाहरण के लिए, "गे ग्राहकों" के बारे में पूछना और टेक्स्ट में "LGBT" के तहत उत्तर ढूंढना)।

मुख्य निष्कर्ष
पेपर का दावा है कि सर्च इंजन को निर्देशित करने के लिए इस "शिक्षक की नज़र" (अटेंशन मैप्स) का उपयोग करने से, सिस्टम बहुत बेहतर हो जाता है। यह केवल यह नहीं जानता कि एक दस्तावेज़ प्रासंगिक है; यह जानता है कि वह प्रासंगिकता कहाँ छिपी है।

सरल शब्दों में: AGREE सर्च इंजन को कवर को सरसरी नज़र से देखना छोड़ कर बारीक अक्षरों को पढ़ना सिखाता है, जिसमें एक सुपर-स्मार्ट AI टीचर उसे ठीक से दिखाता है कि कहाँ देखना है।

पेपर नोट करता है कि यह विधि पिछले तरीकों की तुलना में काफी बेहतर काम करती है, विशेष रूप से जटिल प्रश्नों के लिए, और कोड दूसरों के परीक्षण के लिए उपलब्ध है। यह दावा नहीं करता है कि इसका उपयोग मेडिकल डायग्नोसिस या अन्य विशिष्ट वास्तविक दुनिया के अनुप्रयोगों के अलावा दस्तावेज़ खोज और रिट्रीवल के लिए किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →