← नवीनतम पेपर
💬 NLP

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

प्रदत्त पाठ में शीर्षक ("SlideAgent") और सार (जो हाइब्रिड RAG के लिए "SARA" नामक एक फ्रेमवर्क का वर्णन करता है) के बीच एक विसंगति है, लेकिन सार की सामग्री के आधार पर, यह शोध पत्र SARA का प्रस्ताव करता है, जो एक हाइब्रिड रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो निश्चित टोकन बजट के तहत कई डेटासेट और ओपन-सोर्स LLMs में उत्तर की प्रासंगिकता, शुद्धता और सिमेंटिक समानता में उल्लेखनीय सुधार करने के लिए प्राकृतिक भाषा के स्निपेट्स को सिमेंटिक कम्प्रेशन वेक्टर्स के साथ जोड़ता है।

मूल लेखक: Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके हाथ में एक विशाल, 100 पन्नों की बिजनेस प्रेजेंटेशन है। यह रंगीन चार्ट्स, छोटे फुटनोट्स, जटिल ग्राफ्स और बिखरे हुए टेक्स्ट से भरी हुई है। आप एक विशिष्ट प्रश्न पूछते हैं: "Q2 2015 के मिश्रण (mix) में कितने प्रोडक्ट कैटेगरी हैं?"

यदि आप एक मानक AI (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल, या MLLM) से पूरी स्लाइड को एक साथ देखने के लिए कहते हैं, तो वह अभिभूत हो सकता है। यह एक घास के ढेर में सुई खोजने की तरह है, जहाँ आप पूरे खलिहान को एक ही नज़र में देखने की कोशिश कर रहे हैं। AI "सात" का अनुमान लगा सकता है क्योंकि उसे बहुत सारी चीजें दिखाई दे रही हैं, लेकिन वह इस तथ्य को मिस कर देता है कि एक कैटेगरी एक चार्ट के छोटे से कोने में छिपी हुई है।

SlideAgent एक नया, स्मार्ट सिस्टम है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। इसे एक एकल 'सुपर-ब्रेन' के रूप में नहीं, बल्कि एक अत्यधिक संगठित जासूसी एजेंसी के रूप में सोचें, जिसमें सहयोग करने के लिए विशेषज्ञ पेशेवरों की एक टीम है।

यह कैसे काम करता है, इसे समझने के लिए यहाँ एक सरल उपमा दी गई है:

तीन-स्तरीय जासूसी टीम

सब कुछ करने के लिए एक अकेले AI के बजाय, SlideAgent इस काम को तीन स्तरों में विभाजित करता है, जैसे कि एक कंपनी जिसमें एक CEO, एक प्रोजेक्ट मैनेजर और एक फोरेंसिक एनालिस्ट हो।

1. CEO (ग्लोबल एजेंट)

  • भूमिका: बड़ी तस्वीर (The Big Picture)।
  • वे क्या करते हैं: विवरणों में उतरने से पहले, "CEO" विषय को समझने के लिए दस्तावेज़ के पहले कुछ पन्नों को देखता है। क्या यह एक वित्तीय रिपोर्ट है? एक मार्केटिंग पिच? या एक विज्ञान व्याख्यान?
  • उपमा: कल्पना कीजिए कि आप एक लाइब्रेरी में जा रहे हैं। CEO हर किताब को नहीं पढ़ता; वे लाइब्रेरी के कैटलॉग और मुख्य साइनबोर्ड को देखते हैं ताकि यह जान सकें कि, "ठीक है, यह फाइनेंस का सेक्शन है।" यह टीम को यह जानने में मदद करता है कि क्या उम्मीद की जाए।

2. प्रोजेक्ट मैनेजर (पेज एजेंट)

  • भूमिका: संदर्भ का संरक्षक (The Context Keeper)।
  • वे क्या करते हैं: यह एजेंट पेज दर पेज जाता है। यह वर्तमान स्लाइड के सारांश को पढ़ता है और याद रखता है कि पिछले स्लाइड पर क्या हुआ था। यह पन्नों के बीच के कड़ियों को जोड़ता है।
  • उपमा: यदि CEO कहता है, "हम फाइनेंस के बारे में बात कर रहे हैं," तो प्रोजेक्ट मैनेजर कहता है, "ठीक है, स्लाइड 1 बजट के बारे में थी, और स्लाइड 2 सेल्स टीम के बारे में है। स्लाइड 3 निश्चित रूप से इन दोनों को जोड़ने वाली होगी।" यह सुनिश्चित करता है कि AI भटक न जाए या कहानी के प्रवाह को भूल न जाए।

3. फोरेंसिक एनालिस्ट (एलिमेंट एजेंट)

  • भूमिका: सूक्ष्म-खोजी (The Micro-Scout)।
  • वे क्या करते हैं: ट्रिकी सवालों के लिए यही सबसे महत्वपूर्ण हिस्सा है। जब टीम को किसी विशिष्ट संख्या या बारीक विवरण की आवश्यकता होती है, तो एनालिस्ट ज़ूम इन करता है। वे केवल पूरी स्लाइड को नहीं देखते; वे एक विशिष्ट एलिमेंट जैसे कि एक सिंगल चार्ट, एक विशिष्ट टेक्स्ट बॉक्स, या एक आइकन को अलग करते हैं।
  • उपमा: यदि आप पूछते हैं, "टोकरी में कितने लाल सेब हैं?" तो एनालिस्ट पूरे पिकनिक टेबल को नहीं देखता। वे आवर्धक लेंस (magnifying glass) लगाते हैं, टोकरी को ढूंढते हैं, एक-एक करके लाल सेबों को गिनते हैं, और सैंडविच या ब्लूबेरी को अनदेखा कर देते हैं। यह AI को अव्यवस्थपूर्ण बैकग्राउंड के कारण गलत गिनती करने से रोकता है।

वे मिलकर कैसे काम करते हैं: "ऑर्केस्ट्रेटर"

जब आप कोई प्रश्न पूछते हैं, तो एक कंडक्टर (ऑर्केस्ट्रेटर) तय करता है कि किन जासूसों को जागने की जरूरत है।

  • प्रश्न: "इस प्रेजेंटेशन का मुख्य लक्ष्य क्या है?"
    • कंडक्टर: "केवल CEO को जगाओ।" (सेब गिनने की आवश्यकता नहीं है)।
  • प्रश्न: "स्लाइड 5 पर राजस्व (revenue) क्या है?"
    • कंडक्टर: "स्लाइड 5 को खोजने के लिए प्रोजेक्ट मैनेजर को, और विशिष्ट संख्या पढ़ने के लिए एनालिस्ट को जगाओ।"
  • प्रश्न: "स्लाइड 2 और स्लाइड 10 की बिक्री की तुलना करें।"
    • कंडक्टर: "सभी को जगाओ। हमें दोनों पन्नों का बड़ा परिदृश्य, उनका संदर्भ और दोनों चार्ट्स से विशिष्ट संख्याओं की आवश्यकता है।"

यह बेहतर क्यों है?

वर्तमान AI मॉडल एक ऐसे छात्र की तरह हैं जो बिना नोट्स लिए एक बार में एक पेज पढ़कर पूरी किताब याद करने की कोशिश कर रहा है। वे अक्सर छोटी बारीकियों को मिस कर देते हैं या लेआउट से भ्रमित हो जाते हैं।

SlideAgent विशेषज्ञों की एक टीम की तरह है जिसके पास एक फाइलिंग सिस्टम है:

  1. वे पहले व्यवस्थित करते हैं: वे उत्तर देने से पहले दस्तावेज़ का एक संरचित मानचित्र (Global, Page, Element) बनाते हैं।
  2. वे आवश्यकतानुसार ज़ूम इन करते हैं: वे अनुमान नहीं लगाते; वे आवश्यक सटीक चार्ट या टेक्स्ट बॉक्स को अलग करते हैं।
  3. वे अपने काम की जाँच करते हैं: अंतिम उत्तर तीनों स्तरों का एक संश्लेषण (synthesis) है, यह सुनिश्चित करता है कि "CEO" का "एनालिस्ट" के साथ सहमति हो।

परिणाम

परीक्षणों में, इस टीम दृष्टिकोण ने AI को काफी स्मार्ट बनाया। इसने मौजूदा सर्वश्रेष्ठ AI मॉडलों की तुलना में सटीकता में लगभग 8% से 10% का सुधार किया। यह एक ऐसे मॉडल के बीच का अंतर है जो धुंधली छवि के आधार पर उत्तर का अनुमान लगाता है, और एक ऐसे मॉडल के बीच का अंतर जो बारीक अक्षरों को पढ़ता है, संदर्भ को समझता है, और आपको सटीक संख्या देता है।

संक्षेप में: SlideAgent एक "सुपर-रोबोट" बनने की कोशिश नहीं करता जो एक साथ सब कुछ करता है। इसके बजाय, यह एक श्रेणीबद्ध टीम (hierarchical team) बनाता है जिसे पता है कि जंगल को कब देखना है, पेड़ों को कब देखना है, और एक अकेले पत्ते को कब देखना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →