← नवीनतम पेपर
🤖 AI

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

यह शोध पत्र ViDoRe v3 को प्रस्तुत करता है, जो 6 भाषाओं में 10 विविध डेटासेट और 3,099 मानव-सत्यापित प्रश्नों से युक्त एक व्यापक मल्टीमॉडल बेंचमार्क है, जिसे जटिल, दृश्य रूप से समृद्ध वास्तविक दुनिया के दस्तावेज़ों पर रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) प्रणालियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है और जो विजुअल ग्राउंडिंग तथा मल्टी-डॉक्यूमेंट सिंथेसिस में वर्तमान सीमाओं को रेखांकित करता है।

मूल लेखक: António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल केस सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन केवल टेक्स्ट फाइलों को पढ़ने के बजाय, आपको पुराने ब्लूप्रिंट्स, वित्तीय चार्ट, हस्तलिखित रखरखाव लॉग और वैज्ञानिक आरेखों (diagrams) के एक विशाल पुस्तकालय में से छानबीन करनी है। आपको विशिष्ट सुराग खोजने होंगे, विभिन्न पृष्ठों से जानकारी को जोड़ना होगा, और ठीक से बताना होगा कि सबूत कहाँ छिपे हैं।

यह बिल्कुल वही चुनौती है जिसे ViDoRe V3 पेपर संबोधित करता है। यह एक नया "प्रशिक्षण मैदान" (बेंचमार्क) पेश करता है ताकि यह परीक्षण किया जा सके कि AI सिस्टम कितनी अच्छी तरह से इन जासूसों की भूमिका निभा सकते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:

1. समस्या: "केवल टेक्स्ट वाला" जासूस खो जाता है

लंबे समय तक, AI सहायक (RAG सिस्टम) ऐसे जासूसों की तरह थे जो केवल साधारण टेक्स्ट पढ़ सकते थे। यदि आप उनसे पूछते, "इस विमान पर फ्यूल वाल्व कहाँ है?" और उत्तर किसी जटिल आरेख (diagram) या तालिका (table) के अंदर होता, तो AI अक्सर भ्रमित हो जाता, चित्र को अनदेखा कर देता, या अपनी ओर से कोई उत्तर बना लेता (hallucinate)।

मौजूदा परीक्षण इन AI के लिए बहुत आसान थे। वे एक जासूस से फोन बुक में नाम खोजने के लिए कहने जैसा था। उन्होंने यह परीक्षण नहीं किया कि क्या AI यह कर सकता है:

  • एक चार्ट या मानचित्र को पढ़ सके।
  • एक पहेली को सुलझाने के लिए तीन अलग-अलग दस्तावेजों से सुरागों को जोड़ सके।
  • उस सटीक स्थान की ओर इशारा कर सके जहाँ उत्तर मौजूद है।

2. समाधान: "ViDoRe V3" ट्रेनिंग कैंप

लेखकों ने ViDoRe V3 बनाया है, जो AI जासूसों के लिए एक विशाल, उच्च-दांव वाले प्रशिक्षण शिविर (training camp) की तरह है।

  • पुस्तकालय: उन्होंने वास्तविक दुनिया के दस्तावेजों (जैसे हवाई जहाज के मैनुअल, वित्तीय रिपोर्ट और चिकित्सा दिशानिर्देश) के 26,000 पृष्ठ एकत्र किए जो चित्रों, तालिकाओं और चार्टों से भरे हुए हैं।
  • केस (मामले): उन्होंने 3,099 "केस" (प्रश्न) बनाए जो पेचीदा हैं। कुछ सरल तथ्यों के बारे में पूछते हैं, लेकिन अन्य जटिल तर्क (reasoning) के बारे में पूछते हैं, जैसे "इन तीन मैनुअल के चार्ट के आधार पर इन दो इंजनों के सुरक्षा रिकॉर्ड की तुलना करें।"
  • मानवीय न्यायाधीश: यह सुनिश्चित करने के लिए कि प्रशिक्षण निष्पक्ष हो, मनुष्यों ने उत्तरों को सत्यापित करने में 12,000 घंटे (जो कि 1.5 साल के पूर्णकालिक कार्य के बराबर है!) बिताए। उन्होंने केवल उत्तर नहीं लिखा; उन्होंने ठीक उसी टेक्स्ट या इमेज के चारों ओर बॉक्स भी बनाए जो साबित करता था कि उत्तर सही था।

3. बड़ा परीक्षण: AI ने कैसा प्रदर्शन किया?

शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडल को इस प्रशिक्षण शिविर में डाला ताकि देखा जा सके कि वे कैसा प्रदर्शन करते हैं। यहाँ उन्हें क्या मिला:

  • कानों से बेहतर आँखें हैं: जब AI को दस्तावेज़ छवियों को "देखने" (विजुअल रिट्रीवल) की अनुमति दी गई, तो इसने केवल टेक्स्ट पढ़ने की तुलना में बहुत बेहतर प्रदर्शन किया। यह एक जासूस को अपराध स्थल के लिखित विवरण के बजाय उसकी फोटो देने जैसा है।
  • दूसरी राय की शक्ति: AI बहुत स्मार्ट हो गया जब उसने एक "री-रैंकर" (re-ranker) का उपयोग किया। कल्पना कीजिए कि एक जासूस को 10 सुराग मिलते हैं, लेकिन एक दूसरा विशेषज्ञ (री-रैंकर) उन्हें सबसे बेहतरीन 3 सुरागों पर ध्यान केंद्रित करने में मदद करता है। इस चरण ने बहुत बड़ा अंतर पैदा किया।
  • "हाइब्रिड" दृष्टिकोण जीतता है: सबसे अच्छे परिणाम एक टीम वर्क से आए: एक AI चित्रों को देख रहा था और दूसरा टेक्स्ट को पढ़ रहा था, और फिर उन्होंने अपने निष्कर्षों को जोड़ा। यह एक विजुअल विशेषज्ञ और एक टेक्स्ट विशेषज्ञ के मिलकर काम करने जैसा है।
  • कमजोर कड़ियाँ: सबसे अच्छे AI भी अभी भी संघर्ष कर रहे हैं:
    • खुले अंत वाले प्रश्न (Open-ended questions): "इस मशीन का इतिहास समझाएं" यह पूछने से कठिन है कि "यह किस वर्ष में बनी थी?"
    • क्रॉस-लैंग्वेज केस: यदि प्रश्न स्पेनिश में है लेकिन मैनुअल अंग्रेजी में है, तो AI अक्सर भटक जाता है।
    • उंगली उठाना (Pointing the finger): हालांकि AI अक्सर सही पेज ढूंढ लेता है, लेकिन वह विशिष्ट वाक्य या चार्ट सेल के चारों ओर सटीक बॉक्स बनाने में अभी भी कमजोर है। यह घर में सही कमरा तो ढूंढ लेना लेकिन यह न जान पाना कि चाबी किस कुर्सी के नीचे है।

4. यह क्यों मायने रखता है

यह पेपर AI उद्योग के लिए एक चेतावनी है। यह दिखाता है कि वास्तविक दुनिया के उपयोगी AI सहायक (डॉक्टरों, इंजीनियरों, वकीलों के लिए) बनाने के लिए, हम केवल टेक्स्ट पर निर्भर नहीं रह सकते। हमें ऐसे सिस्टम की आवश्यकता है जो देख सकें, कई दस्तावेजों में तर्क कर सकें, और साबित कर सकें कि उन्हें अपनी जानकारी कहाँ से मिली।

संक्षेप में: ViDoRe V3 AI के लिए एक कठोर "फाइनल एग्जाम" है। यह साबित करता है कि जबकि AI पढ़ने में अच्छा हो रहा है, उसे वास्तव में जटिल, दृश्य और अस्त-व्यस्त दस्तावेजी दुनिया को समझने के लिए अभी भी बहुत सारा होमवर्क करना बाकी है। अच्छी खबर यह है कि उन्होंने परीक्षा के प्रश्न जनता के लिए जारी कर दिए हैं ताकि हर कोई AI को पढ़ने और स्मार्ट बनाने में मदद कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →