← नवीनतम पेपर
💬 NLP

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

यह शोध पत्र चुनौतीपूर्ण PDF-टू-मार्डाउन रूपांतरण कार्यों पर विजन-लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक फ्रांसीसी-केंद्रित बेंचमार्क प्रस्तुत करता है, जो मॉडल-असहमति सैंपलिंग और विशिष्ट सामान्यीकरण मेट्रिक्स का उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि जबकि प्रोप्रायटरी मॉडल्स जटिल हस्तलिखित और फॉर्म-आधारित दस्तावेजों पर उत्कृष्ट हैं, कई ओपन-वेट्स सिस्टम मानक मुद्रित लेआउट के लिए प्रतिस्पर्धी बने हुए हैं।

मूल लेखक: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पुराने फ्रांसीसी दस्तावेजों का एक विशाल पुस्तकालय है। कुछ एकदम साफ, आधुनिक रिपोर्ट हैं; कुछ 19वीं सदी के हस्तलिखित नोट्स हैं, कुछ बिखरी हुई लिखावट वाले फॉर्म हैं, या बहुत छोटे टेक्स्ट और जटिल चार्ट वाले पन्ने हैं। आपका लक्ष्य क्या है? इन सभी अस्त-व्यस्त छवियों को साफ, व्यवस्थित डिजिटल टेक्स्ट (Markdown) में बदलना है जिसे कंप्यूटर आसानी से पढ़ सके और सवालों के जवाब देने के लिए उपयोग कर सके।

यह शोध पत्र वास्तव में सबसे स्मार्ट एआई कंप्यूटरों (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) के लिए एक रिपोर्ट कार्ड है जो यह काम करने की कोशिश कर रहे हैं। लेखक, जो फ्रांसीसी डाक और डेटा कंपनियों के लिए काम करते हैं, यह देखना चाहते थे कि कौन सा एआई सबसे अच्छा "डिजिटल लाइब्रेरियन" है।

यहाँ उनके अध्ययन का विवरण दिया गया, जिसे रोजमर्रा के उदाहरणों के साथ समझाया गया है:

1. समस्या: "परफेक्ट स्कोर" का जाल

कल्पना कीजिए कि आप किसी छात्र के निबंध का ग्रेड दे रहे हैं। यदि आप छात्र के निबंध की तुलना शिक्षक के उत्तर कुंजी से शब्द-दर-शब्द करने के लिए एक सख्त कंप्यूटर प्रोग्राम का उपयोग करते हैं, तो आप छात्र को केवल इसलिए फेल कर सकते हैं क्योंकि उन्होंने सेमीकोलन के बजाय कॉमा का उपयोग किया, या क्योंकि उन्होंने लाइन को थोड़ा अलग तरीके से तोड़ा।

लेखकों ने महसूस किया कि मौजूदा एआई परीक्षण बिल्कुल यही कर रहे थे। वे सटीक वर्तनी और फॉर्मेटिंग के प्रति इतने जुनूनी थे कि वे अर्थ पर ध्यान नहीं दे पा रहे थे।

  • पुराना तरीका: "आपने यहाँ एक कॉमा मिस कर दिया, और आपने टेबल को अलग क्रम में रखा। आपको शून्य मिलता है।"
  • नया तरीका (यह पेपर): "क्या आपने मुख्य विचार सही पकड़े? क्या टेबल पढ़ने योग्य है? क्या आपने कोई महत्वपूर्ण तथ्य छोड़ दिया? यदि हाँ, तो आप पास हैं, भले ही फॉर्मेटिंग थोड़ी अलग क्यों न हो।"

उन्होंने एक नया परीक्षण बनाया जो सिमेंटिक ट्रुथ (क्या आपने अर्थ सही समझा?) पर ध्यान देता है, न कि स्ट्रिंग परफेक्शन (क्या आपने हर अक्षर बिल्कुल सही टाइप किया?) पर।

2. परीक्षण: "एडवर्सरियल" चुनौती

यह सुनिश्चित करने के लिए कि वे एआई की सीमाओं का परीक्षण कर रहे हैं, उन्होंने केवल रैंडम पन्ने नहीं चुने। उन्होंने एक चतुर तरकीब का इस्तेमाल किया:

  • उन्होंने दो अलग-अलग एआई से एक ही पन्ने का ट्रांसक्रिप्शन करने को कहा।
  • यदि दोनों एआई के बीच बड़ा अंतर था, तो उस पन्ने को "कठिन" (Hard) के रूप में चिह्नित किया गया।
  • उन्होंने 60,000 दस्तावेज़ एकत्र किए और उनमें से सबसे कठिन पन्नों को चुना: छोटा टेक्स्ट, हस्तलिखित फॉर्म, घने टेबल, और ग्राफिक्स वाले पन्ने।

इसे एक ड्राइविंग टेस्ट की तरह समझें जहाँ वे आपसे केवल खाली पार्किंग लॉट में गाड़ी चलाना नहीं सीखते; वे आपको बर्फबारी में टूटे हुए विंडशील्ड के साथ भेजते हैं ताकि यह देखा जा सके कि क्या आप वास्तव में गाड़ी चला सकते हैं।

3. प्रतियोगी: "बिग टेक" बनाम "ओपन सोर्स"

उन्होंने 15 अलग-अलग एआई मॉडल्स को इस कठिन परीक्षा से गुजारा।

  • द बिग टेक जायंट्स (प्रोपराइटरी): ये गूगल (Gemini) और OpenAI जैसी कंपनियों के महंगे, बंद-स्रोत (closed-source) मॉडल हैं।
  • द कम्युनिटी हीरोज (ओपन-वेट्स): ये मुफ्त मॉडल हैं जिन्हें शोधकर्ताओं और डेवलपरों ने बनाया और साझा किया है।

परिणाम:

  • हैंडराइटिंग और फॉर्म की चुनौती: यह सबसे कठिन हिस्सा था। Google Gemini 3 Pro स्पष्ट विजेता रहा, जैसे कि एक अनुभवी जासूस जो एक बिखरी हुई, 100 साल पुरानी हस्तलिखित चिट्ठी को पढ़ सकता है। कई मुफ्त मॉडल यहाँ पूरी तरह विफल रहे, वे कर्सिव लिखावट में उलझ गए।
  • स्टैंडर्ड टेक्स्ट की चुनौती: साफ, प्रिंटेड दस्तावेजों के लिए, कई मुफ्त मॉडल्स ने महंगे मॉडल्स के लगभग बराबर प्रदर्शन किया। वे रोजमर्रा के कार्यों के लिए बेहतरीन हैं।
  • ग्राफिक्स की चुनौती: अधिकांश एआई चार्ट और वैज्ञानिक आकृतियों का वर्णन करने में संघर्ष करते हैं। वे अक्सर उन्हें अनदेखा कर देते हैं या डेटा गलत बताते हैं। एक मॉडल, Chandra, इसमें बेहतर प्रदर्शन करने के लिए खड़ा हुआ, लेकिन वह सबसे धीमा भी था।

4. गति बनाम सटीकता का संतुलन (Speed vs. Accuracy Trade-off)

टेक की दुनिया में एक क्लासिक नियम है: तेज़ और सस्ता, या अच्छा और धीमा।

  • द स्पीडस्टर्स: कुछ मॉडल्स (जैसे Docling और MinerU) अविश्वसनीय रूप से तेज़ थे, जो एक सेकंड से कम समय में एक पन्ने को प्रोसेस कर लेते थे। लेकिन वे अक्सर विवरण चूक जाते थे या जटिल लेआउट में उलझ जाते थे।
  • द स्लो-एंड-स्टेडी: सबसे अच्छे मॉडल्स (जैसे Gemini 3 Pro और Chandra) अधिक समय लेते थे (एक पन्ने के लिए कुछ सेकंड) लेकिन बहुत उच्च गुणवत्ता वाले परिणाम देते थे।
  • "ग्लिच" फैक्टर: लेखकों ने देखा कि जब इमेज क्वालिटी कम होती थी (छोटा टेक्स्ट), तो कुछ छोटे मॉडल्स एक लूप में फंस जाते थे, जैसे कि एक ही वाक्य को बार-बार दोहराना, या पन्ने के पूरे हिस्से को छोड़ देना।

5. निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि:

  1. यदि आपको बिखरी हुई लिखावट या जटिल फॉर्म पढ़ने की आवश्यकता है: तो वर्तमान में आपको महंगे, टॉप-टियर मॉडल्स (जैसे Gemini) की आवश्यकता होगी। मुफ्त वाले अभी उस स्तर तक नहीं पहुँचे हैं।
  2. यदि आप साफ, प्रिंटेड टेक्स्ट के साथ काम कर रहे हैं: तो आप पैसे बचाने के लिए मुफ्त, ओपन-सोर्स मॉडल्स का उपयोग कर सकते हैं।
  3. परीक्षण एक जीवित चीज़ है: लेखक केवल एक स्कोर प्रकाशित नहीं कर रहे हैं; वे पूरे समुदाय को इस परीक्षण को बेहतर बनाने, नए प्रकार के दस्तावेज़ जोड़ने और लीडरबोर्ड को अपडेट रखने में मदद करने के लिए आमंत्रित कर रहे हैं।

संक्षेप में: यह पेपर उन लोगों के लिए एक गाइड है जो फ्रांसीसी PDF को डेटा में बदलने की कोशिश कर रहे हैं। यह बताता है कि हालांकि एआई दस्तावेज़ पढ़ने में अद्भुत होता जा रहा है, फिर भी इसे "मानवीय बिखराव" (handwriting और जटिल लेआउट) के साथ संघर्ष करना पड़ता है, और आपको अपनी ज़रूरत के आधार पर—चाहे वह गति हो या पूर्णता—अपने टूल का चुनाव करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →