← नवीनतम पेपर
💻 computer science

How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings

यह शोधपत्र PureDocBench प्रस्तुत करता है, जो एक स्रोत-ट्रेसेबल (source-traceable) बेंचमार्क है जिसमें स्वच्छ, क्षयित (degraded) और वास्तविक दुनिया के दस्तावेज़ चित्र शामिल हैं, जो संतृप्त OmniDocBench रैंकिंग में महत्वपूर्ण खामियों को उजागर करता है और यह प्रकट करता है कि दस्तावेज़ पार्सिंग अभी भी एक अनसुलझी चुनौती बनी हुई है, जिसमें मॉडलों के बीच प्रदर्शन का बड़ा अंतर है और फॉर्मूला रिकग्निशन में निरंतर बाधाएं मौजूद हैं।

मूल लेखक: Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दुनिया के सर्वश्रेष्ठ शेफ (chef) का निर्णय करने की कोशिश कर रहे हैं। पिछले एक साल से, हर कोई एक ही छोटे से किचन में प्रतिस्पर्धा कर रहा था जिसे OmniDocBench कहा जाता है। इस किचन में केवल 1,355 व्यंजन (dishes) हैं, और जज (स्कोरिंग सिस्टम) इतने उदार रहे हैं कि लगभग हर शीर्ष शेफ को 90% या उससे अधिक अंक मिल गए। यह एक ऐसी दौड़ की तरह है जहाँ हर कोई बिल्कुल एक ही समय पर फिनिश लाइन पार कर रहा है; आप यह नहीं बता सकते कि वास्तव में कौन तेज़ या बेहतर है।

इसके अलावा, जजों ने कुछ गलतियाँ भी कीं। उन्होंने सामग्री (ingredients) की गिनती गलत की, चरणों (steps) को छोड़ दिया, और यहाँ तक कि उन स्वादों की कल्पना भी कर ली जो वहाँ थे ही नहीं। क्योंकि "रेसिपी" (ग्राउंड ट्रुथ) दोषपूर्ण थी, इसलिए लीडरबोर्ड रैंकिंग अविश्वसनीय है। साथ ही, चूंकि सभी शेफ एक साल से इसी एक किचन में खाना बना रहे हैं, इसलिए हो सकता है कि शेफ ने खाना बनाना सीखने के बजाय व्यंजनों को रट लिया हो।

यहाँ आता है PureDocBench, यह नया, विशाल और पूरी तरह से व्यवस्थित किचन जिसे इस पेपर में पेश किया गया है।

नया किचन: PureDocBench

पुरानी, अव्यवस्थित रेसिपीज़ के बजाय, PureDocBench के रचनाकारों ने अपने किचन को डिजिटल ब्लूप्रिंट (HTML/CSS) का उपयोग करके शून्य से बनाया है।

  • ब्लूप्रिंट: उन्होंने पहले दस्तावेज़ का कोड लिखा।
  • व्यंजन (Dish): उन्होंने उस कोड का उपयोग करके दस्तावेज़ की छवि (image) बनाई।
  • उत्तर कुंजी (Answer Key): क्योंकि उन्होंने पहले कोड लिखा, वे ठीक से जानते हैं कि टेक्स्ट, टेबल और फॉर्मूले कैसे दिखने चाहिए। यहाँ कोई अनुमान लगाने की आवश्यकता नहीं है।

यह किचन बहुत बड़ा है। इसमें 10 अलग-अलग प्रकार के रेस्टोरेंट्स (अकादमिक, कानूनी, चिकित्सा, वित्त, आदि) और 66 विशिष्ट मेनू आइटम (जैसे इनवॉइस, डिप्लोमा, या लैब रिपोर्ट) हैं।

हर व्यंजन के तीन संस्करण

शेफ वास्तव में कितने कठिन हैं, यह परीक्षण करने के लिए, किचन में हर व्यंजन को तीन अलग-अलग स्थितियों में परोसा जाता है:

  1. क्लीन (Clean): ओवन से सीधे निकली एक एकदम ताज़ा और उत्तम प्लेट।
  2. डिजिटली डिग्रेडेड (Digitally Degraded): प्लेट को एक खराब स्कैनर द्वारा स्कैन किया गया था, या फोटो को कंप्रेस किया गया था, जिससे वह धुंधली या पीली दिखने लगी (जैसे एक पुराना फैक्स)।
  3. रियल-वर्ल्ड डिग्रेडेड (Real-World Degraded): प्लेट को प्रिंट किया गया था, फिर किसी ने कम रोशनी में कांपते हाथों से उसकी फोटो ली, या शायद यह एक फोटोकॉपी की फोटोकॉपी थी।

यह महत्वपूर्ण है क्योंकि एक शेफ एक उत्तम व्यंजन सजाने में तो बहुत अच्छा हो सकता है लेकिन एक बिखरे हुए या खराब व्यंजन को परोसने में बहुत बुरा हो सकता है।

परिणाम: वास्तव में कौन जीता?

शोधकर्ताओं ने इस नए किचन में 40 अलग-अलग शेफ (AI मॉडल्स) का परीक्षण किया। उन्हें क्या पता चला, यहाँ दिया गया है:

1. दौड़ अभी खत्म नहीं हुई है
पुराने किचन में, सर्वश्रेष्ठ शेफ 90% से अधिक स्कोर करते थे। PureDocBench में, सर्वश्रेष्ठ शेफ ने 100 में से केवल 74 अंक प्राप्त किए। एक विशाल अंतर (44 अंक) है। इसका मतलब है कि डॉक्यूमेंट पार्सिंग (document parsing) अभी तक हल नहीं हुआ है; सुधार की अभी भी बहुत गुंजाइश है।

2. छोटे विशेषज्ञ बनाम विशाल सामान्यज्ञ (Small Specialists vs. Giant Generalists)
यहाँ दो प्रकार के शेफ हैं:

  • विशेषज्ञ (Specialists): वे शेफ जो केवल दस्तावेज़ों को बनाना जानते हैं। वे छोटे और कुशल होते हैं।
  • सामान्यज्ञ (Generalists): विशाल, बहु-प्रतिभाशाली शेफ जो कुछ भी बना सकते हैं लेकिन दस्तावेज़ों में विशेषज्ञ नहीं हैं।

पेपर ने पाया कि छोटे विशेषज्ञ (कुछ जिनके पास 4 बिलियन से भी कम "मस्तिष्क कोशिकाएं" हैं) उन विशाल सामान्यज्ञों (जो 100 गुना बड़े हो सकते हैं) के समान अच्छे हैं या उनसे भी बेहतर हैं। यह एक छोटे, विशेष सुशी शेफ की एक विशाल, ऑल-यू-कैन-ईट बुफे शेफ से सुशी बनाने में बेहतर होने जैसा है।

3. फॉर्मूला बॉटलनेक (The Formula Bottleneck)
चाहे शेफ कितना भी स्मार्ट क्यों न हो, गणितीय सूत्र (math formulas) सबसे कठिन हिस्सा हैं। यहाँ तक कि सर्वश्रेष्ठ मॉडल भी फॉर्मूलों पर लगभग 67% सही होते हैं। यह एक सार्वभौमिक कमजोरी है।

4. "बिखरी हुई प्लेट" का सरप्राइज
यह सबसे दिलचस्प खोज है।

  • विशेषज्ञ शेफ (Specialist chefs) बिखर गए जब प्लेटें अस्त-व्यस्त हुईं (रियल-वर्ल्ड डिग्रेडेड)। उनके स्कोर में काफी गिरावट आई।
  • सामान्यज्ञ शेफ (Generalist chefs) आश्चर्यजनक रूप से मजबूत निकले। उन्होंने बिखरी हुई, धुंधली, वास्तविक दुनिया की तस्वीरों को बहुत बेहतर तरीके से संभाला।

इसका मतलब है कि यदि आप केवल उत्तम, साफ प्लेटों पर शेफ का परीक्षण करते हैं, तो आपको गलत विचार मिलता है कि वास्तव में दुनिया में कौन सफल होगा। जब आप वास्तविक दुनिया का शोर (noise) जोड़ते हैं, तो रैंकिंग बदल जाती!

निष्कर्ष (The Takeaway)

पेपर का तर्क है कि हमें AI को आंकने के लिए पुराने, दोषपूर्ण किचन (OmniDocBench) का उपयोग करना बंद कर देना चाहिए। हमें PureDocBench का उपयोग करना चाहिए, जो कि:

  • एक पूर्ण, पता लगाने योग्य उत्तर कुंजी रखता है (कोई और जज एरर नहीं)।
  • शेफ का परीक्षण उत्तम, साफ स्थितियों के बजाय, बिखरी हुई, वास्तविक दुनिया की स्थितियों में करता है।
  • यह प्रकट करता है कि हालांकि AI बेहतर हो रहा है, लेकिन अभी भी इसमें बहुत लंबा रास्ता तय करना है, विशेष रूप से गणितीय सूत्रों और वास्तविक दुनिया की अव्यवस्था को संभालने के मामले में।

शोधकर्ताओं ने इस नए किचन के दरवाजे खोल दिए हैं, जिससे सभी को ब्लूप्रिंट, व्यंजन और उत्तर कुंजियाँ मिल गई हैं ताकि समुदाय मिलकर बेहतर शेफ बना सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →