← नवीनतम पेपर
💻 computer science

ParseBench: A Document Parsing Benchmark for AI Agents

यह शोध पत्र ParseBench प्रस्तुत करता है, जो लगभग 2,000 मानव-सत्यापित उद्यम दस्तावेजों से बना एक नया बेंचमार्क है जिसे पांच महत्वपूर्ण अर्थपूर्ण शुद्धता आयामों—तालिकाएं, चार्ट, सामग्री की सत्यनिष्ठा, अर्थपूर्ण स्वरूपण और दृश्य ग्राउंडिंग—पर एआई एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान पार्सिंग विधियों में सभी क्षमताओं में सुसंगत प्रदर्शन का अभाव है।

मूल लेखक: Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Simon Suo

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Simon Suo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपनी कंपनी का दैनिक व्यवसाय चलाने में मदद करने के लिए एक सुपर-स्मार्ट रोबोट सहायक को काम पर रखा है। इस रोबोट को हर दिन हजारों दस्तावेज़ पढ़ने की आवश्यकता होगी: बीमा दावे (insurance claims), बैंक स्टेटमेंट, सरकारी नियम और जटिल अनुबंध (contracts)।

अतीत में, हम बस रोबोट से पूछते थे, "क्या आप इसे पढ़ सकते हैं?" यदि रोबोट PDF को ऐसे टेक्स्ट में बदल देता था जो मूल दस्तावेज़ जैसा लगभग दिखता था, तो हम खुश थे।

लेकिन अब, हमें रोबोट से उस जानकारी पर कार्य करने की आवश्यकता है। उसे ऋण (loan) स्वीकृत करना है, टैक्स रिटर्न दाखिल करना है, या बीमा दावा अस्वीकार करना है। यदि रोबोट किसी संख्या को गलत पढ़ लेता है, टेबल के दो कॉलम आपस में बदल देता है, या स्ट्राइकथ्रू (strikethrough) से कटी हुई "रद्द" (cancelled) वाली लाइन को छोड़ देता है, तो रोबोट एक विनाशकारी गलती कर सकता है। यह अब केवल "पढ़ने" के बारे में नहीं है; यह समझने और भरोसा करने के बारे में है।

यह पेपर ParseBench को पेश करता है, जो इन AI रोब-ऑट्स के लिए एक नया "ड्राइविंग लाइसेंस टेस्ट" है, यह देखने के लिए कि क्या वे वास्तव में वास्तविक दुनिया के व्यवसाय के हाईवे पर गाड़ी चलाने के लिए तैयार हैं।

समस्या: पुराने परीक्षण बहुत आसान थे

कल्पना कीजिए कि आप एक बच्चे को गाड़ी चलाना सिखा रहे हैं।

  • पुराने परीक्षण: आप उन्हें खाली शंकु (cones) वाले पार्किंग लॉट में रखते हैं और उन्हें एक सीधी रेखा में गाड़ी चलाने के लिए कहते हैं। वे आसानी से पास हो जाते हैं।
  • वास्तविकता: वास्तविक ड्राइविंग में बारिश, भारी ट्रैफिक, भ्रमित करने वाले सड़क संकेत और पैदल चलने वाले लोग शामिल होते हैं।

मौजूदा AI परीक्षण पार्किंग लॉट की तरह थे। उन्होंने सरल दस्तावेज़ों (मुख्यतः अकादमिक शोध पत्र) का उपयोग किया और केवल यह जांचा कि AI का टेक्स्ट आउटपुट मूल दस्तावेज़ के समान दिखता है या नहीं। वे उन अव्यवस्थित और जटिल चीजों को चूक गए जो वास्तविक व्यवसायों में होती हैं।

समाधान: ParseBench (एक "स्ट्रेस टेस्ट")

ParseBench एक विशाल, मानव-सत्यापित बाधा दौड़ (obstacle course) है। इसमें बीमा कंपनियों, बैंकों और सरकार के लगभग 2,000 पृष्ठों के वास्तविक, जटिल दस्तावेज़ शामिल हैं।

केवल यह जांचने के बजाय कि टेक्स्ट सही दिखता है या नहीं, ParseBench AI का पाँच विशिष्ट कौशलों (पाँच आयामों) पर परीक्षण करता है:

  1. टेबल मास्टर (Tables):
    • चुनौती: वास्तविक टेबल्स अव्यवस्थित होते हैं। उनमें मर्ज किए गए सेल (जैसे तीन कॉलमों को कवर करने वाला एक बड़ा हेडर), कई पृष्ठों तक फैले हेडर और जटिल ग्रिड होते हैं।
    • परीक्षण: यदि AI दो कॉलम बदल देता है या एक मर्ज किए गए सेल को छोड़ देता है, तो यह ऐसा है जैसे रोबोट ने 50कीकीमतको50 की कीमत को 500 पढ़ लिया हो। ParseBench यह जांचता है कि क्या AI शब्दों को ही नहीं, बल्कि संरचना (structure) को भी समझता है।
  2. चार्ट डिटेक्टिव (Charts):
    • चुनौती: एक ग्राफ की तस्वीर को स्प्रेडशीट में बदलना।
    • परीक्षण: क्या AI एक बार चार्ट को देखकर कह सकता है, "यह बार ठीक $401,000 है"? कई AI केवल चार्ट का वर्णन करते हैं ("यह ऊपर जाता हुआ एक नीला बार है") बजाय इसके कि वे गणित के लिए आवश्यक वास्तविक संख्याएं निकाल सकें।
  3. सत्यवादी (Content Faithfulness):
    • चुनौती: मनगढ़ंत बातें न बनाना या कुछ छोड़ना नहीं।
    • परीक्षण: यदि मूल दस्तावेज़ कहता है "भुगतान रद्द (cancelled)" और AI कहता है "भुगतान स्वीकृत (approved)", तो यह एक 'हैलुसिनेशन' (hallucination) है। यदि AI एक पैराग्राफ छोड़ देता है, तो वह एक चूक (omission) है। रोबोट को स्रोत के प्रति 100% वफादार होना चाहिए।
  4. स्टाइलिस्ट (Semantic Formatting):
    • चुनौती: यह समझना कि फॉर्मेटिंग का भी एक अर्थ होता है।
    • परीक्षण: एक अनुबंध में, यदि कोई कीमत बोल्ड (bold) है, तो वह अंतिम कीमत हो सकती है। यदि उस पर स्ट्राइकथ्रू (strikethrough) है, तो उसे हटा दिया गया है। यदि वह सुपरस्क्रिप्ट (superscript - जैसे फुटनोट मार्कर) है, तो वह एक संदर्भ है। कई AI इस फॉर्मेटिंग को हटा देते हैं, जिससे एक सूक्ष्म दस्तावेज़ एक सपाट, भ्रमित करने वाली टेक्स्ट की दीवार में बदल जाता है।
  5. जीपीएस (Visual Grounding):
    • चुनौती: यह जानना कि जानकारी कहाँ से आई है।
    • परीक्षण: यदि AI कहता है "कुल राशि 100है,"तोक्यावहमूलपृष्ठकेउससटीकस्थानकीओरइशाराकरसकताहैजहाँवह100 है," तो क्या वह मूल पृष्ठ के उस सटीक स्थान की ओर इशारा कर सकता है जहाँ वह 100 लिखा है? ऑडिट के लिए यह अत्यंत महत्वपूर्ण है। यदि कोई इंसान पूछता है, "मुझे सबूत दिखाओ," तो रोबोट को उसकी ओर इशारा करने में सक्षम होना चाहिए।

परिणाम: कौन पास हुआ?

लेखकों ने बड़ी टेक दिग्गजों (जैसे Google, OpenAI, Anthropic) से लेकर विशेष दस्तावेज़ पार्सर्स तक 14 अलग-अलग AI सिस्टम का परीक्षण किया।

  • फैसला: कोई भी एक रोबोट हर चीज़ में परफेक्ट नहीं है।
    • कुछ टेक्स्ट पढ़ने में बेहतरीन हैं लेकिन चार्ट पढ़ने में बहुत खराब हैं।
    • कुछ पेज पर सही जगह खोजने में अच्छे हैं लेकिन टेबल की संरचना समझने में खराब हैं।
    • अधिकांश "सामान्य" AI मॉडल (जिनसे आप चैट करते हैं) व्यावसायिक दस्तावेजों के जटिल विवरणों के साथ संघर्ष करते हैं।
  • विजेता: लेखकों के अपने सिस्टम, LlamaParse Agentic ने कुल मिलाकर (84.9%) उच्चतम स्कोर किया। यह एकमात्र ऐसा सिस्टम था जो इन पाँच कठिन कौशलों में लगातार मजबूत रहा।

यह क्यों मायने रखता है

इसे एक पर्यटक और एक सर्जन के बीच के अंतर की तरह समझें।

  • एक पर्यटक मानचित्र को देख सकता है और कह सकता है, "वह एक अस्पताल जैसा लग रहा है।"
  • एक सर्जन को यह जानने की आवश्यकता है कि ठीक कहाँ चीरा लगाना है, किस नस से बचना है, और दवा की सटीक खुराक क्या होनी चाहिए।

व्यवसाय के लिए उपयोगी होने के लिए, AI को सर्जन होना चाहिए। उसे केवल दस्तावेज़ को "देखना" नहीं चाहिए; उसे दस्तावेज़ को एक सर्जन की सटीकता के साथ पार्स (parse) करना चाहिए ताकि जब वह कोई निर्णय ले, तो वह निर्णय सुरक्षित, सटीक और भरोसेमंद हो।

ParseBench वह उपकरण है जो अंततः हमें यह मापने की अनुमति देता है कि हमारे AI रोबोट्स सर्जन बनने के लिए तैयार हैं, या वे अभी भी केवल मानचित्र देखते हुए पर्यटक हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →