ParseBench: A Document Parsing Benchmark for AI Agents
यह शोध पत्र ParseBench प्रस्तुत करता है, जो लगभग 2,000 मानव-सत्यापित उद्यम दस्तावेजों से बना एक नया बेंचमार्क है जिसे पांच महत्वपूर्ण अर्थपूर्ण शुद्धता आयामों—तालिकाएं, चार्ट, सामग्री की सत्यनिष्ठा, अर्थपूर्ण स्वरूपण और दृश्य ग्राउंडिंग—पर एआई एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान पार्सिंग विधियों में सभी क्षमताओं में सुसंगत प्रदर्शन का अभाव है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपनी कंपनी का दैनिक व्यवसाय चलाने में मदद करने के लिए एक सुपर-स्मार्ट रोबोट सहायक को काम पर रखा है। इस रोबोट को हर दिन हजारों दस्तावेज़ पढ़ने की आवश्यकता होगी: बीमा दावे (insurance claims), बैंक स्टेटमेंट, सरकारी नियम और जटिल अनुबंध (contracts)।
अतीत में, हम बस रोबोट से पूछते थे, "क्या आप इसे पढ़ सकते हैं?" यदि रोबोट PDF को ऐसे टेक्स्ट में बदल देता था जो मूल दस्तावेज़ जैसा लगभग दिखता था, तो हम खुश थे।
लेकिन अब, हमें रोबोट से उस जानकारी पर कार्य करने की आवश्यकता है। उसे ऋण (loan) स्वीकृत करना है, टैक्स रिटर्न दाखिल करना है, या बीमा दावा अस्वीकार करना है। यदि रोबोट किसी संख्या को गलत पढ़ लेता है, टेबल के दो कॉलम आपस में बदल देता है, या स्ट्राइकथ्रू (strikethrough) से कटी हुई "रद्द" (cancelled) वाली लाइन को छोड़ देता है, तो रोबोट एक विनाशकारी गलती कर सकता है। यह अब केवल "पढ़ने" के बारे में नहीं है; यह समझने और भरोसा करने के बारे में है।
यह पेपर ParseBench को पेश करता है, जो इन AI रोब-ऑट्स के लिए एक नया "ड्राइविंग लाइसेंस टेस्ट" है, यह देखने के लिए कि क्या वे वास्तव में वास्तविक दुनिया के व्यवसाय के हाईवे पर गाड़ी चलाने के लिए तैयार हैं।
समस्या: पुराने परीक्षण बहुत आसान थे
कल्पना कीजिए कि आप एक बच्चे को गाड़ी चलाना सिखा रहे हैं।
- पुराने परीक्षण: आप उन्हें खाली शंकु (cones) वाले पार्किंग लॉट में रखते हैं और उन्हें एक सीधी रेखा में गाड़ी चलाने के लिए कहते हैं। वे आसानी से पास हो जाते हैं।
- वास्तविकता: वास्तविक ड्राइविंग में बारिश, भारी ट्रैफिक, भ्रमित करने वाले सड़क संकेत और पैदल चलने वाले लोग शामिल होते हैं।
मौजूदा AI परीक्षण पार्किंग लॉट की तरह थे। उन्होंने सरल दस्तावेज़ों (मुख्यतः अकादमिक शोध पत्र) का उपयोग किया और केवल यह जांचा कि AI का टेक्स्ट आउटपुट मूल दस्तावेज़ के समान दिखता है या नहीं। वे उन अव्यवस्थित और जटिल चीजों को चूक गए जो वास्तविक व्यवसायों में होती हैं।
समाधान: ParseBench (एक "स्ट्रेस टेस्ट")
ParseBench एक विशाल, मानव-सत्यापित बाधा दौड़ (obstacle course) है। इसमें बीमा कंपनियों, बैंकों और सरकार के लगभग 2,000 पृष्ठों के वास्तविक, जटिल दस्तावेज़ शामिल हैं।
केवल यह जांचने के बजाय कि टेक्स्ट सही दिखता है या नहीं, ParseBench AI का पाँच विशिष्ट कौशलों (पाँच आयामों) पर परीक्षण करता है:
- टेबल मास्टर (Tables):
- चुनौती: वास्तविक टेबल्स अव्यवस्थित होते हैं। उनमें मर्ज किए गए सेल (जैसे तीन कॉलमों को कवर करने वाला एक बड़ा हेडर), कई पृष्ठों तक फैले हेडर और जटिल ग्रिड होते हैं।
- परीक्षण: यदि AI दो कॉलम बदल देता है या एक मर्ज किए गए सेल को छोड़ देता है, तो यह ऐसा है जैसे रोबोट ने 500 पढ़ लिया हो। ParseBench यह जांचता है कि क्या AI शब्दों को ही नहीं, बल्कि संरचना (structure) को भी समझता है।
- चार्ट डिटेक्टिव (Charts):
- चुनौती: एक ग्राफ की तस्वीर को स्प्रेडशीट में बदलना।
- परीक्षण: क्या AI एक बार चार्ट को देखकर कह सकता है, "यह बार ठीक $401,000 है"? कई AI केवल चार्ट का वर्णन करते हैं ("यह ऊपर जाता हुआ एक नीला बार है") बजाय इसके कि वे गणित के लिए आवश्यक वास्तविक संख्याएं निकाल सकें।
- सत्यवादी (Content Faithfulness):
- चुनौती: मनगढ़ंत बातें न बनाना या कुछ छोड़ना नहीं।
- परीक्षण: यदि मूल दस्तावेज़ कहता है "भुगतान रद्द (cancelled)" और AI कहता है "भुगतान स्वीकृत (approved)", तो यह एक 'हैलुसिनेशन' (hallucination) है। यदि AI एक पैराग्राफ छोड़ देता है, तो वह एक चूक (omission) है। रोबोट को स्रोत के प्रति 100% वफादार होना चाहिए।
- स्टाइलिस्ट (Semantic Formatting):
- चुनौती: यह समझना कि फॉर्मेटिंग का भी एक अर्थ होता है।
- परीक्षण: एक अनुबंध में, यदि कोई कीमत बोल्ड (bold) है, तो वह अंतिम कीमत हो सकती है। यदि उस पर
स्ट्राइकथ्रू(strikethrough) है, तो उसे हटा दिया गया है। यदि वह सुपरस्क्रिप्ट (superscript - जैसे फुटनोट मार्कर) है, तो वह एक संदर्भ है। कई AI इस फॉर्मेटिंग को हटा देते हैं, जिससे एक सूक्ष्म दस्तावेज़ एक सपाट, भ्रमित करने वाली टेक्स्ट की दीवार में बदल जाता है।
- जीपीएस (Visual Grounding):
- चुनौती: यह जानना कि जानकारी कहाँ से आई है।
- परीक्षण: यदि AI कहता है "कुल राशि 100 लिखा है? ऑडिट के लिए यह अत्यंत महत्वपूर्ण है। यदि कोई इंसान पूछता है, "मुझे सबूत दिखाओ," तो रोबोट को उसकी ओर इशारा करने में सक्षम होना चाहिए।
परिणाम: कौन पास हुआ?
लेखकों ने बड़ी टेक दिग्गजों (जैसे Google, OpenAI, Anthropic) से लेकर विशेष दस्तावेज़ पार्सर्स तक 14 अलग-अलग AI सिस्टम का परीक्षण किया।
- फैसला: कोई भी एक रोबोट हर चीज़ में परफेक्ट नहीं है।
- कुछ टेक्स्ट पढ़ने में बेहतरीन हैं लेकिन चार्ट पढ़ने में बहुत खराब हैं।
- कुछ पेज पर सही जगह खोजने में अच्छे हैं लेकिन टेबल की संरचना समझने में खराब हैं।
- अधिकांश "सामान्य" AI मॉडल (जिनसे आप चैट करते हैं) व्यावसायिक दस्तावेजों के जटिल विवरणों के साथ संघर्ष करते हैं।
- विजेता: लेखकों के अपने सिस्टम, LlamaParse Agentic ने कुल मिलाकर (84.9%) उच्चतम स्कोर किया। यह एकमात्र ऐसा सिस्टम था जो इन पाँच कठिन कौशलों में लगातार मजबूत रहा।
यह क्यों मायने रखता है
इसे एक पर्यटक और एक सर्जन के बीच के अंतर की तरह समझें।
- एक पर्यटक मानचित्र को देख सकता है और कह सकता है, "वह एक अस्पताल जैसा लग रहा है।"
- एक सर्जन को यह जानने की आवश्यकता है कि ठीक कहाँ चीरा लगाना है, किस नस से बचना है, और दवा की सटीक खुराक क्या होनी चाहिए।
व्यवसाय के लिए उपयोगी होने के लिए, AI को सर्जन होना चाहिए। उसे केवल दस्तावेज़ को "देखना" नहीं चाहिए; उसे दस्तावेज़ को एक सर्जन की सटीकता के साथ पार्स (parse) करना चाहिए ताकि जब वह कोई निर्णय ले, तो वह निर्णय सुरक्षित, सटीक और भरोसेमंद हो।
ParseBench वह उपकरण है जो अंततः हमें यह मापने की अनुमति देता है कि हमारे AI रोबोट्स सर्जन बनने के लिए तैयार हैं, या वे अभी भी केवल मानचित्र देखते हुए पर्यटक हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।