PulseBench-Tab: A Multilingual Benchmark for Table Extraction with Graph-Based Evaluation
यह शोधपत्र PulseBench-Tab प्रस्तुत करता है, जो नौ भाषाओं और चार लिपियों में 1,820 मानव-एनोटेटेड तालिकाओं से युक्त एक बहुभाषी बेंचमार्क है, साथ ही इसमें जटिल, वास्तविक दुनिया की दस्तावेज़ छवियों पर विभिन्न तालिका निष्कर्षण प्रणालियों के प्रदर्शन का आकलन करने के लिए T-LAG नामक एक नवीन ग्राफ-आधारित मूल्यांकन मीट्रिक भी शामिल है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल पुस्तकालय है—वित्तीय रिपोर्ट, सरकारी फॉर्म और कॉर्पोरेट खुलासे—जो नौ अलग-अलग भाषाओं में छपे हुए हैं। इन दस्तावेजों के भीतर हजारों टेबल हैं, जैसे कि स्प्रेडशीट, जो संख्याओं और टेक्स्ट से भरी हुई हैं। इस पेपर का लक्ष्य यह देखना है कि कंप्यूटर कितनी अच्छी तरह से इन टेबल्स को "पढ़" सकते हैं, उन्हें पूरी तरह से कॉपी कर सकते हैं, और यह समझ सकते हैं कि जानकारी का हर एक हिस्सा वास्तव में कहाँ होना चाहिए।
यहाँ PulseBench-Tab और T-LAG का सरल विवरण दिया गया है।
1. समस्या: टेबल कठिन क्यों हैं
टेबल को पढ़ना केवल अक्षरों को पहचानना (जैसे कि किताब पढ़ना) नहीं है। यह ज्यामिति (geometry) को समझने के बारे में है।
- उपमा (Analogy): कल्पना कीजिए कि एक टेबल एक जिग्सॉ पहेली (jigsaw puzzle) की तरह है। यदि आप "100" संख्या वाले एक टुकड़े को गलत जगह रख देते हैं, तो पूरी तस्वीर बिगड़ जाती है। एक कंप्यूटर सिस्टम में, यदि कोई संख्या गलत सेल में चली जाती है, तो यह केवल एक टाइपिंग की गलती नहीं है; यह एक आपदा है जो बाद में किए जाने वाले किसी भी कैलकुलेशन को खराब कर देती है।
- अंतराल (Gap): पिछले परीक्षणों में ज्यादातर अंग्रेजी टेबल्स को देखा गया या टेबल्स को शब्दों की लंबी सूचियों (फ्लैटनिंग) की तरह माना गया, जिससे उनकी 2D संरचना (पंक्तियाँ और कॉलम) खो जाती है। उन्होंने उन भाषाओं का भी पर्याप्त परीक्षण नहीं किया जो दाएं-से-बाएं लिखी जाती हैं (जैसे अरबी) या जो जटिल पात्रों (जैसे चीनी या जापानी) का उपयोग करती हैं।
2. समाधान: एक नया "टेबल जिम" (डेटासेट)
लेखकों ने PulseBench-Tab नामक एक विशाल प्रशिक्षण मैदान बनाया है।
- आकार: इसमें 1,820 वास्तविक दुनिया की टेबल्स शामिल हैं।
- विविधता: ये टेबल्स 9 भाषाओं (अंग्रेजी, चीनी, अरबी, रूसी, आदि) में 380 विभिन्न दस्तावेजों से ली गई हैं और 4 अलग-अलग लेखन प्रणालियों का उपयोग करती हैं।
- कठिनाई: कुछ टेबल्स बहुत छोटी हैं (केवल 2 सेल), जबकि अन्य 1,000 से अधिक सेल वाले दैत्य समान हैं। लगभग आधे में "मर्ज" किए गए सेल (जहाँ एक बड़ा सेल दो या तीन छोटे सेल्स की जगह घेर लेता है) हैं, जो एक पहेली के टुकड़े की तरह है जो बोर्ड पर कई स्थानों को कवर करता है।
- गोल्ड स्टैंडर्ड: प्रत्येक टेबल की जांच उन विशिष्ट भाषाओं के मानव विशेषज्ञों द्वारा की गई थी ताकि यह सुनिश्चित हो सके कि "उत्तर कुंजी" 100% सही है।
3. नया रूलर: T-LAG (ग्राफ मेट्रिक)
कंप्यूटरों को ग्रेड देने के लिए, लेखकों ने T-LAG नामक एक नई स्कोरिंग प्रणाली बनाई है।
- पुराना तरीका: पिछली विधियों ने अक्सर यह देखा कि कंप्यूटर ने सही शब्द प्राप्त किए या नहीं, लेकिन उन्हें इस बात की ज्यादा परवाह नहीं थी कि वे शब्द उनके सही पड़ोसियों के साथ थे या नहीं। यह एक छात्र को स्पेलिंग टेस्ट पर ग्रेड देने जैसा था लेकिन इस बात को नजरअंदाज करना कि उन्होंने शब्दों को सही वाक्यों में रखा है या नहीं।
- नया तरीका (T-LAG): टेबल को सड़कों से जुड़े शहरों के मानचित्र के रूप में कल्पना करें।
- नोड्स (शहर): व्यक्तिगत सेल।
- एजेस (सड़कें): सेल के बीच के संबंध (जैसे, "सेल A, सेल B के दाईं ओर है" या "सेल C, सेल D के नीचे है")।
- स्कोरिंग कैसे होती है: T-LAG "सड़कों" को देखता है। यह पूछता है: "क्या कंप्यूटर ने वास्तविक टेबल की तरह ही सड़कों का नक्शा बनाया है?"
- यदि कंप्यूटर टेक्स्ट को सही प्राप्त करता है लेकिन उसे गलत कॉलम में रखता है, तो "सड़क" टूट जाती है, और स्कोर गिर जाता है।
- यह एक विशेष गणितीय ट्रिक (हंगेरियन एल्गोरिदम) का उपयोग करता है ताकि वास्तविक टेबल और कंप्यूटर की टेबल के बीच सबसे अच्छा मिलान पाया जा सके, यह सुनिश्चित करने के लिए कि यह केवल रैंडम अनुमान न लगाए।
- "कठोरता" का डायल: लेखकों ने स्कोरिंग को बहुत सख्त (एक "k=7" सेटिंग) रखा है। वास्तविक दुनिया में, यदि एक वित्तीय रिपोर्ट "10 मिलियन" कहती है, तो यह एक विफलता है, न कि एक "करीब-करीब" का प्रयास। यह मेट्रिक वास्तविक दुनिया की जरूरतों को दर्शाने के लिए छोटी गलतियों को भी बड़ी विफलताओं के रूप में मानता है।
4. दौड़: कौन जीता?
लेखकों ने इस डेटासेट पर 9 अलग-अलग कंप्यूटर सिस्टम (बड़ी टेक API, ओपन-सोर्स टूल्स और उनके अपने सिस्टम सहित) का परीक्षण किया।
- विजेता: Pulse Ultra 2 (लेखकों का अपना सिस्टम) 93.5% के स्कोर के साथ पहले स्थान पर आया। यह एकमात्र ऐसा सिस्टम था जिसने आधी से अधिक टेबल्स पर "परफेक्ट" स्कोर प्राप्त किया।
- उपविजेता: Gemini 3.1 81.6% के साथ दूसरे स्थान पर रहा।
- अंतराल: शीर्ष दो के बाद स्कोर में भारी गिरावट आई। निचले तीसरे हिस्से के सिस्टमों का स्कोर 72% से नीचे था, जिसका अर्थ है कि वे काफी संघर्ष कर रहे थे।
- सबसे कठिन चुनौती: गैर-लैटिन लिपियाँ (जैसे अरबी, कोरियाई और चीनी) सभी के लिए सबसे कठिन थीं।
- उपमा: इसे एक ऐसे धावक के रूप में सोचें जो एक सपाट, पक्की सड़क (अंग्रेजी) पर बहुत अच्छा है लेकिन एक पहाड़ी रास्ते (अरबी/कोरियाई) पर हर पत्थर से टकराकर गिर जाता है। सबसे अच्छे सिस्टमों ने भी भाषा बदलने पर अपने स्कोर में महत्वपूर्ण गिरावट देखी।
- "साइलेंट फेलियर्स" (मौन विफलताएं): कुछ सिस्टमों ने केवल गलत उत्तर ही नहीं दिए; बल्कि लगभग 20% टेबल्स के लिए उन्होंने कोई उत्तर ही नहीं दिया। वास्तविक व्यवसाय में, यह एक ऐसे रोबोट की तरह है जो कठिन दस्तावेज़ देखते ही काम करना बंद कर देता है।
5. निष्कर्ष (Takeaway)
पेपर यह निष्कर्ष निकालता है कि हालांकि कंप्यूटर टेबल्स को पढ़ने में बेहतर हो रहे हैं, लेकिन सबसे अच्छे सिस्टम और बाकी क्षेत्र के बीच एक बड़ा अंतर है, खासकर जटिल लेआउट या गैर-अंग्रेजी भाषाओं के मामले में।
उन्होंने डेटासेट, स्कोरिंग कोड और परिणामों को सार्वजनिक रूप से जारी कर दिया है। यह जिम के दरवाजे सभी के लिए खोलने जैसा है, ताकि शोधकर्ता देख सकें कि मशीनें वास्तव में कहाँ विफल हो रही हैं और अनुमान लगाने के बजाय उन्हें ठीक करने का प्रयास कर सकें।
संक्षेप में: उन्होंने टेबल-रीडिंग AI के लिए एक कठिन, बहुभाषी बाधा दौड़ (obstacle course) बनाई, AI ने इस बाधा दौड़ को कितनी अच्छी तरह पार किया, इसे मापने के लिए एक नया रूलर बनाया, और पाया कि हालांकि एक सिस्टम वर्तमान में सबसे आगे है, लेकिन अधिकांश अन्य अभी भी जटिल, गैर-अंग्रेजी परिवेश में अपना संतुलन बनाए रखने के लिए संघर्ष कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।