← नवीनतम पेपर
💬 NLP

PulseBench-Tab: A Multilingual Benchmark for Table Extraction with Graph-Based Evaluation

यह शोधपत्र PulseBench-Tab प्रस्तुत करता है, जो नौ भाषाओं और चार लिपियों में 1,820 मानव-एनोटेटेड तालिकाओं से युक्त एक बहुभाषी बेंचमार्क है, साथ ही इसमें जटिल, वास्तविक दुनिया की दस्तावेज़ छवियों पर विभिन्न तालिका निष्कर्षण प्रणालियों के प्रदर्शन का आकलन करने के लिए T-LAG नामक एक नवीन ग्राफ-आधारित मूल्यांकन मीट्रिक भी शामिल है।

मूल लेखक: Ritvik Pandey, Sid Manchkanti, Mohammed Wazir Adain, Mohammed Hadi, Dushyanth Sekhar

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ritvik Pandey, Sid Manchkanti, Mohammed Wazir Adain, Mohammed Hadi, Dushyanth Sekhar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल पुस्तकालय है—वित्तीय रिपोर्ट, सरकारी फॉर्म और कॉर्पोरेट खुलासे—जो नौ अलग-अलग भाषाओं में छपे हुए हैं। इन दस्तावेजों के भीतर हजारों टेबल हैं, जैसे कि स्प्रेडशीट, जो संख्याओं और टेक्स्ट से भरी हुई हैं। इस पेपर का लक्ष्य यह देखना है कि कंप्यूटर कितनी अच्छी तरह से इन टेबल्स को "पढ़" सकते हैं, उन्हें पूरी तरह से कॉपी कर सकते हैं, और यह समझ सकते हैं कि जानकारी का हर एक हिस्सा वास्तव में कहाँ होना चाहिए।

यहाँ PulseBench-Tab और T-LAG का सरल विवरण दिया गया है।

1. समस्या: टेबल कठिन क्यों हैं

टेबल को पढ़ना केवल अक्षरों को पहचानना (जैसे कि किताब पढ़ना) नहीं है। यह ज्यामिति (geometry) को समझने के बारे में है।

  • उपमा (Analogy): कल्पना कीजिए कि एक टेबल एक जिग्सॉ पहेली (jigsaw puzzle) की तरह है। यदि आप "100" संख्या वाले एक टुकड़े को गलत जगह रख देते हैं, तो पूरी तस्वीर बिगड़ जाती है। एक कंप्यूटर सिस्टम में, यदि कोई संख्या गलत सेल में चली जाती है, तो यह केवल एक टाइपिंग की गलती नहीं है; यह एक आपदा है जो बाद में किए जाने वाले किसी भी कैलकुलेशन को खराब कर देती है।
  • अंतराल (Gap): पिछले परीक्षणों में ज्यादातर अंग्रेजी टेबल्स को देखा गया या टेबल्स को शब्दों की लंबी सूचियों (फ्लैटनिंग) की तरह माना गया, जिससे उनकी 2D संरचना (पंक्तियाँ और कॉलम) खो जाती है। उन्होंने उन भाषाओं का भी पर्याप्त परीक्षण नहीं किया जो दाएं-से-बाएं लिखी जाती हैं (जैसे अरबी) या जो जटिल पात्रों (जैसे चीनी या जापानी) का उपयोग करती हैं।

2. समाधान: एक नया "टेबल जिम" (डेटासेट)

लेखकों ने PulseBench-Tab नामक एक विशाल प्रशिक्षण मैदान बनाया है।

  • आकार: इसमें 1,820 वास्तविक दुनिया की टेबल्स शामिल हैं।
  • विविधता: ये टेबल्स 9 भाषाओं (अंग्रेजी, चीनी, अरबी, रूसी, आदि) में 380 विभिन्न दस्तावेजों से ली गई हैं और 4 अलग-अलग लेखन प्रणालियों का उपयोग करती हैं।
  • कठिनाई: कुछ टेबल्स बहुत छोटी हैं (केवल 2 सेल), जबकि अन्य 1,000 से अधिक सेल वाले दैत्य समान हैं। लगभग आधे में "मर्ज" किए गए सेल (जहाँ एक बड़ा सेल दो या तीन छोटे सेल्स की जगह घेर लेता है) हैं, जो एक पहेली के टुकड़े की तरह है जो बोर्ड पर कई स्थानों को कवर करता है।
  • गोल्ड स्टैंडर्ड: प्रत्येक टेबल की जांच उन विशिष्ट भाषाओं के मानव विशेषज्ञों द्वारा की गई थी ताकि यह सुनिश्चित हो सके कि "उत्तर कुंजी" 100% सही है।

3. नया रूलर: T-LAG (ग्राफ मेट्रिक)

कंप्यूटरों को ग्रेड देने के लिए, लेखकों ने T-LAG नामक एक नई स्कोरिंग प्रणाली बनाई है।

  • पुराना तरीका: पिछली विधियों ने अक्सर यह देखा कि कंप्यूटर ने सही शब्द प्राप्त किए या नहीं, लेकिन उन्हें इस बात की ज्यादा परवाह नहीं थी कि वे शब्द उनके सही पड़ोसियों के साथ थे या नहीं। यह एक छात्र को स्पेलिंग टेस्ट पर ग्रेड देने जैसा था लेकिन इस बात को नजरअंदाज करना कि उन्होंने शब्दों को सही वाक्यों में रखा है या नहीं।
  • नया तरीका (T-LAG): टेबल को सड़कों से जुड़े शहरों के मानचित्र के रूप में कल्पना करें।
    • नोड्स (शहर): व्यक्तिगत सेल।
    • एजेस (सड़कें): सेल के बीच के संबंध (जैसे, "सेल A, सेल B के दाईं ओर है" या "सेल C, सेल D के नीचे है")।
  • स्कोरिंग कैसे होती है: T-LAG "सड़कों" को देखता है। यह पूछता है: "क्या कंप्यूटर ने वास्तविक टेबल की तरह ही सड़कों का नक्शा बनाया है?"
    • यदि कंप्यूटर टेक्स्ट को सही प्राप्त करता है लेकिन उसे गलत कॉलम में रखता है, तो "सड़क" टूट जाती है, और स्कोर गिर जाता है।
    • यह एक विशेष गणितीय ट्रिक (हंगेरियन एल्गोरिदम) का उपयोग करता है ताकि वास्तविक टेबल और कंप्यूटर की टेबल के बीच सबसे अच्छा मिलान पाया जा सके, यह सुनिश्चित करने के लिए कि यह केवल रैंडम अनुमान न लगाए।
    • "कठोरता" का डायल: लेखकों ने स्कोरिंग को बहुत सख्त (एक "k=7" सेटिंग) रखा है। वास्तविक दुनिया में, यदि एक वित्तीय रिपोर्ट "1मिलियन"केबजाय"1 मिलियन" के बजाय "10 मिलियन" कहती है, तो यह एक विफलता है, न कि एक "करीब-करीब" का प्रयास। यह मेट्रिक वास्तविक दुनिया की जरूरतों को दर्शाने के लिए छोटी गलतियों को भी बड़ी विफलताओं के रूप में मानता है।

4. दौड़: कौन जीता?

लेखकों ने इस डेटासेट पर 9 अलग-अलग कंप्यूटर सिस्टम (बड़ी टेक API, ओपन-सोर्स टूल्स और उनके अपने सिस्टम सहित) का परीक्षण किया।

  • विजेता: Pulse Ultra 2 (लेखकों का अपना सिस्टम) 93.5% के स्कोर के साथ पहले स्थान पर आया। यह एकमात्र ऐसा सिस्टम था जिसने आधी से अधिक टेबल्स पर "परफेक्ट" स्कोर प्राप्त किया।
  • उपविजेता: Gemini 3.1 81.6% के साथ दूसरे स्थान पर रहा।
  • अंतराल: शीर्ष दो के बाद स्कोर में भारी गिरावट आई। निचले तीसरे हिस्से के सिस्टमों का स्कोर 72% से नीचे था, जिसका अर्थ है कि वे काफी संघर्ष कर रहे थे।
  • सबसे कठिन चुनौती: गैर-लैटिन लिपियाँ (जैसे अरबी, कोरियाई और चीनी) सभी के लिए सबसे कठिन थीं।
    • उपमा: इसे एक ऐसे धावक के रूप में सोचें जो एक सपाट, पक्की सड़क (अंग्रेजी) पर बहुत अच्छा है लेकिन एक पहाड़ी रास्ते (अरबी/कोरियाई) पर हर पत्थर से टकराकर गिर जाता है। सबसे अच्छे सिस्टमों ने भी भाषा बदलने पर अपने स्कोर में महत्वपूर्ण गिरावट देखी।
  • "साइलेंट फेलियर्स" (मौन विफलताएं): कुछ सिस्टमों ने केवल गलत उत्तर ही नहीं दिए; बल्कि लगभग 20% टेबल्स के लिए उन्होंने कोई उत्तर ही नहीं दिया। वास्तविक व्यवसाय में, यह एक ऐसे रोबोट की तरह है जो कठिन दस्तावेज़ देखते ही काम करना बंद कर देता है।

5. निष्कर्ष (Takeaway)

पेपर यह निष्कर्ष निकालता है कि हालांकि कंप्यूटर टेबल्स को पढ़ने में बेहतर हो रहे हैं, लेकिन सबसे अच्छे सिस्टम और बाकी क्षेत्र के बीच एक बड़ा अंतर है, खासकर जटिल लेआउट या गैर-अंग्रेजी भाषाओं के मामले में।

उन्होंने डेटासेट, स्कोरिंग कोड और परिणामों को सार्वजनिक रूप से जारी कर दिया है। यह जिम के दरवाजे सभी के लिए खोलने जैसा है, ताकि शोधकर्ता देख सकें कि मशीनें वास्तव में कहाँ विफल हो रही हैं और अनुमान लगाने के बजाय उन्हें ठीक करने का प्रयास कर सकें।

संक्षेप में: उन्होंने टेबल-रीडिंग AI के लिए एक कठिन, बहुभाषी बाधा दौड़ (obstacle course) बनाई, AI ने इस बाधा दौड़ को कितनी अच्छी तरह पार किया, इसे मापने के लिए एक नया रूलर बनाया, और पाया कि हालांकि एक सिस्टम वर्तमान में सबसे आगे है, लेकिन अधिकांश अन्य अभी भी जटिल, गैर-अंग्रेजी परिवेश में अपना संतुलन बनाए रखने के लिए संघर्ष कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →