← नवीनतम पेपर
💻 computer science

PubTables-v2: A new large-scale dataset for full-page and multi-page table extraction

यह शोध पत्र PubTables-v2 को प्रस्तुत करता है, जो एक नया बड़े पैमाने का डेटासेट है जिसे एनोटेटेड डेटा की कमी को दूर करने और विजन-लैंग्वेज मॉडल्स के लिए बेसलाइन प्रदर्शन स्थापित करके फुल-पेज और मल्टी-पेज टेबल निष्कर्षण (extraction) को उन्नत करने के लिए डिज़ाइन किया गया है, विशेष रूप से मल्टी-पेज टेबल संरचना पहचान की चुनौती पर प्रकाश डालते हुए।

मूल लेखक: Brandon Smock, Valerie Faucon-Morin, Max Sokolov, Libin Liang, Tayyibah Khanam, Amrit Ramesh, Maury Courtland

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Brandon Smock, Valerie Faucon-Morin, Max Sokolov, Libin Liang, Tayyibah Khanam, Amrit Ramesh, Maury Courtland

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप वैज्ञानिक शोध पत्रों के एक विशाल पुस्तकालय को डिजिटल बनाने की कोशिश कर रहे हैं। आप इन शोध पत्रों में मौजूद बिखरे हुए, छपे हुए तालिकाओं (tables) को साफ और संपादन योग्य स्प्रेडशीट में बदलना चाहते हैं जिन्हें कंप्यूटर समझ सके। यह टेबल एक्सट्रैक्शन (Table Extraction) का काम है।

लंबे समय तक, कंप्यूटर अनाड़ी पुस्तकालयाध्यक्षों की तरह थे। वे एक पेज को देखते, उसमें से एक तालिका ढूंढते, उसे कैंची से काट लेते (क्रॉपिंग), और फिर उसके पंक्तियों (rows) और कॉलम (columns) को समझने की कोशिश करते। लेकिन इस दृष्टिकोण के दो बड़े मुद्दे थे:

  1. यह संदर्भ (context) खो देता था: तालिका को काटकर अलग करने से, कंप्यूटर भूल जाता था कि वह कहाँ से आई थी। क्या नीचे दिया गया "Total" पूरे पेज का फुटर था, या सिर्फ उस तालिका का अंत था?
  2. यह लंबी कहानियों को नहीं संभाल पाता था: कुछ तालिकाएँ इतनी विशाल होती हैं कि वे अगले पेज पर, या यहाँ तक कि अगले दस पेजों तक फैल जाती हैं। पुराना "कट-एंड-पेस्ट" तरीका भ्रमित हो जाता था और हार मान लेता था।

यहाँ PubTables-v2 आता है, जो शोधकर्ताओं द्वारा बनाया गया एक नया "सुपर-लाइब्रेरी" है ताकि कंप्यूटर को यह काम बेहतर तरीके से करना सिखाया जा सके।

यहाँ उन्होंने जो किया है, उसका विवरण दिया गया है (रोजमर्रा के उदाहरणों का उपयोग करते हुए):

1. नया "पाठ्यपुस्तक" (The Dataset)

पिछले डेटासेट्स को एकल, अलग-थलग फ्लैशकार्ड्स के संग्रह की तरह समझें। आप कंप्यूटर को एक कार्ड दिखाते जिसमें एक तालिका होती, और उसे उसकी संरचना का अनुमान लगाना पड़ता।

PubTables-v2 कंप्यूटर को एक पूरी पाठ्यपुस्तक थमाने जैसा है।

  • "पूरा पेज" वाला दृश्य (The "Full Page" View): केवल तालिका दिखाने के बजाय, वे पूरा पेज दिखाते हैं, जिसमें शीर्षक, फुटनोट और आसपास का टेक्स्ट भी शामिल होता है। इससे कंप्यूटर को संदर्भ समझने में मदद मिलती है।
  • "बहु-पेज" चुनौती (The "Multi-Page" Challenge): यही सबसे बड़ा नवाचार है। उन्होंने 9,492 ऐसी तालिकाएँ शामिल कीं जो कई पेजों में फैली हुई हैं। कल्पना कीजिए कि एक तालिका पेज 1 पर शुरू होती है, पेज 2 पर जारी रहती है, और पेज 5 पर समाप्त होती है। पिछले कंप्यूटरों को इन्हें आपस में जोड़ने का तरीका नहीं पता था। PubTables-v2 पहली विशाल डेटासेट है जो उन्हें यह कौशल सिखाती है।
  • "हार्ड मोड" वाली तालिकाएँ (The "Hard Mode" Tables): उन्होंने विशेष रूप से उन तालिकाओं को शामिल किया जो अविश्वसनीय रूप से लंबी (30+ पंक्तियाँ) या अविश्वसनीय रूप से चौड़ी (12+ कॉलम) हैं, जो वे प्रकार के टेबल हैं जो पुराने सॉफ़्टवेयर को अक्सर खराब कर देते हैं।

2. "छात्र" (The Models)

शोधकर्ताओं ने यह देखने के लिए कई "छात्रों" (AI मॉडल्स) का परीक्षण किया कि वे इस नई पाठ्यपुस्तक को कितनी अच्छी तरह पढ़ सकते हैं।

  • विशेषज्ञ छात्र (VLMs): ये विजन-लैंग्वेज मॉडल्स (Vision-Language Models) हैं। इन्हें ऐसे स्मार्ट छात्रों के रूप में सोचें जो टेक्स्ट पढ़ सकते हैं और साथ ही चित्रों को भी देख सकते हैं।
  • परिणाम: जब केवल एक कटी हुई (cropped) तालिका पढ़ने के लिए कहा गया, तो इन छात्रों ने ठीक-ठाक प्रदर्शन किया। लेकिन जब उन्हें एक पूरा पेज या बहु-पेज वाला दस्तावेज़ पढ़ने के लिए कहा गया, तो वे संघर्ष करने लगे। वे अक्सर तालिकाओं को मिस कर देते थे, लेआउट में भ्रमित हो जाते थे, या यह नहीं बता पाते थे कि एक तालिका कहाँ समाप्त हुई और दूसरी कहाँ शुरू हुई।

3. "गोंद" वाला नुस्खा (The "Glue" Trick - Cross-Page Merging)

एक सबसे बड़ी कमी यह पाई गई कि कंप्यूटर यह समझने में बहुत खराब हैं कि, "अरे, पेज 1 पर यह तालिका पेज 2 पर जारी रहने वाली वही तालिका है।" वे उन्हें दो अलग, असंबंधित चीजों के रूप में देखते हैं।

शोधकर्ताओं ने एक चतुर वर्कअराउंड विकसित किया, जैसे कि एक विशेष गोंद वाली गन (specialized glue gun):

  • उन्होंने एक साधारण "जासूस" (एक इमेज क्लासिफायर) को प्रशिक्षित किया जो दो पेजों को अगल-बगल से देखता है।
  • जासूस का एकमात्र काम यह पूछना है: "क्या पेज 1 के नीचे वाली तालिका पेज 2 पर जारी है?"
  • यदि जासूस कहता है "हाँ," तो सिस्टम "गोंद" का उपयोग करके दो तालिका आउटपुट को एक विशाल तालिका में भौतिक रूप से जोड़ देता है।
  • परिणाम: इस सरल ट्रिक ने लंबी, बहु-पेज वाली दस्तावेज़ों को संभालने की कंप्यूटर की क्षमता में नाटकीय रूप से सुधार किया। इसने एक असफल ग्रेड को पासिंग ग्रेड में बदल दिया।

4. यह क्यों मायने रखता है

PubTables-v2 को टेबल एक्सट्रैक्शन के लिए "ओलंपिक्स" के रूप में देखें।

  • पहले: हम केवल छोटे, शांत पूल (क्रॉप्ड टेबल्स) में तैराकों का परीक्षण कर रहे थे।
  • अब: हम उन्हें खुले समुद्र में लहरों और धाराओं के बीच टेस्ट कर रहे हैं (फुल पेज और मल्टी-पेज दस्तावेज़)।

यह पेपर दिखाता है कि जबकि हमारा वर्तमान AI टेक्स्ट पढ़ने में बेहतर हो रहा है, यह अभी भी वास्तविक दुनिया के दस्तावेजों के जटिल लेआउट के साथ संघर्ष करता है। इस विशाल नए डेटासेट को प्रदान करके और यह दिखाकर कि एक सरल "गोंद" वाला चरण मल्टी-पेज समस्याओं को ठीक कर सकता है, शोधकर्ताओं ने AI समुदाय को यह बताने के लिए एक स्पष्ट रोडमैप दिया है कि अगले पीढ़ी के डॉक्यूमेंट रीडर कैसे बनाए जाएं।

संक्षेप में: उन्होंने AI के लिए एक कठिन, अधिक वास्तविक प्रशिक्षण मैदान बनाया, यह खोजा कि वर्तमान AI पेजों के बीच के संबंधों को जोड़ने में बुरा है, और इसे करने में मदद करने के लिए एक सरल ट्रिक भी ढूंढी। अब, डेटा और कोड सभी के उपयोग और सुधार के लिए खुले हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →