← नवीनतम पेपर
💻 computer science

InstructTable: Improving Table Structure Recognition Through Instructions

यह शोध पत्र InstructTable को प्रस्तुत करता है, जो एक नवीन टेम्पलेट-मुक्त डेटा संश्लेषण पद्धति (TME) द्वारा संवर्धित एक निर्देश-निर्देशित बहु-चरणीय प्रशिक्षण ढांचा है, जो सूक्ष्म संरचनात्मक पैटर्न समझ को मजबूत दृश्य सूचना मॉडलिंग के साथ प्रभावी ढंग से जोड़कर अत्याधुनिक तालिका संरचना पहचान प्रदर्शन प्राप्त करता है।

मूल लेखक: Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बिखरे हुए, हाथ से लिखे गए स्प्रेडशीट को पढ़ना सिखाने की कोशिश कर रहे हैं। कुछ सेल खाली हैं, कुछ बहुत बड़े ब्लॉक हैं जो कई कॉलमों में फैले हुए हैं, और कुछ रेखाएं धुंधली हैं। यह टेबल स्ट्रक्चर रिकग्निशन (TSR) की चुनौती है।

लंबे समय तक, रोबोटों ने इसे दो तरीकों से हल करने की कोशिश की, लेकिन दोनों में खामियां थीं:

  1. "ईगल आई" दृष्टिकोण (विजुअल-सेंट्रिक): ये रोबोट केवल तस्वीर को देखते थे। वे रेखाओं और बक्सों को देखने में माहिर थे, लेकिन यदि कोई सेल खाली होता या अजीब तरह से मर्ज (merged) होता, तो वे भ्रमित हो जाते थे क्योंकि वे टेबल के तर्क (logic) को नहीं समझते थे।
  2. "बुकवॉर्म" दृष्टिकोण (विज़न-लैंग्वेज मॉडल्स): ये रोबोट टेक्स्ट को पढ़ते थे और संदर्भ को अच्छी तरह समझते थे, लेकिन वे अक्सर इस बारीक विवरण को भूल जाते थे कि बॉक्स वास्तव में कहाँ थे। वे यह तो जान सकते थे कि टेबल "फाइनेंस" के बारे में है, लेकिन वे ग्रिड लाइनों को गलत जगहों पर खींच देते थे।

यह पेपर InstructTable नामक एक नई प्रणाली पेश करता है, जो एक सुपर-इंटेलिजेंट आर्किटेक्ट की तरह काम करती है जो ब्लूप्रिंट को देख भी सकता है और निर्देशों को समझ भी सकता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "इंस्ट्रक्शन मैनुअल" (निर्देश-निर्देशित प्रशिक्षण)

कल्पना कीजिए कि आप एक बच्चे को घर बनाना सिखा रहे हैं।

  • पुराना तरीका: आप बस उन्हें एक तस्वीर दिखाते हैं और कहते हैं, "इसे बनाओ।" वे शायद चिमनी या दरवाजा बनाना भूल जाएं।
  • InstructTable का तरीका: आप उन्हें विशिष्ट कमांड देते हैं जैसे, "पहले, छत बनाओ," फिर "अब, दूसरी पंक्ति में खिड़कियां बनाओ," और अंत में, "गैरेज में खाली जगह को मत भूलना।"

शोधकर्ताओं ने उनके AI को इन विशिष्ट निर्देशों को सुनना सिखाया।

  • यदि आप कहते हैं, "सभी खाली सेल्स को खोजें," तो AI अपना ध्यान खाली स्थानों पर केंद्रित करता है।
  • यदि आप कहते हैं, "मर्ज किए गए सेल्स को खोजें," तो वह बड़े ब्लॉक्स को देखता है।
  • जादू: AI को यह सिखाकर कि वह आपके पूछने के आधार पर अपना ध्यान बदले, यह पहले की तुलना में टेबल की संरचना (structure) को बहुत बेहतर तरीके से समझना सीख जाता है। यह एक रोबोट को टॉर्च देने जैसा है जिसका रंग इस आधार पर बदल जाता है कि आप उससे क्या ढूंढना चाहते हैं।

2. "लेगो बिल्डर" (टेबल मिक्स एक्सपैंड - TME)

AI को सिखाने के लिए, आपको हजारों अभ्यास टेबल्स की आवश्यकता होती है। लेकिन वास्तविक टेबल्स ढूंढना और उन्हें लेबल करना कठिन है।

  • समस्या: पिछले तरीकों ने कठोर टेम्पलेट्स (जैसे कि "मैड लिब्स" गेम) का उपयोग करके नकली टेबल्स बनाने की कोशिश की। इसके परिणामस्वरूप ऐसे टेबल्स बने जो नकली दिखते थे या जिनमें छिपी हुई त्रुटियां (जैसे कि ऐसी अदृश्य पंक्तियाँ जो वहां नहीं होनी चाहिए थीं) थीं।
  • समाधान (TME): लेखकों ने Table Mix Expand नामक एक नया डेटा बनाने का तरीका आविष्कार किया।
    • कल्पना कीजिए कि आप वास्तविक, प्रामाणिक टेबल्स को लेते हैं और उन्हें उनके सबसे छोटे निर्माण खंडों (एटॉमिक सेल्स) में तोड़ देते हैं।
    • फिर, एक "डिजिटल मिक्सर" का उपयोग करके, वे इन ब्लॉक्स को बेतरतीब ढंग से एक साथ जोड़कर बिल्कुल नए, अद्वितीय टेबल्स बनाते हैं।
    • अंत में, वे एक स्मार्ट AI (जैसे कि लैंग्वेज मॉडल) का उपयोग करते हैं ताकि नया टेक्स्ट कंटेंट सार्थक बनाया जा सके।
    • परिणाम: उन्होंने अभ्यास के लिए नए और अद्वितीय टेबल्स बनाने के लिए एक विशाल, विविध लाइब्रेरी बनाई जो असली दिखती है और महसूस होती है, बिना पुराने टेम्पलेट तरीकों वाली "ग्लिच" के। यह हजारों असली घरों को ईंटों में तोड़ने और फिर एक रोबोट को लाखों नए, अनूठे घर बनाने के लिए छोड़ने जैसा है ताकि वह अभ्यास कर सके।

3. "ट्रेनिंग कैंप" (बहु-चरणीय शिक्षण)

AI सब कुछ एक साथ नहीं सीखता है। यह तीन चरणों से गुजरता है, जैसे एक छात्र स्कूल में जाता है:

  1. किंडरगार्टन: यह सरल टेबल्स को देखकर बुनियादी बातें सीखता है कि "एक सेल क्या है?"
  2. हाई स्कूल: इसे "इंस्ट्रक्शन मैनुअल" प्रशिक्षण मिलता है। यह जटिल लेआउट को समझने के लिए विशिष्ट कमांड (जैसे, "मर्ज किए गए सेल्स को खोजें") को सुनना सीखता है।
  3. यूनिवर्सिटी: यह अपने कौशल को निखारने के लिए वास्तविक दुनिया के डेटा पर एक अंतिम, विशेष परीक्षा देता है।

4. "नया एग्जाम" (BCDSTab बेंचमार्क)

शोधकर्ताओं ने महसूस किया कि मौजूदा टेस्ट बहुत आसान थे—वे ज्यादातर छोटे, सरल टेबल्स पर आधारित थे। वास्तविक जीवन में विशाल, जटिल स्प्रेडशीट्स होती हैं।
इसलिए, उन्होंने BCDSTab नामक एक नया, कठिन एग्जाम बनाया। इसमें उनके "लेगो बिल्डर" पद्धति से उत्पन्न 900 जटिल, घने टेबल्स शामिल हैं। इसे एक स्ट्रेस टेस्ट के रूप में बनाया गया है ताकि यह देखा जा सके कि क्या कोई AI उन मेसी, वास्तविक दुनिया के टेबल्स को संभाल सकता है जो आमतौर पर अन्य सिस्टम को विफल कर देते हैं।

निचोड़

InstructTable एक बड़ी सफलता है क्योंकि यह अनुमान लगाना बंद कर देता है। केवल "देखने" या केवल "पढ़ने" के बजाय, यह यह जानने के लिए कि क्या देखना है, निर्देशों को सुनता है, और यह खुद द्वारा बनाए गए विशाल, यथार्थवादी डेटा पर अभ्यास करता है।

परिणाम:

  • यह टेबल्स को पढ़ने में पिछले सभी रोबोट्स को पछाड़ देता है।
  • यह मेसी, मर्ज किए गए और खाली सेल्स को आसानी से संभाल लेता है।
  • यह स्ट्रक्चर्ड डेटा को समझने के लिए एक नया मानक स्थापित करता है, जिससे पेपर रिपोर्ट्स या PDFs को उपयोगी डिजिटल डेटा में बदलना बहुत आसान हो जाता है।

संक्षेप में: उन्होंने रोबोट को न केवल टेबल को देखना, बल्कि इसे पढ़ने के निर्देशों को समझना सिखाया, और उसे अभ्यास करने के लिए एक विशाल, यथार्थवादी खेल का मैदान दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →