← नवीनतम पेपर
🤖 AI

ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition

ConRTF एक वास्तविक समय की तालिका संरचना पहचान विधि है जो प्रशिक्षण के दौरान पंक्तियों और स्तंभों के बीच संरचनात्मक विषमता को एनकोड करने के लिए एक एज-कन्स्ट्रेंड फाइन-ग्रेन्ड लोकलाइजेशन (EFL) लॉस पेश करती है, जिससे इन्फरेंस पाइपलाइन को बदले बिना सार्वजनिक और निजी दोनों डेटासेट पर सीमा वितरण को परिष्कृत किया जाता है और सटीकता में सुधार किया जाता है।

मूल लेखक: Eliott Thomas, Tri-Cong Pham, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier, Antoine Doucet

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eliott Thomas, Tri-Cong Pham, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier, Antoine Doucet

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को एक बिखरे हुए स्प्रेडशीट या वित्तीय रिपोर्ट को पढ़ना सिखा रहे हैं। कंप्यूटर को यह समझना होगा कि पंक्तियाँ (rows) कहाँ समाप्त होती हैं, कॉलम कहाँ से शुरू होते हैं, और डेटा कैसे व्यवस्थित है। इसे टेबल स्ट्रक्चर रिकग्निशन (TSR) कहा जाता है।

एक टेबल को लेगो ब्रिक्स (Lego bricks) के ग्रिड की तरह समझें। यदि आप ईंटों की एक दीवार बनाते हैं, तो सबसे महत्वपूर्ण रेखाएँ वे क्षैतिज (horizontal) रेखाएँ हैं जो एक पंक्ति की ईंटों को दूसरी पंक्ति से अलग करती हैं। यदि वे रेखाएँ टेढ़ी-मेढ़ी हों, तो पूरी दीवार गलत दिखने लगती है। इसी तरह, एक टेबल में, क्षैतिज रेखाएँ पंक्तियों को परिभाषित करती हैं, और ऊर्ध्वाधर (vertical) रेखाएँ कॉलम को परिभाषित करती हैं।

समस्या: "एक ही नियम सबके लिए" काम नहीं करता

वर्तमान AI उपकरण जो टेबल्स को पढ़ते हैं, अक्सर पेज पर मौजूद हर रेखा के साथ एक जैसा व्यवहार करते हैं। वे एक क्षैिज रेखा और एक ऊर्ध्वाधर रेखा को देखते हैं और कहते हैं, "ठीक है, दोनों ही किनारे हैं; चलिए दोनों को समान रूप से खोजने की कोशिश करते हैं।"

इस शोध पत्र के लेखक तर्क देते हैं कि यह एक लंबी, पतली बाड़ (fence) पर पेंट करने के लिए ऊपर और नीचे के हिस्से पर उतना ही पेंट लगाने जैसा है जितना कि किनारों पर। यह अक्षम है।

  • एक पंक्ति (Row) के लिए: ऊपर और नीचे के किनारे "बॉस" हैं। वे पंक्ति को परिभाषित करते हैं। बाएँ और दाएँ किनारे केवल "बाड़ के खंभे" (fence posts) हैं जो अंत को चिह्नित करते हैं।
  • एक कॉलम (Column) के लिए: बाएँ और दाएँ किनारे "बॉस" हैं। ऊपर और नीचे के किनारे केवल बाड़ के खंभे हैं।

यदि AI "बॉस" किनारों को थोड़ा भी गलत कर देता है, तो पूरी टेबल की संरचना बिगड़ जाती है। लेकिन यदि वह "बाड़ के खंभों" वाले किनारों को थोड़ा गलत कर देता है, तो भी टेबल काफी हद तक ठीक दिखती है।

समाधान: ConRTF (द "स्मार्ट पेंटर")

यह शोध पत्र एक नई विधि पेश करता है जिसे ConRTF कहा जाता है। इसे एक स्मार्ट पेंटर की तरह समझें जिसे ठीक से पता है कि बाड़ के किन हिस्सों पर सबसे अधिक ध्यान देने की आवश्यकता है।

  1. विशेष पेंट (EFL Loss): इसकी मुख्य नवीनता एक नया नियम है जिसे एज-कंस्ट्रेंड फाइन-ग्रेन्ड लोकलाइजेशन (EFL) कहा जाता है।

    • जब AI एक पंक्ति (row) बनाने सीख रहा होता है, तो EFL नियम कहता है: "हे, ऊपर और नीचे की रेखाओं पर अतिरिक्त ध्यान दो! उन्हें एकदम सटीक बनाओ। बगल की रेखाओं को थोड़ा ढीला छोड़ा जा सकता है।"
    • जब AI एक कॉलम (column) बनाना सीख रहा होता है, तो नियम बदल जाता है: "बाएँ और दाएँ रेखाओं पर कड़ी एकाग्रता रखें! ऊपर और नीचे के हिस्से थोड़े लचीले हो सकते हैं।"
  2. केवल प्रशिक्षण के दौरान (Training Only): यह विशेष नियम केवल तभी लागू होता है जब AI पढ़ाई (training) कर रहा होता है। एक बार जब AI सीखना समाप्त कर लेता है और काम करने के लिए तैयार होता है (inference), तो उसे इन अतिरिक्त नियमों का पालन करने की आवश्यकता नहीं होती है। यह पहले की तरह ही तेज़ काम करता है। यह एक छात्र की तरह है जो परीक्षा के लिए अध्ययन करते समय विशेष हाइलाइटर का उपयोग करता है; परीक्षा शुरू होने पर वह सामान्य रूप से लिखता है, लेकिन उसने महत्वपूर्ण हिस्सों को बेहतर ढंग से याद रखा है।

  3. डेटा दक्षता (Data Efficiency): लेखकों ने पाया कि यह तरीका AI को यह सिखाने में इतना प्रभावी है कि उसे सीखने के लिए विशाल लाइब्रेरी की आवश्यकता नहीं है। यह अपेक्षाकृत कम उदाहरणों (लगभग 2,000 से 3,000) के साथ भी बहुत अच्छी तरह से टेबल पढ़ना सीख सकता है, जबकि अन्य तरीकों को समान परिणाम प्राप्त करने के लिए बहुत अधिक डेटा की आवश्यकता हो सकती है।

परिणाम: तेज़ और अधिक सटीक

टीम ने अपने "स्मार्ट पेंटर" (ConRTF) का परीक्षण वास्तविक दुनिया की टेबल्स (जैसे वैज्ञानिक पेपर और व्यावसायिक दस्तावेज़) के विशाल डेटासेट पर अन्य शीर्ष-स्तरीय AI मॉडलों के विरुद्ध किया।

  • बेहतर सटीकता: ConRTF ने टेबल की रेखाओं को खींचने में कम गलतियाँ कीं। इसने मौजूदा रियल-टाइम मॉडलों की तुलना में "GriTS" स्कोर (एक माप कि टेबल की संरचना को कितनी अच्छी तरह समझा गया है) में 1.6 अंक तक सुधार किया।
  • गति: क्योंकि विशेष नियम केवल प्रशिक्षण के दौरान होते हैं, इसलिए AI वास्तव में दस्तावेज़ पढ़ते समय उतना ही तेज़ चलता है जितना कि मानक मॉडल। इसने प्रक्रिया को धीमा नहीं किया।
  • कठिन कार्यों को संभालना: सबसे बड़े सुधार उन "बिखरी हुई" टेबल्स पर देखे गए जहाँ अन्य AI मॉडल संघर्ष करते थे। ConRTF उन जटिल लेआउट्स को सुलझाने में बेहतर था जहाँ पंक्तियाँ और कॉलम एक-दूसरे के ऊपर आते हैं या जिन्हें अलग करना कठिन होता है।

संक्षेप में

यह शोध पत्र AI को टेबल पढ़ना सिखाने का एक तरीका प्रस्तुत करता है, जो उसे यह सिखाता है कि सभी रेखाएँ समान नहीं होतीं। AI को यह बताकर कि उसे अपनी ऊर्जा उन विशिष्ट रेखाओं पर केंद्रित करनी चाहिए जो एक पंक्ति या कॉलम के आकार को परिभाषित करती हैं, यह तेजी से सीखता है, इसे कम डेटा की आवश्यकता होती है, और यह प्रक्रिया को धीमा किए बिना बहुत स्वच्छ और अधिक सटीक टेबल संरचनाएं बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →