← नवीनतम पेपर
💬 NLP

TABLET: A Large-Scale Dataset for Robust Visual Table Understanding

यह शोध पत्र TABLET को प्रस्तुत करता है, जो 2 मिलियन अद्वितीय वास्तविक दुनिया की तालिकाओं (tables) पर आधारित 4 मिलियन उदाहरणों का एक बड़े पैमाने का डेटासेट है जिसमें विज़ुअलाइज़ेशन को सुरक्षित रखा गया है, जो विज़ुअल टेबल अंडरस्टैंडिंग कार्यों पर विज़न-लैंग्वेज मॉडल्स की मजबूती और प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Iñigo Alonso, Imanol Miranda, Eneko Agirre, Mirella Lapata

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Iñigo Alonso, Imanol Miranda, Eneko Agirre, Mirella Lapata

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अखबार पढ़ना सिखाने की कोशिश कर रहे हैं।

लंबे समय तक, शोधकर्ताओं ने रोबोट को टेबल (जैसे स्प्रेडशीट या स्पोर्ट्स स्टैट्स) पढ़ने के लिए उनका टेक्स्ट (text) वाला संस्करण दिया। यह एक रोबोट को संख्याओं और शब्दों की सूची देने जैसा है और यह कहना कि, "यह रहा डेटा।" रोबोट तर्क को समझना सीख जाता है, लेकिन वह वास्तव में टेबल को देखता नहीं है।

लेकिन वास्तविक दुनिया में, टेबल्स केवल शब्दों की सूचियाँ नहीं होतीं। वे विजुअल ऑब्जेक्ट्स (visual objects) होते हैं। उनमें रंग, मर्ज किए गए सेल्स (merged cells), अजीब फोंट, और टेबल्स के अंदर तस्वीरें होती हैं, और उनकी लाइनें हमेशा एकदम सीधी नहीं होतीं। यदि आप रोबोट को केवल टेक्स्ट पढ़ना सिखाते हैं, तो जब वह स्क्रीन पर एक असली टेबल देखता है, तो वह भ्रमित हो जाता है। यह किसी को केवल एक मैप का उपयोग करके गाड़ी चलाना सिखाने जैसा है, और फिर उससे शहर में ट्रैफिक लाइट, गड्ढों और निर्माण कार्यों के बीच गाड़ी चलाने के लिए कहने जैसा। वे सिद्धांत जानते हैं, लेकिन व्यवहार में वे दुर्घटनाग्रस्त हो जाते हैं।

यह पेपर TABLET पेश करता है, जो AI के लिए एक नया विशाल "ड्राइविंग स्कूल" है, जिसे इस समस्या को ठीक करने के लिए डिज़ाइन किया गया है।

समस्या: "सिंथेटिक" जाल (The "Synthetic" Trap)

पिछले डेटासेट्स प्लास्टिक की मॉडल कारों की तरह थे। वे कारों की तरह दिखते थे, लेकिन वे चिकने, एकदम परफेक्ट प्लास्टिक से बनी थीं। उनमें असली टायर, जंग या डेंट नहीं थे।

  • समस्या: अधिकांश AI मॉडल इन "प्लास्टिक" टेबल्स (कोड से जेनरेट की गई सिंथेटिक इमेज) पर प्रशिक्षित थे (synthetic images generated from code)। जब इन मॉडल्स ने एक "असली" टेबल (जैसे कोई जटिल PDF या वेबसाइट का स्क्रीनशॉट) को पढ़ने की कोशिश की, तो वे विफल हो गए क्योंकि असली टेबल्स में वे "डेंट" और "जंग" (जटिल फॉर्मेटिंग) थे जिन्हें उन्होंने पहले कभी नहीं देखा था।

समाधान: "वास्तविक दुनिया" का डेटासेट (The "Real World" Dataset)

लेखकों ने TABLET बनाया है, जो वास्तविक दुनिया के टेबल्स के एक विशाल कबाड़खाने (junkyard) की तरह है।

  • पैमाना (Scale): इसमें 2 मिलियन अद्वितीय टेबल्स पर आधारित 4 मिलियन उदाहरण शामिल हैं।
  • सीक्रेट सॉस (Secret Sauce): इनमें से 88% टेबल्स इंटरनेट से सीधे लिए गए ओरिजिनल स्क्रीनशॉट्स हैं (मुख्य रूप से विकिपीडिया से)। ये "लॉसलेस" (lossless) हैं, जिसका अर्थ है कि वे अपने मूल रंगों, फोंट और अस्त-व्यस्त लेआउट को बनाए रखते हैं।
  • विविधता (Variety): यह 21 अलग-अलग कार्यों को कवर करता है, जैसे प्रश्न पूछना ("राष्ट्रपति की आयु क्या है?"), टेक्स्ट जेनरेट करना ("इस टेबल के आधार पर जीवनी लिखें"), से लेकर गलतियों को पकड़ना।

TABLET को ऐसे समझने की कल्पना करें जैसे आपने एक ऐसे छात्र को लिया हो जिसने केवल एक शांत लाइब्रेरी में पढ़ाई की है और फिर उसे यह सीखने के लिए एक व्यस्त, अराजक बाजार में फेंक दिया है कि कैसे नेविगेट किया जाए।

नया टेस्ट: "VisualTableQA"

यह साबित करने के लिए कि उनका नया प्रशिक्षण तरीका काम करता है, लेखकों ने VisualTableQA नामक एक विशेष परीक्षण बनाया है।

  • उपमा (Analogy): एक ऐसी टेबल की कल्पना करें जहाँ उत्तर केवल संख्याओं में नहीं, बल्कि टेक्स्ट के रंग में है।
    • प्रश्न: "कौन सी कार लाल है?"
    • पुराना AI: "मैं बता नहीं सकता, टेक्स्ट बस कहता है 'कार मॉडल X'।"
    • नया AI (TABLET पर प्रशिक्षित): "आह, मैं देख सकता हूँ कि 'कार मॉडल X' शब्द लाल स्याही में लिखा है, इसलिए यही उत्तर है!"
  • यह टेस्ट AI को टेक्स्ट पढ़ने और साथ ही चित्र को देखने के लिए मजबूर करता है, ठीक वैसे ही जैसे एक इंसान करता है।

परिणाम: सुपरचार्ज्ड रोबोट्स (Supercharged Robots)

शोधकर्ताओं ने शक्तिशाली AI मॉडल्स (जैसे Qwen और Gemma) को लेकर TABLET का उपयोग करके उन्हें "फाइन-ट्यून" (fine-tuned) किया।

  • पहले: मॉडल एक मैप के साथ पर्यटकों की तरह थे; वे वास्तविक दुनिया में खो जाते थे।
  • बाद में: मॉडल स्थानीय टैक्सी ड्राइवरों की तरह बन गए। उन्होंने अस्त-व्यस्त, वास्तविक दुनिया के टेबल्स को आसानी से संभाला।
  • परिणाम: ये मॉडल्स न केवल उन विशिष्ट कार्यों में बेहतर हुए जिनके लिए उन्हें प्रशिक्षित किया गया था; वे हर चीज़ में बेहतर हो गए। वे अधिक मजबूत (robust) हो गए, जिसका अर्थ है कि वे अजीब फॉर्मेटिंग से भ्रमित नहीं हुए, और वे उन नए प्रकार के विजुअल पहेलियों को हल कर सके जिन्हें उन्होंने पहले कभी नहीं देखा था।

यह क्यों महत्वपूर्ण है?

यह एक बड़ी बात है क्योंकि AI का भविष्य एजेंट्स (agents) से जुड़ा है जो स्क्रीन के माध्यम से दुनिया के साथ इंटरैक्ट करते हैं। यदि कोई AI एजेंट फ्लाइट बुक करने, बैंक स्टेटमेंट चेक करने या मेडिकल रिपोर्ट का विश्लेषण करने जा रहा है, तो उसे स्क्रीन पर दिखने वाले विजुअल टेबल को पढ़ने की आवश्यकता है, न कि उसके पीछे छिपे कोड को।

संक्षेप में: लेखकों ने AI को "प्लास्टिक" टेबल्स पढ़ना सिखाना बंद कर दिया और उसे "असली" टेबल्स पढ़ना सिखाना शुरू किया। परिणाम एक ऐसा AI है जो बहुत अधिक स्मार्ट, अनुकूलन योग्य (adaptable) है, और इंटरनेट की अस्त-व्यस्त, रंगीन वास्तविकता के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →