← नवीनतम पेपर
💻 computer science

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

यह शोध पत्र TRivia को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित फाइन-ट्यूनिंग विधि है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन और अटेंशन-गाइडेड क्वेश्चन आंसरिंग का लाभ उठाकर विजन-लैंग्वेज मॉडल्स को अनलेबल डेटा से सीधे टेबल रिकग्निशन सीखने में सक्षम बनाती है, जिसके परिणामस्वरूप ओपन-सोर्स TRivia-3B मॉडल प्राप्त होता है जो प्रमुख बेंचमार्क पर मौजूदा प्रोप्राइटरी सिस्टम्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

प्रकाशित 2026-03-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "TRivia: Table Recognition के लिए Vision-Language Models का Self-supervised Fine-tuning" का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी तस्वीर: द "टेबल ट्रांसलेटर" समस्या

कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल पुस्तकालय है, लेकिन सबसे महत्वपूर्ण जानकारी टेबल्स (tables) के अंदर फंसी हुई है। कुछ टेबल्स साफ सुथरे ग्रिड की तरह हैं; अन्य बिखरे हुए हैं, जिनमें मर्ज किए गए सेल्स (merged cells), गायब बॉर्डर और हाथ से लिखे नोट्स हैं।

आपका लक्ष्य इन टेबल्स की धुंधली तस्वीरों को साफ, डिजिटल कोड (जैसे HTML या Markdown) में बदलना है जिसे कंप्यूटर पढ़ सके और उपयोग कर सके। इसे टेबल रिकग्निशन (TR) कहा जाता है।

समस्या:
अब तक, कंप्यूटर को यह सिखाना एक बच्चे को फ्लैशकार्ड दिखाकर पढ़ाने जैसा था जिसके पीछे उत्तर लिखे होते हैं। आपको इंसानों की ज़रूरत थी जो हज़ारों टेबल्स को देखें, रेखाएँ खींचें और उत्तर टाइप करें। यह महंगा, धीमा और निजी दस्तावेजों (जैसे बैंक रिकॉर्ड या मेडिकल फाइलें) के लिए कठिन है जहाँ आप उन्हें क्लाउड सर्वर पर अपलोड नहीं कर सकते।

बड़ी टेक कंपनियाँ (जैसे Google या OpenAI) ने इसे भारी मात्रा में मानव श्रम और सुपर-कंप्यूटर का उपयोग करके हल किया है। लेकिन बाकी सभी के लिए, सबसे अच्छे ओपन-सोर्स मॉडल अभी भी संघर्ष कर रहे हैं।

समाधान: TRivia
लेखकों ने TRivia नामक एक नई विधि बनाई है। TRivia को सिखाने के लिए इंसानों द्वारा उत्तर लिखने की आवश्यकता नहीं है; TRivia कंप्यूटर को "प्रश्न और उत्तर" का खेल खेलकर अनलेबल (unlabeled) टेबल्स (बिना उत्तर वाले टेबल्स) से सीखना सिखाता है।


उपमा: "स्टडी ग्रुप" बनाम "सख्त शिक्षक"

1. पुराना तरीका: सख्त शिक्षक (Supervised Learning)

कल्पना कीजिए कि एक छात्र (AI) गणित सीखने की कोशिश कर रहा है।

  • पुराना तरीका: एक शिक्षक छात्र को 1,000 समस्याओं वाला एक वर्कशीट देता है जिसके साथ उत्तर कुंजी (answer key) भी जुड़ी होती है। छात्र उत्तरों को रट लेता है।
  • दोष: यदि शिक्षक के पास उत्तर कुंजियाँ खत्म हो जाती हैं (जो वास्तविक दुनिया के, बिखरे हुए टेबल्स के मामले में होता है), तो छात्र सीखना बंद कर देता है। साथ ही, यदि छात्र को एक गुप्त किताब पढ़नी है जिसे वह शिक्षक को नहीं दिखा सकता, तो वह इस विधि का उपयोग नहीं कर सकता।

2. नया तरीका: स्टडी ग्रुप (TRivia)

TRivia एक स्मार्ट स्टडी ग्रुप की तरह है जहाँ छात्र बिना उत्तर कुंजी के किताबों के ढेर से सीखता है।

चरण 1: "अनुमान लगाने का खेल" (Response-Consistency Sampling)
छात्र एक बिखरे हुए टेबल को देखता है और उसे हल करने की कोशिश करता है। वह यह काम कई बार करता है, हर बार थोड़ा अलग उत्तर प्राप्त करता है।

  • ट्रिक: यदि छात्र हर बार बिल्कुल एक जैसा उत्तर देता है, तो इसका मतलब है कि टेबल शायद बहुत आसान थी। लेकिन अगर छात्र के अलग-अलग उत्तर आते हैं, तो इसका मतलब है कि टेबल पेचीदा और दिलचस्प है। TRivia इन "पेचीदा" टेबल्स को पढ़ने के लिए चुनता है क्योंकि वे सीखने के लिए सबसे अधिक मूल्य प्रदान करते हैं।

चरण 2: "क्विज़ मास्टर" (Attention-Guided QA)
अब, बिना उत्तर कुंजी के छात्र को कैसे पता चलेगा कि उसका उत्तर सही है या नहीं?

  • TRivia एक क्विज़ मास्टर की तरह कार्य करता है। यह टेबल को देखता है और विशिष्ट प्रश्न पूछता है जैसे, "नीचे दाएं कोने में कुल योग क्या है?" या "दूसरी पंक्ति में कौन सूचीबद्ध है?"
  • जादू: सिस्टम AI के अपने "अटेंशन" (एक स्पॉटलाइट की तरह) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि प्रश्न टेबल के विभिन्न हिस्सों को कवर करें, न कि केवल एक ही जगह पर बार-बार केंद्रित हों।

चरण 3: "स्वयं सुधार" (The Reward Loop)
छात्र क्विज़ मास्टर के सवालों के जवाब देने के लिए टेबल की अपनी व्याख्या के आधार पर उत्तर देने की कोशिश करता है।

  • यदि छात्र का टेबल स्ट्रक्चर गलत है, तो वह क्विज़ के सवालों का गलत उत्तर देगा।
  • यदि छात्र का टेबल स्ट्रक्चर सही है, तो वह क्विज़ के सवालों का सही उत्तर देगा।
  • रिवॉर्ड (पुरस्कार): सिस्टम छात्र को उनके क्विज़ के उत्तर देने के आधार पर एक "स्कोर" देता है। यदि वे अच्छा करते हैं, तो उन्हें रिवॉर्ड मिलता है। यदि वे खराब करते हैं, तो उन्हें पेनल्टी मिलती है।
  • समय के साथ, छात्र क्विज़ पर उच्च स्कोर पाने के लिए एकदम सही टेबल स्ट्रक्चर बनाना सीख जाता है। उन्होंने कभी "सही" उत्तर कुंजी नहीं देखी; उन्होंने बस क्विज़ के सवालों का सही उत्तर देना सीख लिया।

यह एक बड़ी बात क्यों है?

  1. यह "सेल्फ-सुपरवाइज्ड" है: इसे डेटा को लेबल करने के लिए इंसानों की आवश्यकता नहीं है। यह इंटरनेट पर पाए जाने वाले किसी भी टेबल इमेज या निजी दस्तावेजों से सीख सकता है।
  2. यह "विशेषज्ञों" से बेहतर है: पेपर दिखाता है कि उनका नया मॉडल, TRivia-3B, वास्तव में बड़ी टेक कंपनियों के महंगे, प्रोप्राइटरी मॉडल्स (जैसे Gemini 2.5 Pro) और अन्य विशेष ओपन-सोर्स मॉडल्स की तुलना में टेबल्स पढ़ने में अधिक स्मार्ट है।
  3. यह "निजी" है: क्योंकि इसे लेबल प्राप्त करने के लिए डेटा को क्लाउड सर्वर पर भेजने की आवश्यकता नहीं है, आप गोपनीयता लीक की चिंता किए बिना संवेदनशील दस्तावेजों (जैसे कानूनी अनुबंध या मेडिकल रिकॉर्ड) को प्रोसेस करने के लिए इसे अपने स्वयं के कंप्यूटर पर चला सकते हैं।

"सीक्रेट सॉस" सामग्री

  • "स्पॉटलाइट" (Attention): सिस्टम यह सुनिश्चित करता है कि टेबल के बारे में पूछे गए प्रश्न केवल एक ही कोने के बारे में न हों। यह AI को पूरी तस्वीर देखने के लिए मजबूर करता है।
  • "फ़िल्टर" (Illegal-Sample Filtering): कभी-कभी AI भ्रमित हो जाता है और अजीबोगरीब परिणाम (gibberish) देता है। सिस्टम इतना स्मार्ट है कि वह उन खराब प्रयासों को हटा देता है ताकि वे सीखने की प्रक्रिया को भ्रमित न करें।
  • "ग्रुप चैट" (GRPO): केवल "सही" या "गलत" कहने के बजाय, सिस्टम AI के विभिन्न प्रयासों की आपस में तुलना करता है। यह पूछता है, "इन 5 अनुमानों में से कौन सा सबसे अधिक सुसंगत (consistent) था?" और उसी को पुरस्कृत करता है।

निचोड़ (The Bottom Line)

TRivia कंप्यूटर को टेबल पढ़ना सिखाने जैसा है, जिसमें उसे यह बताने के बजाय कि "यह सही उत्तर है," उससे यह पूछा जाता है, "क्या तुम बता सकते हो कि इस सेल में क्या है?"

इस स्व-जनित क्विज़ के खेल को खेलकर, AI टेबल्स को पहले से कहीं बेहतर तरीके से समझना सीख जाता है, और इसके लिए उसे महंगे मानव शिक्षकों या गोपनीयता जोखिमों की आवश्यकता नहीं होती है। यह दस्तावेजों को मशीनों के लिए पठनीय बनाने की दिशा में एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →