← नवीनतम पेपर
💬 NLP

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

यह शोध पत्र INDOTABVQA प्रस्तुत करता है, जो बहासा इंडोनेशिया दस्तावेज़ों में टेबल विजुअल क्वेश्चन अनस्विंग (Table Visual Question Answering) के लिए एक क्रॉस-लिंगुअल बेंचमार्क डेटासेट है, जो लक्षित फाइन-ट्यूनिंग और स्थानिक पूर्ववृत्तों (spatial priors) के समावेश के माध्यम से विजन-लैंग्वेज मॉडल्स के लिए महत्वपूर्ण प्रदर्शन लाभों का मूल्यांकन और प्रदर्शन करता है।

मूल लेखक: Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट लाइब्रेरियन है जिसका नाम "VLM" (विज़न-लैंग्वेज मॉडल) है। यह रोबोट किताबों को पढ़ने और सवालों के जवाब देने के लिए तस्वीरों को देखने के लिए प्रसिद्ध है। लेकिन इसमें एक पेंच है: इस रोबोट को मुख्य रूप से एक अंग्रेजी बोलने वाले पुस्तकालय में प्रशिक्षित किया गया था। यह अंग्रेजी टेबल्स और चार्ट्स को पूरी तरह से जानता है, लेकिन यदि आप इसे बहासा इंडोनेशिया (इंडोनेशिया की भाषा) में लिखा गया कोई दस्तावेज़ थमा दें और हिंदी या अरबी में सवाल पूछें, तो यह भ्रमित हो जाता है। यह वैसा ही है जैसे किसी ऐसे शेफ से एकदम सही भारतीय करी बनाने के लिए कहना जिसे केवल इतालवी पास्ता बनाना आता है और उसे अरबी में लिखी रेसिपी दी गई हो—उसे सामग्री का पता तो हो सकता है, लेकिन निर्देश एक विदेशी भाषा में हैं।

यह शोध पत्र इस समस्या को ठीक करने के लिए एक नया "ट्रेनिंग कैंप" पेश करता है जिसे INDOTABVQA कहा जाता है। सरल शब्दों में इसका विवरण यहाँ दिया गया है:

1. समस्या: "अनुवाद में खोई हुई" लाइब्रेरी

शोधकर्ताओं ने देखा कि जबकि AI दस्तावेज़ों को पढ़ने में बेहतर हो रहा है, इसे तब संघर्ष करना पड़ता है जब दस्तावेज़ ऐसी भाषा में हो जिसे वह अच्छी तरह नहीं बोलता (जैसे इंडोनेशियाई) और सवाल किसी अलग भाषा में हो (जैसे हिंदी)।

  • परिदृश्य: आपके पास इंडोनेशिया से एक सरकारी रिपोर्ट है जिसमें स्कूल फंडिंग दिखाने वाली एक तालिका (टेबल) है।
  • चुनौती: आप AI से हिंदी में पूछते हैं, "हाई स्कूल के छात्रों को कितनी राशि मिली?"
  • परिणाम: AI इंडोनेशियाई नंबर तो देख लेता है लेकिन वह हिंदी सवाल को नहीं समझ पाता, या दोनों को जोड़ने की कोशिश में भटक जाता है। यह एक पहेली को हल करने जैसा है जहाँ टुकड़े एक भाषा में हैं और डिब्बे पर बनी तस्वीर दूसरी भाषा में है।

2. समाधान: एक नया "प्रशिक्षण मैनुअल" (डेटासेट)

टीम ने एक विशाल नया डेटासेट बनाया जिसे INDOTABVQA कहा जाता है। इसे इस रोबोट लाइब्रेरियन के लिए एक विशेष प्रशिक्षण मैनुअल समझें।

  • सामग्री: इसमें इंडोनेशिया (जैसे सरकारी रिपोर्ट, स्कूल रिकॉर्ड और व्यावसायिक इनवॉइस) से 1,593 वास्तविक दुनिया के दस्तावेज़ शामिल हैं।
  • ट्विस्ट: प्रत्येक दस्तावेज़ के साथ चार भाषाओं में प्रश्न और उत्तर लिखे गए हैं: बहासा इंडोनेशिया, अंग्रेजी, हिंदी और अरबी।
  • विविधता: टेबल्स सभी साफ-सुथरे और व्यवस्थित नहीं हैं। कुछ में स्पष्ट काली सीमाएं (बॉर्डर) हैं (जैसे एक स्प्रेडशीट), कुछ में कोई रेखा नहीं है (केवल तैरता हुआ टेक्स्ट), और कुछ जानकारी को समूह में रखने के लिए चमकीले रंगों का उपयोग करते हैं। यह AI को केवल परफेक्ट कंप्यूटर-जनरेटेड दस्तावेज़ों को नहीं, बल्कि बिखरे हुए, वास्तविक जीवन के दस्तावेज़ों को पढ़ना सिखाने के लिए मजबूर करता है।

3. प्रयोग: रोबोट्स का परीक्षण

शोधकर्ताओं ने इस नए मैनुअल का उपयोग करके कई "रोबोट्स" (AI मॉडल्स) का परीक्षण किया। उन्होंने तीन अलग-अलग प्रकार के परीक्षण चलाए:

  • परीक्षण 1 ("ज़ीरो-शॉट" परीक्षण): रोबोट बिना किसी विशेष प्रशिक्षण के उत्तर देने की कोशिश करता है। परिणाम: इसे संघर्ष करना पड़ा, विशेष रूप से हिंदी और अरबी के साथ। यह बिना मानचित्र के किसी विदेशी शहर में घूमने वाले पर्यटक जैसा था।
  • परीक्षण 2 ("फाइन-ट्यूनिंग" परीक्षण): उन्होंने रोबोट को मैनुअल के 500 उदाहरणों के साथ एक क्रैश कोर्स दिया। परिणाम: रोबोट बहुत स्मार्ट हो गया, विशेष रूप से इंडोनेशियाई में। इसने इन विशिष्ट दस्तावेज़ों की "शब्दावली" सीख ली।
  • परीक्षण 3 ("जीपीएस" परीक्षण): यह सबसे चतुर हिस्सा था। उन्होंने रोबोट को शुरू करने से पहले "जीपीएस निर्देशांक" (टेबल के चारों ओर खींचा गया एक बॉक्स) दिया। परिणाम: इससे रोबोट को ध्यान केंद्रित करने में मदद मिली। पूरे पेज में उत्तर खोजने के बजाय, उसे पता था कि कहाँ देखना है। यह किसी को किताब में एक विशिष्ट वाक्य खोजने के लिए कहने से पहले हाइलाइटर पेन देने जैसा है।

4. बड़ी खोजें

  • आकार मायने रखता है (लेकिन सब कुछ नहीं): बड़े रोबोट (जैसे GPT-4o) आम तौर पर बेहतर थे, लेकिन जब भाषाएँ आपस में मिल जाती थीं, तो सबसे बड़े भी विफल हो जाते थे।
  • "हिंदी" की बाधा: AI को हिंदी के साथ सबसे अधिक संघर्ष करना पड़ा। शोधकर्ताओं का मानना है कि ऐसा इसलिए है क्योंकि हिंदी लिपि (देवनागरी) को कंप्यूटर के लिए सार्थक शब्दों में तोड़ना कठिन है, जो कुछ ऐसा है जैसे एक ऐसे वाक्य को पढ़ने की कोशिश करना जहाँ हर अक्षर एक स्पेस द्वारा अलग किया गया हो।
  • "जीपीएस" की शक्ति: AI को टेबल का सटीक स्थान (स्पेशियल प्रायर्स) देने से इसके प्रदर्शन में काफी वृद्धि हुई। इसने साबित कर दिया कि कभी-कभी, AI को केवल यह जानने की आवश्यकता नहीं होती कि क्या पढ़ना है, बल्कि उसे थोड़ा यह भी जानने की आवश्यकता होती है कि कहाँ देखना है।
  • सीखना काम करता है: एक छोटा, कॉम्पैक्ट रोबोट (3 बिलियन पैरामीटर्स) भी इस विशिष्ट डेटासेट पर थोड़े से प्रशिक्षण के बाद बहुत बेहतर हो गया।

5. यह क्यों मायने रखता है?

वर्तमान में, अधिकांश AI उपकरण अंग्रेजी बोलने वालों के लिए बनाए गए हैं। यह शोध पत्र दिखाता है कि यदि हम चाहते हैं कि AI वास्तव में उन अरबों लोगों के लिए उपयोगी हो जो इंडोनेशियाई, हिंदी या अरबी बोलते हैं, तो हमें:

  1. उन्हें उनकी अपनी भाषाओं में सिखाना होगा।
  2. उन्हें वास्तविक दुनिया के, बिखरे हुए उदाहरण देने होंगे (केवल साफ, परफेक्ट डेटा नहीं)।
  3. उन्हें ध्यान केंद्रित करने में मदद करनी होगी, यह दिखाकर कि महत्वपूर्ण जानकारी कहाँ है।

संक्षेप में: शोधकर्ताओं ने इंडोनेशियाई दस्तावेज़ों और कई भाषाओं के प्रश्नों के बीच एक सेतु (पुल) बनाया है। उन्होंने दिखाया कि हालांकि वर्तमान AI स्मार्ट है, लेकिन इसे विशेष प्रशिक्षण और थोड़े "जीपीएस" सहयोग की आवश्यकता है ताकि यह उन भाषाओं में टेबल्स को समझ सके जिन्हें वह धाराप्रवाह नहीं बोलता। यह AI को केवल अंग्रेजी बोलने वालों के लिए ही नहीं, बल्कि सभी के लिए उपयोगी बनाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →