← नवीनतम पेपर
🤖 AI

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

यह शोधपत्र TABVERSE को प्रस्तुत करता है, जो एक नियंत्रित मल्टीमॉडल बेंचमार्क है जो मॉडल प्रदर्शन पर तालिका प्रतिनिधित्व प्रारूपों (जैसे कि HTML, Markdown, LaTeX और चित्र) के प्रभाव को अलग करता है, जिससे यह पता चलता है कि संरचित टेक्स्ट आमतौर पर चित्रों से बेहतर प्रदर्शन करता है लेकिन प्रतिनिधित्व का चयन विभिन्न कार्यों और मॉडलों में परिणामों को महत्वपूर्ण रूप से प्रभावित करता है।

मूल लेखक: Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास मौसम, बिक्री या खेल के स्कोर का डेटा रखने वाली एक बहुत महत्वपूर्ण स्प्रेडशीट है। अब, कल्पना कीजिए कि आप इसी स्प्रेडशीट को एक कंप्यूटर को चार अलग-अलग तरीकों से दिखा सकते हैं:

  1. एक तस्वीर के रूप में (जैसे आपके फोन से लिया गया स्क्रीनशॉट)।
  2. HTML कोड के रूप में (वह भाषा जिसका उपयोग वेबसाइटें टेबल बनाने के लिए करती हैं)।
  3. LaTeX कोड के रूप में (एक भाषा जिसका उपयोग वैज्ञानिक जटिल दस्तावेज़ टाइप करने के लिए करते हैं)।
  4. Markdown के रूप में (एक सरल टेक्स्ट फॉर्मेट जिसका उपयोग चैट ऐप्स और नोट्स में किया जाता है)।

पेपर "TABVERSE" एक सरल लेकिन पेचीदा सवाल पूछता है: क्या यह मायने रखता है कि हम AI को टेबल कैसे दिखाते हैं?

अधिकांश पिछले परीक्षणों में AI को अलग-अलग टेबल और अलग-अलग फॉर्मेट एक साथ दिए जाते थे। यह कुछ ऐसा था जैसे पूछना, "क्या आप इस गणित के सवाल को हल कर सकते हैं?" लेकिन कभी सवाल कागज पर दिया जाता, कभी व्हाइटबोर्ड पर, तो कभी फुसफुसाकर बताया जाता। आपको पता नहीं चलता कि AI गणित की वजह से असफल हुआ या व्हाइटबोर्ड गंदा होने की वजह से।

TABVERSE इसे ठीक करता है क्योंकि यह एक ही सिंगल टेबल को लेता है और उसे सभी चार फॉर्मेट में एक साथ AI को दिखाता है। इससे शोधकर्ता ठीक से देख पाते हैं कि कौन सा फॉर्मेट AI की सोचने की क्षमता को बेहतर बनाता है और कौन सा उसे भ्रमित करता है।

यहाँ उनके निष्कर्ष दिए गए हैं, जिन्हें रोजमर्रा के उदाहरणों के साथ समझाया गया है:

1. "पढ़ने बनाम देखने" का परीक्षण (प्रश्न उत्तर)

शोधकर्ताओं ने AI से ऐसे प्रश्न पूछे जैसे, "किसने सबसे अधिक बिक्री की?" या "औसत कीमत क्या है?"

  • निष्कर्ष: सामान्य तौर पर, AI टेक्स्ट कोड (जैसे HTML या Markdown) को पढ़ने में तस्वीर को देखने की तुलना में बेहतर होता है।
  • उदाहरण: कल्पना कीजिए कि आप फोन बुक में एक विशिष्ट नाम ढूंढने की कोशिश कर रहे हैं।
    • टेक्स्ट फॉर्मेट: यह आपके सामने असली फोन बुक खुली होने जैसा है। आप अक्षरों को स्कैन कर सकते हैं और नाम आसानी से ढूंढ सकते हैं।
    • इमेज फॉर्मेट: यह उस फोन बुक के पन्ने की धुंधली फोटो देखने जैसा है। आप शब्दों को देख तो सकते हैं, लेकिन आपकी आँखों को फोकस करने के लिए अधिक मेहनत करनी पड़ती है, और शायद आप कोई अक्षर मिस कर दें।
  • विजेता: HTML सबसे विश्वसनीय "फोन बुक" फॉर्मेट था। AI इसमें शायद ही कभी भ्रमित हुआ। LaTeX थोड़ा कठिन था, जैसे कि एक ऐसी फोन बुक जो बहुत ही फैंसी और सख्त फॉन्ट में लिखी गई हो जो कभी-कभी पाठक को उलझा देती है।

2. "मैप रीडिंग" का परीक्षण (संरचनात्मक समझ)

इसके बाद, उन्होंने AI को एक कार्टोग्राफर (मानचित्रकार) की तरह काम करने के लिए कहा। उन्होंने ऐसे प्रश्न पूछे जैसे, "कितनी पंक्तियाँ (rows) हैं?" या "तीसरी पंक्ति और दूसरे कॉलम में क्या है?"

  • निष्कर्ष: AI पंक्तियों को गिनने और विशिष्ट स्थानों को खोजने में आश्चर्यजनक रूप से खराब है, भले ही वह टेक्स्ट को पूरी तरह से पढ़ सके।
  • उदाहरण: AI को एक पर्यटक के रूप में सोचें जिसके पास एक नक्शा है।
    • कॉलम (Columns): AI उत्तर-दक्षिण दिशा में चलने वाली "गलियों" (columns) को गिनने में बहुत अच्छा है। ऊर्ध्वाधर रेखाओं को देखना आसान है।
    • पंक्तियाँ (Rows): AI पूर्व-पश्चिम दिशा में चलने वाली "एवेन्यू" (rows) को गिनने में खो जाता है। वह अक्सर भूल जाता है कि ऊपर दी गई "शीर्षक" (Title) एक सड़क नहीं है, या वह इस बात को लेकर भ्रमित हो जाता है कि पहली सड़क कहाँ से शुरू होती है।
  • ट्विस्ट: जब शोधकर्ताओं ने AI को तस्वीर के बजाय पंक्तियों की एक टेक्स्ट लिस्ट दी, तो वह गिनने में बहुत बेहतर हो गया। लेकिन फिर भी, वह "पंक्ति" की अवधारणा के साथ "कॉलम" की तुलना में संघर्ष करता रहा।

3. "कॉपीकैट" परीक्षण (पुनर्निर्माण)

अंत में, उन्होंने AI को एक टेबल की तस्वीर दिखाई और उसे कोड (HTML, LaTeX, या Markdown) में फिर से बनाने के लिए कहा।

  • निष्कर्ष: AI टेबल के आकार (बक्से और रेखाएं) को कॉपी करने में बहुत अच्छा है लेकिन कंटेंट (सामग्री) को पूरी तरह से कॉपी करने में बहुत खराब है, विशेष रूप से LaTeX में।
  • उदाहरण: कल्पना कीजिए कि आप एक बच्चे को घर का चित्र कॉपी करने के लिए कह रहे हैं।
    • टोपोलॉजी (आकार): बच्चा घर के लिए एक वर्ग और छत के लिए एक त्रिकोण बनाता है। उन्होंने आकार सही बनाया! (इसे ही पेपर में "Topology" कहा गया है)।
    • कंटेंट (विवरण): लेकिन बच्चा "GARAGE" शब्द गलत लिख देता है या दरवाजे को गलत जगह पर बना देता है।
    • LaTeX की समस्या: AI को LaTeX में टेबल को फिर से बनाने के लिए कहना एक बच्चे को बहुत ही सख्त, जटिल नियमों का उपयोग करके घर बनाने के लिए कहने जैसा है। यदि बच्चा नियमों में एक छोटी सी भी गलती करता है, तो पूरा चित्र काम नहीं करेगा। पेपर में पाया गया कि कई AI मॉडल "टूटा हुआ" LaTeX कोड बनाते थे जिसे कंप्यूटर पढ़ नहीं सकते थे, भले ही चित्र ठीक लग रहा हो।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि आप AI को डेटा कैसे देते हैं, यह उतना ही महत्वपूर्ण है जितना कि स्वयं डेटा।

  • सिर्फ मान न लें: आप यह मानकर नहीं चल सकते कि AI एक टेबल को समझता है क्योंकि उसने तस्वीर पर सही उत्तर दिया था।
  • फॉर्मेट मायने रखता है: यदि आप चाहते हैं कि AI जटिल गणित करे या विशिष्ट पंक्तियाँ ढूंढे, तो उसे एक साफ टेक्स्ट फ़ाइल (जैसे HTML) देना एक स्क्रीनशॉट दिखाने से बेहतर होता है।
  • "रो" (Row) की अनदेखी: सबसे स्मार्ट AI मॉडल भी अभी भी यह ट्रैक रखने में संघर्ष करते हैं कि कौन सी पंक्ति कौन सी है, और अक्सर हेडर (headers) से भ्रमित हो जाते हैं या लाइनों को गलत गिनते हैं।

संक्षेप में, TABVERSE AI के लिए एक नए ड्राइविंग टेस्ट की तरह है। यह केवल यह नहीं देखता कि कार चल सकती है या नहीं, बल्कि यह परीक्षण करता है कि क्या कार एक चिकनी हाईवे (HTML), एक ऊबड़-खाबड़ कच्ची सड़क (LaTeX), या सड़क के बजाय नक्शा देखते हुए (Images) बेहतर चलती है। परिणाम दिखाते हैं कि AI जिस "सड़क" पर चलता है, वह उसके प्रदर्शन को बदल देती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →