← नवीनतम पेपर
🤖 machine learning

MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark

यह शोध पत्र MMTU को प्रस्तुत करता है, जो 25 वास्तविक दुनिया के विशेषज्ञ-स्तरीय तालिका कार्यों में 28,000 से अधिक प्रश्नों वाला एक बड़े पैमाने का बेंचमार्क है, जिसे संरचित सारणीबद्ध डेटा (structured tabular data) को समझने, तर्क करने और हेरफेर करने में वर्तमान अत्याधुनिक मॉडलों की महत्वपूर्ण सीमाओं का व्यापक रूप से मूल्यांकन करने और उन्हें प्रकट करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Junjie Xing, Yeye He, Mengyu Zhou, Haoyu Dong, Shi Han, Lingjiao Chen, Dongmei Zhang, Surajit Chaudhuri, H. V. Jagadish

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Xing, Yeye He, Mengyu Zhou, Haoyu Dong, Shi Han, Lingjiao Chen, Dongmei Zhang, Surajit Chaudhuri, H. V. Jagadish

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट असिस्टेंट (एक AI) है जो किताबें पढ़ सकता है, निबंध लिख सकता है और यहाँ तक कि गणित की समस्याओं को भी हल कर सकता है। आप सोच सकते हैं, "शानदार! यह मेरे स्प्रेडशीट्स भी संभाल सकता है, है ना?"

बिल्कुल नहीं। यही वह समस्या है जिसे यह पेपर संबोधित करता है।

समस्या: "एक्सेल" गैप (The "Excel" Gap)

लार्ज लैंग्वेज मॉडल्स (LLMs) को एक ऐसे प्रतिभाशाली लाइब्रेरियन की तरह समझें जिसने दुनिया की हर किताब पढ़ ली है। वे टेक्स्ट समझने में अद्भुत हैं। लेकिन टेबल्स (जैसे एक्सेल शीट्स, डेटाबेस, या वित्तीय रिपोर्ट) केवल टेक्स्ट नहीं हैं; वे स्ट्रक्चर्ड ग्रिड्स (संरचित ग्रिड) हैं जिनमें पंक्तियों (rows) और कॉलमों के साथ विशिष्ट संबंध होते हैं।

अब तक, हमने इन AI लाइब्रेरियन का परीक्षण केवल सरल "टेबल प्रश्नों" पर किया है जैसे, "जुलाई के लिए कुल बिक्री क्या है?" (यह ऐसा है जैसे लाइब्रेरियन से किसी किताब में एक विशिष्ट वाक्य खोजने के लिए कहना)।

लेकिन वास्तविक दुनिया के विशेषज्ञ—डेटा एनालिस्ट, अकाउंटेंट और इंजीनियर—केवल टेबल्स को पढ़ते नहीं हैं; वे उन्हें हेरफेर (manipulate) करते हैं। उन्हें आवश्यकता होती है:

  • टूटे हुए डेटा को ठीक करने की (जैसे पहेली का एक गायब हिस्सा ढूंढना)।
  • दो अलग-अलग स्प्रेडशीट्स को मिलाने की (जैसे पार्टी के लिए दो अलग-अलग मेहमान सूचियों को मर्ज करना)।
  • अव्यवस्थित डेटा को एक साफ रिपोर्ट में बदलने के लिए कोड लिखने की।
  • उन त्रुटियों को पकड़ने की जो तर्कहीन लगती हैं (जैसे किसी व्यक्ति की आयु "200" लिखी होना)।

वर्तमान AI मॉडल इन "विशेषज्ञ" कार्यों में बहुत खराब हैं। वे ग्रिड में खो जाते हैं, पंक्तियों और कॉलमों को आपस में मिला देते हैं, या गलत तथ्य (hallucinate) पेश करते हैं।

समाधान: MMTU (द "टेबल ओलंपिक्स")

लेखकों ने MMTU (मैसिव मल्टी-टास्क टेबल अंडरस्टैंडिंग) नामक एक नया बेंचमार्क बनाया है। इसे टेबल्स पर AI के लिए "ओलंपिक्स" की तरह समझें।

साधारण प्रश्न पूछने के बजाय, MMTU AI के सामने 28,000 अलग-अलग "इवेंट्स" फेंकता है। ये इवेंट्स दशकों के कंप्यूटर साइंस अनुसंधान से लिए गए हैं और उन वास्तविक कार्यों का प्रतिनिधित्व करते हैं जो पेशेवर हर दिन करते हैं।

ये 25 इवेंट्स शामिल हैं:

  • "डेटा डिटेक्टिव" (डेटा क्लीनिंग): गायब मानों (missing values) को ढूंढना या त्रुटियों को पहचानना।
  • "ट्रांसलेटर" (टेबल जॉइन): दो अलग-अलग सूचियों को लेना और यह समझना कि वे कैसे जुड़ती हैं।
  • "आर्किटेक्ट" (टेबल ट्रांसफॉर्म): एक अव्यवस्थित सूची को लेकर उसे एक व्यवस्थित टेबल में बदलना।
  • "कोडर" (NL-to-SQL): एक साधारण अंग्रेजी प्रश्न जैसे "टॉप 5 सेल्स दिखाएं" को उस वास्तविक कंप्यूटर कोड (SQL) में बदलना जिसकी उत्तर पाने के लिए आवश्यकता है।

परिणाम: AI अभी भी एक नौसिखिया है

शोधकर्ताओं ने इस "ओलंपिक्स" पर उपलब्ध सबसे स्मार्ट AI मॉडल्स (जैसे OpenAI का GPT-5 और DeepSeek R1) का परीक्षण किया।

यहाँ स्कोरकार्ड है:

  • सर्वश्रेष्ठ AI: लगभग 69% सही।
  • "रीजनिंग" AI (वे मॉडल जो बोलने से पहले सोचते हैं): लगभग 58% सही।
  • औसत AI: और भी अधिक संघर्ष करता है।

इसका क्या मतलब है?
जटिल टेबल कार्य के मामले में सबसे स्मार्ट AI भी अभी भी "रूकी इंटर्न" (नौसिखिया इंटर्न) की तरह हैं। वे एक टेबल को पढ़ सकते हैं, लेकिन यदि आप उन्हें एक विशाल स्प्रेडशीट को पुनर्गठित करने या एक टूटा हुआ फॉर्मूला ठीक करने के लिए कहते हैं, तो वे अक्सर गलतियाँ करते हैं।

मुख्य खोजें ("अहा!" मोमेंट्स)

  1. सोचना मदद करता है, लेकिन पर्याप्त नहीं है: "रीजनिंग" मॉडल (जो सोचते हैं) मानक चैटबॉट्स की तुलना में बेहतर प्रदर्शन करते हैं, लेकिन वे फिर भी संघर्ष करते हैं। यह पता चला है कि टेबल को समझने के लिए केवल तर्क की ही नहीं, बल्कि ग्रिड की संरचना (structure) को समझने की भी आवश्यकता होती है।
  2. "लॉन्ग टेबल" की समस्या: यदि टेबल छोटी है, तो AI ठीक काम करता है। लेकिन यदि टेबल बहुत बड़ी है (जैसे हजारों पंक्तियों वाली स्प्रेडशीट), तो AI खो जाता है। यह ऐसा है जैसे घास के ढेर में एक विशिष्ट सुई ढूंढना, लेकिन वह घास का ढेर 10 मील चौड़ा है। AI भूल जाता है कि वह कहाँ है।
  3. "शफल" संवेदनशीलता (Shuffle Sensitivity): एक वास्तविक स्प्रेडशीट में, इससे कोई फर्क नहीं पड़ता कि आप पंक्तियों को इधर-उधर (shuffle) करते हैं (डेटा का क्रम)। अर्थ वही रहता है। लेकिन AI मॉडल भ्रमित हो जाते हैं! यदि आप पंक्तियों को शफल करते हैं, तो AI अक्सर सोचता है कि डेटा बदल गया है। यह दर्शाता है कि वे वास्तव में टेबल को "समझते" नहीं हैं; वे केवल पैटर्न-मैचिंग कर रहे हैं।
  4. फॉर्मेट मायने रखता है (कभी-कभी): AI पहले बहुत भ्रमित हो जाता था यदि आप उन्हें अजीब फॉर्मेट (जैसे HTML बनाम CSV) में टेबल देते थे। अब, वे विभिन्न फॉर्मेट को संभालने में बेहतर हो रहे हैं, लेकिन वे अभी भी साफ और सरल लेआउट पसंद करते हैं।

हमें इसकी परवाह क्यों करनी चाहिए?

हम बैंकिंग, स्वास्थ्य सेवा, लॉजिस्टिक्स और विज्ञान के लिए सब कुछ टेबल्स पर निर्भर हैं। यदि हम चाहते हैं कि AI डेटा विशेषज्ञों के लिए एक वास्तविक "को-पायलट" (सहायक) बने (डेटाबेस बनाने या रुझानों का विश्लेषण करने में मदद करने के लिए), तो उसे MMTU टेस्ट पास करना होगा।

निष्कर्ष:
हमने एक ऐसा शानदार AI बनाया है जो कविता लिख सकता है और कैलकुलस हल कर सकता है। लेकिन जब बात स्प्रेडशीट्स और डेटाबेस की उबाऊ, अव्यवस्थित और जटिल दुनिया की आती है, तो यह अभी भी थोड़ा अनाड़ी है। MMTU वह नया पैमाना है जिसका उपयोग हम यह मापने के लिए कर रहे हैं कि इसे डेटा के साथ वास्तव में मदद करने के लिए कितना बड़ा होना होगा।

लेखकों को उम्मीद है कि इस बेंचमार्क को प्रकाशित करके, अन्य शोधकर्ता बेहतर मॉडल बनाएंगे जो अंततः टेबल के "एक्सपर्ट" स्तर के काम को संभाल सकें, जिससे हमारा डिजिटल जीवन बहुत आसान हो जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →