← नवीनतम पेपर
🤖 machine learning

MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image

यह शोधपत्र MulTaBench प्रस्तुत करता है, जो 40 इमेज-टेबुलर और टेक्स्ट-टेबुलर डेटासेट्स का एक व्यापक बेंचमार्क है जिसे यह प्रदर्शित करने के लिए डिज़ाइन किया गया है कि अनस्ट्रक्चर्ड मोडैलिटी एम्बेडिंग्स का टास्क-विशिष्ट ट्यूनिंग फ्रोजन एम्बेडिंग्स की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे नवीन मल्टीमॉडल टेबुलर फाउंडेशन मॉडल्स विकसित करने के लिए एक आधार स्थापित होता है।

मूल लेखक: Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker, Gaël Varoquaux, Frank Hutter, Roi Reichart

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker, Gaël Varoquaux, Frank Hutter, Roi Reichart

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास एक केस फाइल (संरचित सारणीबद्ध डेटा - structured tabular data) है जिसमें व्यक्ति की आयु, नौकरी का पद और वेतन जैसे तथ्य हैं। लेकिन आपके पास संदिग्ध की एक फोटो और एक हस्तलिखित नोट (असंरचित पाठ और छवि डेटा - unstructured text and image data) भी है।

लंबे समय तक, सर्वश्रेष्ठ जासूस (AI मॉडल) केस फाइल पढ़ने में तो माहिर थे लेकिन फोटो देखने या नोट्स पढ़ने में बहुत खराब थे। वे बस फोटो और नोट पर एक सरसरी नज़र डालते, जो कुछ उन्होंने देखा उसका एक त्वरित, सामान्य सा स्नैपशॉट (झलक) लेते, और फिर केवल उन स्नैपशॉट्स का उपयोग करके मामला सुलझाने की कोशिश करते।

समस्या यह थी कि वह सामान्य स्नैपशॉट अक्सर इस विशिष्ट रहस्य को सुलझाने के लिए आवश्यक सूक्ष्म, महत्वपूर्ण विवरणों को मिस कर देता था। फेफड़ों के एक्स-रे की एक फोटो एक सामान्य कैमरे को "स्वस्थ" लग सकती है, लेकिन निमोनिया के लिए तलाश कर रहे विशेषज्ञ को एक विशिष्ट, सूक्ष्म छाया देखनी होगी जिसे एक सामान्य स्शॉट धुंधला कर सकता है।

MulTaBench: नया प्रशिक्षण मैदान

लेखकों ने एक विशाल नया प्रशिक्षण मैदान बनाया जिसे MulTaBench कहा गया है। इसे 40 अलग-अलग बाधा दौड़ वाले एक विशाल जिम के रूप में समझें। आधे कोर्स फोटो को केस फाइल के साथ मिलाते हैं; अन्य आधे हस्तलिखित नोट्स को केस फाइल के साथ मिलाते हैं।

लेकिन उन्होंने डेटा को केवल बेतरतीब ढंग से नहीं जोड़ा। उन्होंने डेटा को दो विशिष्ट चीजों को सुनिश्चित करने के लिए फ़िल्टर किया:

  1. टीमवर्क आवश्यक है: फोटो/नोट को कुछ ऐसा जोड़ना चाहिए जो केस फाइल में पहले से मौजूद नहीं है। यदि केस फाइल पहले से ही आपको सब कुछ बता देती है, तो फोटो बेकार शोर है।
  2. विशेषज्ञता आवश्यक है: सामान्य स्नैपशॉट काफी नहीं है। जासूस को अपने देखने के तरीके को हाथ के काम के लिए विशेष रूप से "ट्यून" (समायोजित) करने की आवश्यकता है।

बड़ी खोज: "लक्ष्य-जागरूक" दृष्टि (Target-Aware Vision)

पेपर ने एक नई रणनीति का परीक्षण किया जिसे Target-Aware Representations (TAR) कहा गया।

  • पुराना तरीका (Frozen Embeddings): कल्पना कीजिए कि एक सुरक्षा गार्ड जो दरवाजे से गुजरने वाले हर व्यक्ति को देखता है और बस कहता है, "वह एक इंसान है।" उसे इससे फर्क नहीं पड़ता कि आप एक चोर हैं, एक डॉक्टर हैं, या एक बेकर हैं। वे एक सामान्य विवरण देते हैं।
  • नया तरीका (TAR): कल्पना कीजिए कि एक सुरक्षा गार्ड जानता है कि आप एक विशिष्ट चोर की तलाश कर रहे हैं। भीड़ को देखने से पहले ही, वह अपनी आंखों को केवल उन विशेषताओं पर ध्यान केंद्रित करने के लिए समायोजित करता है जो उस चोर को प्रकट कर सकती हैं। वह कपड़ों को अनदेखा करता है और चाल या किसी विशिष्ट निशान पर ध्यान केंद्रित करता है।

पेपर के प्रयोगों ने दिखाया कि TAR हर बार जीतता है। जब AI ने अपने विजन को विशिष्ट लक्ष्य (जैसे बीमारी का निदान करना या कीमत का अनुमान लगाना) के लिए "ट्यून" किया, तो उसने सामान्य "स्नैपशॉट" दृष्टिकोण की तुलना में समस्याओं को बहुत बेहतर ढंग से हल किया। यह फोटो के लिए, टेक्स्ट के लिए, छोटे मॉडलों के लिए, और बड़े मॉडलों के लिए भी काम कर गया।

यह क्यों मायने रखता है (पेपर के अनुसार)

लेखक तर्क देते हैं कि वर्तमान "सर्वश्रेष्ठ" AI मॉडल सारणीबद्ध डेटा के लिए प्रतिभाशाली अकाउंटेंट की तरह हैं जो सबूतों वाली फोटो देखने से इनकार करते हैं। वे गणित में महान हैं लेकिन संदर्भ (context) समझने में कमजोर हैं।

MulTaBench साबित करता है कि अगली पीढ़ी के "मल्टीमॉडल फाउंडेशन मॉडल्स" (सुपर-AI जो नंबर, टेक्स्ट और इमेज को एक साथ संभालते हैं) बनाने के लिए, हम केवल एक सामान्य फोटो-रीडर को एक मैथ-रीडर के साथ चिपका नहीं सकते। हमें एक ऐसी प्रणाली की आवश्यकता है जो फोटो को विशेष रूप से उस गणितीय समस्या को हल करने में मदद करने के लिए देखना सीख सके।

चुनौती (सीमाएं)

पेपर स्वीकार करता है कि काम करने का यह नया तरीका महंगा है। विजन को "ट्यून" करने में एक सामान्य स्नैपशॉट लेने की तुलना में बहुत अधिक कंप्यूटर पावर और समय लगता है। यह हर मामले के लिए एक सामान्य विशेषज्ञ के बजाय एक विशिष्ट विशेषज्ञ जासूस को काम पर रखने जैसा है। साथ ही, उन्होंने जिस तरह से 40 डेटासेट चुने, वह थोड़ा गोलाकार (circular) था: उन्होंने ऐसे डेटासेट चुने जहाँ यह विशिष्ट "ट्यूनिंग" विधि अच्छी तरह काम करती थी, इसलिए हम जानते हैं कि यह वहां काम करती है, लेकिन यह दुनिया के हर डेटासेट पर काम नहीं कर सकती है।

संक्षेप में

पेपर कहता है: "हमने एक नया टेस्ट ट्रैक (MulTaBench) बनाया है यह साबित करने के लिए कि AI मॉडलों को फोटो और टेक्स्ट देखते समय सामान्य, एक ही आकार के (one-size-fits-all) चश्मे का उपयोग करना बंद करने की आवश्यकता है। यदि वे नंबरों से जुड़ी जटिल समस्याओं को हल करना चाहते हैं, तो उन्हें उस विशिष्ट प्रश्न के लेंस के माध्यम से दुनिया को देखना सीखना होगा जिसका वे उत्तर देने की कोशिश कर रहे हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →