TabularMath: Understanding Math Reasoning over Tables with Large Language Models
यह शोध पत्र स्केलेबल सारणीबद्ध तर्क कार्यों (tabular reasoning tasks) को उत्पन्न करने के लिए एक न्यूरो-सिंबोलिक फ्रेमवर्क, AutoT2T पेश करता है, और TabularMath प्रस्तुत करता है, जो टेक्स्ट और इमेज-आधारित तालिकाओं में बड़े भाषा मॉडलों की गणितीय तर्क क्षमताओं का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है और साथ ही मॉडल के प्रदर्शन पर तालिका की जटिलता और गुणवत्ता के महत्वपूर्ण प्रभाव को भी उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। अतीत में, सुराग साधारण पैराग्राफ के रूप में लिखे जाते थे। लेकिन वास्तविक दुनिया में, सुराग अक्सर स्प्रेडशीट्स, वित्तीय रिपोर्ट या अव्यवस्थित डेटा तालिकाओं (data tables) के रूप में आते हैं।
यह शोध पत्र, "TabularMath," एआई (AI) जासूसों को यह सिखाने के बारे में है कि कैसे वे इन जटिल तालिकाओं के भीतर छिपे रहस्यों को सुलझाएं, न कि केवल सरल वाक्यों के माध्यम से।
यहाँ उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:
1. समस्या: "टेक्स्ट बनाम टेबल" का अंतर
वर्तमान एआई मॉडल (जैसे कि वे जिनसे आप चैट करते हैं) को उन छात्रों के रूप में सोचें जो कहानी की किताबें पढ़ने में उत्कृष्ट हैं। यदि आप उनसे कहानी में लिखा कोई गणित का सवाल पूछें ("जनेट के पास 5 सेब हैं..."), तो वे इसमें बहुत अच्छे होते हैं।
हालाँकि, वास्तविक दुनिया में (जैसे कि किसी बैंक या व्यवसाय में), डेटा कहानियों में नहीं होता; वह एक्सेल शीट्स (Excel sheets) में होता है।
- समस्या: जब एआई को कहानी के बजाय स्प्रेडशीट देखने के लिए मजबूर किया जाता है, तो वह भ्रमित हो जाता है। यह एक ऐसे छात्र से पूछने जैसा है जो उपन्यास पढ़ने में माहिर है, लेकिन अचानक उसे एक ऐसी पहेली हल करने को कहा जाए जहाँ सुराग एक बिखरे हुए, अव्यवस्थित व्हाइटबोर्ड और स्टिकी नोट्स के रूप में हों। वे अक्सर सुरागों को मिस कर देते हैं, पंक्तियों (rows) और कॉलम (columns) में खो जाते हैं, या बस एक उत्तर बना लेते हैं क्योंकि वे खुश करने के लिए बहुत उत्सुक होते हैं।
2. समाधान: "मैजिक फैक्ट्री" (AUTOT2T)
शोधकर्ताओं ने AUTOT2T (ऑटोमैटिक टेक्स्ट-टू-टेबल) नामक एक विशेष उपकरण बनाया है।
- उपमा: एक ऐसी फैक्ट्री की कल्पना करें जो एक आदर्श कहानी के पन्ने को लेती है और स्वचालित रूप से उसे एक जटिल स्प्रेडशीट में फिर से लिख देती है।
- यह कैसे काम करता है: यह केवल कॉपी-पेस्ट नहीं करता; यह एक "न्यूरो-सिम्बोलिक" मस्तिष्क (एआई अंतर्ज्ञान और सख्त गणितीय तर्क का मिश्रण) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि स्प्रेडशीट समझ में आने योग्य हो। यह स्वचालित रूप से विभिन्न कठिनाई स्तरों वाली हजारों तालिकाएं बना सकता है, ठीक वैसे ही जैसे एक वीडियो गेम डिजाइनर "आसान" से "कठिन" स्तर बनाने के लिए लेवल बनाता है।
- लाभ: इससे पहले, शोधकर्ताओं को हर एक तालिका को मैन्युअल रूप से लिखना पड़ता था, जो धीमा और सीमित था। अब, वे एआई को टेस्ट करने के लिए तालिकाओं की एक विशाल, अनंत लाइब्रेरी स्वचालित रूप से बना सकते हैं।
3. नई परीक्षा: "TabularMath"
अपनी मैजिक फैक्ट्री का उपयोग करके, उन्होंने TabularMath नामक एक नया टेस्ट बनाया है। यह एआई के लिए एक जिम की तरह है, जिसमें तीन विशिष्ट प्रकार के वर्कआउट हैं:
- कठिनाई की सीढ़ी (The Difficulty Ladder): तालिकाएँ बड़ी और अधिक अव्यवस्थित होती जाती हैं (आसान, मध्यम, कठिन)।
- "ट्रैप" रूम (अपूर्ण उपसमुच्चय/Imperfect Subset): यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने तालिकाओं में छेद (गायब डेटा) या झूठ (विरोधाभासी संख्याएँ) बनाए।
- वास्तविक दुनिया की उपमा: एक वित्तीय रिपोर्ट की कल्पना करें जहाँ "कुल योग" (Total) उसके हिस्सों के योग से मेल नहीं खाता। एक अच्छा एआई कहेगा, "हे, यह डेटा टूटा हुआ है, मैं इसे हल नहीं कर सकता।" एक बुरा एआई बस एक नंबर का अनुमान लगाएगा और दिखावा करेगा कि वह सही है।
- दृश्य परीक्षण (The Visual Test): उन्होंने इन तालिकाओं को इमेज (जैसे स्क्रीनशॉट) में भी बदला ताकि यह देखा जा सके कि क्या एआई एक तस्वीर के रूप में तालिका को उतनी ही अच्छी तरह "पढ़" सकता है जितना कि वह टेक्स्ट को पढ़ता है।
4. उन्होंने क्या खोजा ( "Aha!" क्षण)
18 अलग-अलग एआई मॉडलों का इस नई परीक्षा पर परीक्षण करने के बाद, उन्हें तीन आश्चर्यजनक बातें पता चलीं:
खोज 1: "रिट्रीवल" (Retrieval) की बाधा।
- उपमा: शब्दकोश में एक विशिष्ट शब्द ढूंढना (Retrieval) उस शब्द का उपयोग करके पूरा निबंध लिखने (Reasoning) से आसान है।
- परिणाम: यदि आप एआई को ठीक से बताते हैं कि कहाँ देखना है, तो वह तालिका में एक संख्या खोजने में काफी अच्छा है। लेकिन जब उसे संख्या ढूंढनी होती है और साथ ही गणित भी करना होता है, तो वह घबरा जाता है। "खोजने" वाला हिस्सा और "सोचने" वाला हिस्सा आपस में लड़ते हैं, जिससे एआई विफल हो जाता है।
खोज 2: "हैलुसिनेशन" (Hallucination) का खतरा।
- उपमा: यदि आप किसी आत्मविश्वासी लेकिन बिना तैयारी वाले छात्र से अधूरी जानकारी वाला सवाल पूछते हैं, तो वह स्मार्ट दिखने के लिए बस एक उत्तर बना सकता है।
- परिणाम: जब तालिकाओं में गायब या विरोधाभासी डेटा था, तो अधिकांश एआई ने "मुझे नहीं पता" नहीं कहा। इसके बजाय, उन्होंने आत्मविश्वास के साथ गलत उत्तर दिए। यह वास्तविक जीवन (जैसे वित्त या चिकित्सा) में खतरनाक है क्योंकि एआई आपको गलत नंबर दे सकता है और आप उस पर भरोसा कर सकते हैं।
खोज 3: टेक्स्ट अभी भी राजा है।
- उपमा: टाइप की गई सूची को पढ़ना, नैपकिन पर लिखे हाथ से लिखे नोट को पढ़ने से आसान है।
- परिणाम: उन्नत एआई के लिए भी, जो इमेज देख सकता है, टेक्स्ट-आधारित तालिका (जैसे कोड या JSON) पर तर्क करना, तालिका की तस्वीर पर तर्क करने की तुलना में बहुत आसान है। विजुअल फॉर्मेट "शोर" (जैसे खराब लिखावट या धुंधले पिक्सेल) जोड़ देता है जो गणित को भ्रमित कर देता है।
5. यह क्यों मायने रखता है
यह शोध पत्र एक चेतावनी है। यह हमें बताता है कि हालांकि एआई गणित में स्मार्ट हो रहा है, लेकिन यह वास्तविक दुनिया के डेटा के साथ अभी भी अनाड़ी है।
- यदि हम चाहते हैं कि एआई हमारे टैक्स, व्यावसायिक रिपोर्ट या मेडिकल रिकॉर्ड में मदद करे, तो हमें इसे अव्यवस्थित, अपूर्ण और जटिल तालिकाओं को संभालना सिखाना होगा, न कि केवल साफ-सुथरी कहानियों को।
- शोधकर्ताओं ने दिखाया कि उनकी "मैजिक फैक्ट्री" डेटा पर प्रशिक्षण लेने से, मॉडल त्रुटियों को पहचानने और जटिल तालिका पहेलियों को हल करने में काफी बेहतर हो गए।
संक्षेप में: इस शोध पत्र ने एआई को भ्रमित हुए बिना अव्यवस्थित स्प्रेडशीट पढ़ना सिखाने के लिए एक विशाल, स्वचालित प्रशिक्षण मैदान बनाया। उन्होंने पाया कि हालांकि एआई में सुधार हो रहा है, लेकिन जब डेटा अधूरा होता है या तालिका बहुत बड़ी होती है, तो वह अभी भी संघर्ष करता है, और वास्तविक दुनिया में एक विश्वसनीय साथी बनने के लिए उसे और अधिक अभ्यास की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।