← नवीनतम पेपर
💻 computer science

Enhancing Table Reasoning with Deterministic Table-State Rewards

यह शोध पत्र 'लॉन्गेस्ट कॉमन सबसीक्वेंस' (Longest Common Subsequence) पर आधारित एक प्रशिक्षण-मुक्त नियतात्मक रिवॉर्ड मेट्रिक, TABROUGE, और RE-TAB फ्रेमवर्क को प्रस्तुत करता है, जो बिना किसी सीखे हुए मॉडल या बाहरी निष्पादक (external executor) पर निर्भर रहे, मध्यवर्ती अवस्थाओं के लिए स्केलेबल और क्वेरी-आधारित फीडबैक प्रदान करके लार्ज लैंग्वेज मॉडल्स की बहु-चरणीय तालिका तर्क (multi-step table reasoning) सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying Nian Wu, Lei Ding, Guang Cheng

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying Nian Wu, Lei Ding, Guang Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "खोया हुआ" एजेंट (The "Lost in the Sauce" Agent)

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े भुलक्कड़ सहायक (एक लार्ज लैंग्वेज मॉडल) का उपयोग करके एक जटिल पहेली को हल करने की कोशिश कर रहे हैं। आप उन्हें एक विशाल स्प्रेडशीट (एक टेबल) देते हैं और एक प्रश्न पूछते हैं जैसे, "टीम ने 20 से अधिक अंकों के साथ कितने गेम जीते?"

सहायक इस तालिका को टुकड़ों में काटकर, पंक्तियों (rows) को फ़िल्टर करके और नंबरों की गणना करके इसे हल करने की कोशिश करता है। हालाँकि, एक बड़ी समस्या है: सहायक को यह तब तक पता नहीं चलता कि वह अच्छा काम कर रहा है या नहीं, जब तक कि वह अंतिम उत्तर नहीं दे देता।

यदि सहायक गलती से गलत पंक्ति को हटा देता है या अप्रासंगिक डेटा को रख लेता है, तो उसे अंत तक अपनी गलती का एहसास नहीं होगा। तब तक बहुत देर हो चुकी होगी। यह एक ऐसे शेफ की तरह है जो सूप में बिना चखे सामग्री मिलाता रहता है, और अंत में उसे पता चलता है कि सूप बहुत नमकीन हो गया है। पेपर इसे "साइलेंट कंपाउंडिंग एरर्स" (silent compounding errors) कहता है। सहायक सही होने का आत्मविश्वास दिखाते हुए भी रास्ता भटक जाता है।

समाधान: डेटा के लिए एक "जीपीएस" (A "GPS" for Data)

लेखकों ने एक नया सिस्टम पेश किया है जिसे RE-TAB कहा जाता है और एक विशिष्ट टूल जिसे TABROUGE कहा जाता है। इन्हें आप एक जीपीएस और सहायक के काम के लिए एक "क्वालिटी स्कोर" के रूप में समझ सकते हैं।

अंत तक प्रतीक्षा करने के बजाय कि उत्तर सही है या नहीं, यह सिस्टम सहायक के काम को हर एक कदम के बाद चेक करता है।

1. TABROUGE: "प्रासंगिकता स्कोरकार्ड" (The "Relevance Scorecard")

TABROUGE एक चतुर, गणित-आधारित तरीका है जो बिना किसी इंसान द्वारा देखे या किसी जटिल कंप्यूटर प्रोग्राम को चलाने के, सहायक की वर्तमान टेबल स्थिति को ग्रेड देता है।

  • यह कैसे काम करता है: यह टेबल को वाक्यों की एक सरल सूची में बदल देता है (जैसे, "कॉलम A 55 है," "कॉलम B 27 है")। फिर, यह इस सूची की आपकी मूल प्रश्न से तुलना करता है।
  • उपमा (Analogy): कल्पना कीजिए कि आप एक लाइब्रेरी में एक विशिष्ट पुस्तक खोज रहे हैं।
    • गलत कदम: सहायक किताबों से भरी एक गाड़ी निकालता है, लेकिन अधिकांश किताबें खाना पकाने के बारे में हैं, इतिहास के बारे में नहीं। TABROUGE इसे कम स्कोर देता है क्योंकि आपके प्रश्न के "इतिहास" वाले शब्द उस गाड़ी पर मौजूद नहीं हैं।
    • सही कदम: सहायक खाना पकाने की किताबें हटा देता है और केवल इतिहास की किताबें रखता है। TABROUGE इसे उच्च स्कोर देता है क्योंकि अब गाड़ी आपकी रिक्वेस्ट से पूरी तरह मेल खाती है।
  • यह क्यों विशेष है: यह "डिटरमिनिस्टिक" (deterministic) है, जिसका अर्थ है कि यह समान डेटा के लिए हमेशा एक ही स्कोर देता है। यह अनुमान नहीं लगाता या सीखता नहीं है; यह बस यह गिनता है कि वर्तमान टेबल आपके प्रश्न से कितनी अच्छी तरह मेल खाती है। यह "ब्लोट" (bloat - अनावश्यक चीज़ों को रखना) को भी दंडित करता है, जिससे सहायक को टेबल को साफ और केंद्रित रखने के लिए प्रोत्साहन मिलता है।

2. RE-TAB: "स्मार्ट नेविगेटर" (The "Smart Navigator")

RE-TAB वह फ्रेमवर्क है जो सहायक को गाइड करने के लिए TABROUGE का उपयोग करता है। यह दो मुख्य काम करता है:

  • चरण-दर-चरण फीडबैक: सहायक द्वारा कोई चाल चलने (जैसे, "पंक्तियों को फ़िल्टर करें") के बाद, RE-TAB तुरंत उसे TABROUGE स्कोर दिखाता है। यदि स्कोर गिरता है, तो सहायक को पता चल जाता है, "ओह, मैं गलत दिशा में जा रहा था," और वह एक अलग चाल आज़मा सकता है।
  • टेस्ट-टाइम स्केलिंग (The "Try Again" Strategy): कभी-कभी, सहायक अभी भी भ्रमित हो सकता है। RE-TAB सहायक को समस्या को कई बार हल करने की कोशिश करने (विभिन्न "पथों" या "ट्रैजेक्टरीज" को जेनरेट करने) की अनुमति देता है। इसके बाद, यह केवल आत्मविश्वास या वोटिंग के आधार पर चुनने के बजाय, उत्तर तक पहुँचने के लिए सबसे अच्छे पथ को चुनने के लिए TABROUGE स्कोर का उपयोग करता है।

परिणाम: स्मार्ट और तेज़ (The Results: Smarter and Faster)

पेपर ने इस सिस्टम का परीक्षण छह अलग-अलग AI मॉडल्स (छोटे, ओपन-सोर्स से लेकर विशाल, अत्याधुनिक मॉडल्स तक) और तीन अलग-अलग प्रकार के टेबल पहेलियों पर किया।

  • सटीकता में वृद्धि (Accuracy Boost): औसतन, इस "स्कोरकार्ड" को जोड़ने से सटीकता में 26.7 प्रतिशत अंक का सुधार हुआ। यह एक बहुत बड़ी छलांग है, जो एक संघर्षरत सहायक को एक शीर्ष प्रदर्शन करने वाले में बदल देती है।
  • दक्षता (Efficiency): क्योंकि सिस्टम जानता है कि उसने सही रास्ता ढूंढ लिया है, इसलिए इसे 20 अलग-अलग समाधान आज़माने में समय बर्बाद करने की आवश्यकता नहीं है। इसने पिछले तरीकों की तुलना में 33% कम प्रयासों के साथ सही उत्तर खोज लिया।
  • कोई ट्रेनिंग आवश्यक नहीं: सबसे अच्छी बात यह है कि आपको AI मॉडल्स को फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं है। आप बस इस "स्कोरकार्ड" सिस्टम को जोड़ते हैं, और यह तुरंत काम करने लगता है।

कमी (सीमाएं) (The Catch - Limitations)

लेखक ईमानदार हैं कि उनका "स्कोरकार्ड" परफेक्ट नहीं है। क्योंकि यह शब्दों के मिलान (lexical matching) पर निर्भर करता है न कि गहरे अर्थ को समझने पर, यह कभी-कभी भ्रमित हो सकता है यदि:

  • सहायक किसी कॉलम का नाम कुछ ऐसा रख देता है जो प्रश्न जैसा सुनाई देता है लेकिन वास्तव में उपयोगी नहीं है (एक "डेकॉय" या छलावा)।
  • सहायक एक नया नंबर कैलकुलेट करता है जो सही है लेकिन उसमें प्रश्न के अलग शब्दों का उपयोग किया गया है (उदाहरण के लिए, "प्रॉफिट" कैलकुलेट करना जबकि प्रश्न में "अर्निंग्स" पूछा गया था)।

हालाँकि, पेपर दिखाता है कि ऐसी गलतियाँ दुर्लभ हैं, और सिस्टम अधिकांश वास्तविक दुनिया की टेबल पहेलियों को प्रभावी ढंग से संभालने के लिए पर्याप्त मजबूत है।

सारांश (Summary)

संक्षेप में, यह पेपर AI एजेंटों को खाना पकाते समय अपना सूप चखना सिखाता है। उन्हें एक सरल, इंस्टेंट स्कोरकार्ड (TABROUGE) देकर जो उन्हें हर कदम के बाद बताता है कि क्या वे उत्तर के करीब पहुँच रहे हैं, एजेंट रास्ता भटकने से रुक जाते हैं, समस्याओं को अधिक सटीकता से हल करते हैं, और कम समय बर्बाद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →