← नवीनतम पेपर
💻 computer science

From Table to Cell: Attention for Better Reasoning with TABALIGN

यह शोधपत्र TABALIGN प्रस्तुत करता है, जो एक नवीन तर्क ढांचा (reasoning framework) है जो मल्टी-स्टेप टेबल रीजनिंग में ऑटोरेग्रेसिव मॉडल्स की सीमाओं को दूर करने के लिए एक मास्क्ड डिफ्यूजन लैंग्वेज मॉडल प्लानर और एक सेल-ग्राउंडिंग अटेंशन वेरीफायर का लाभ उठाता है, जिससे आठ बेंचमार्क में महत्वपूर्ण सटीकता और दक्षता लाभ प्राप्त होता है।

मूल लेखक: Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Guo

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "From Table to Cell: Attention for Better Reasoning with TABALIGN" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "बाएँ-से-दाएँ" का जाल (The "Left-to-Right" Trap)

कल्पना कीजिए कि आप एक स्प्रेडशीट में लिखे गए गणित के सवाल को हल करने की कोशिश कर रहे हैं। स्प्रेडशीट में डेटा की पंक्तियाँ (जैसे "Obs 1," "Obs 2") और कॉलम (जैसे "Revenue," "Cost") हैं।

वर्तमान AI मॉडल उन छात्रों की तरह हैं जिन्हें सख्ती से बाएँ से दाएँ, ऊपर से नीचे पढ़ने के लिए मजबूर किया जाता है। वे आगे नहीं देख सकते या इधर-उधर नहीं कूद सकते।

  • समस्या: यदि आप स्प्रेडशीट की पंक्तियों का क्रम बदल देते हैं (जैसे "Obs 1" से पहले "Obs 3" रख देना), तो छात्र भ्रमित हो जाता है। वे गलत नंबर चुन सकते हैं क्योंकि वे उस क्रम पर अटके हुए हैं जिसे उन्हें सिखाया गया था, न कि डेटा के अर्थ पर।
  • परिणाम: AI अक्सर उन सेल्स (cells) को चुनने में गलती करता है जिन्हें उसे देखना चाहिए, भले ही वह अंततः सही उत्तर तक पहुँच जाए। यह ऐसा है जैसे तर्क समझने के बजाय गलती से सही उत्तर मिल जाना।

समाधान: TABALIGN

लेखकों ने इस समस्या को ठीक करने के लिए TABALIGN नामक एक नया सिस्टम बनाया है। इसे एक दो-सदस्यीय टीम के रूप में समझें जो स्प्रेडशीट की पहेली को हल करने के लिए मिलकर काम करती है: एक प्लानर (Planner) और एक एक्सेक्यूटर (Executor)

1. प्लानर (The "Diffusion" Architect)

पुराने "बाएँ-से-दाएँ" वाले छात्र के बजाय, यह टीम एक प्लानर का उपयोग करती है जो एक डिफ्यूजन मॉडल (diffusion model) का उपयोग करने वाले आर्किटेक्ट की तरह है (एक प्रकार का AI जो एक वाक्य को एक-एक शब्द करके लिखने के बजाय, पत्थर के एक ब्लॉक को तराश कर आकृति उभारने वाले मूर्तिकार की तरह काम करता है)।

  • यह कैसे काम करता है: प्लानर एक ही बार में पूरी स्प्रेडशीट को देखता है। उसे इससे फर्क नहीं पड़ता कि पंक्तियों का क्रम बदला गया है या नहीं। वह पूरी तस्वीर देखता है और एक "ब्लूप्रिंट" (योजना) बनाता है कि किन सेल्स का उपयोग किया जाना चाहिए।
  • जादू: क्योंकि यह सब कुछ एक साथ देख सकता है, यह एक बहुत ही स्थिर और सटीक मानचित्र तैयार करता है कि महत्वपूर्ण जानकारी कहाँ है, चाहे टेबल की व्यवस्था कैसी भी हो।

2. एक्सेक्यूटर (The "Reasoner")

एक्सेक्यूटर वह कार्यकर्ता है जो वास्तव में गणित करता है। यह प्लानर से ब्लूप्रिंट लेता है और उत्तर प्राप्त करने के लिए सेल्स पर क्लिक करना शुरू करता है।

  • समस्या: एक अच्छे ब्लूप्रिंट के बावजूद, एक्सेक्यूटर विचलित हो सकता है और गलत सेल पर क्लिक कर सकता है (जैसे "Obs 1" के बजाय "Total" पर क्लिक करना)।
  • समाधान: टीम ने एक वेरिफायर (Verifier) जोड़ा है (जिसे TABATTN कहा जाता है)।

3. वेरिफायर (The "Spotter")

कल्पना कीजिए कि एक कोच एक्सेक्यूटर के बगल में खड़ा है। कोच के हाथ में प्लानर का ब्लूप्रिंट है।

  • जब भी एक्सेक्यूटर किसी सेल पर क्लिक करता है, कोच जाँचता है: "क्या आपने उसी सेल पर क्लिक किया जिसके लिए ब्लूप्रिंट ने कहा था?"
  • यदि एक्सेक्यूटर सही सेल पर क्लिक करता है, तो कोच कहता है, "अच्छा काम किया, जारी रखो।"
  • यदि एक्सेक्यूटर गलत सेल पर क्लिक करता है (भले ही अंतिम संख्या सही दिख रही हो), तो कोच कहता है, "रुको! तुम गलत जगह देख रहे हो। फिर से कोशिश करो।"

यह सुनिश्चित करता है कि AI केवल किस्मत से सही उत्तर न दे जाए; वह वास्तव में सही पथ का पालन करे।

यह क्यों मायने रखता है (परिणाम)

पेपर में इस टीम (प्लानर + एक्सेक्यूटर + कोच) का परीक्षण आठ अलग-अलग प्रकार के स्प्रेडशीट पहेलियों पर किया गया।

  • स्कोर: TABALIGN टीम ने समान आकार के सर्वश्रेष्ठ मौजूदा ओपन-सोर्स AI मॉडल की तुलना में औसतन 15.76 अंक अधिक प्राप्त किए।
  • गति: क्योंकि प्लानर एक साफ और सटीक मानचित्र बनाता है, इसलिए एक्सेक्यूटर इधर-उधर भटक कर समय बर्बाद नहीं करता है। वास्तविक तर्क चरणों (reasoning steps) में पूरी प्रक्रिया 44% तेज़ हो गई।
  • स्थिरता: यदि आप स्प्रेडशीट की पंक्तियों को बदलते हैं, तो पुराना AI भ्रमित हो जाता है और उसका प्रदर्शन गिर जाता है। TABALIGN टीम स्थिर रहती है और टेबल व्यवस्थित होने के बावजूद समान प्रदर्शन करती है।

मुख्य अंतर्दृष्टि (Core Insight)

पेपर ने दो मुख्य बातें खोजीं:

  1. पूरी तस्वीर देखना बेहतर है: जो मॉडल एक साथ सभी डेटा को देख सकते हैं (जैसे प्लानर), वे लाइन-दर-लाइन पढ़ने वाले मॉडलों की तुलना में टेबल्स को बहुत बेहतर समझते हैं।
  2. "क्या" की तुलना में "कहाँ" की जाँच करना बेहतर है: केवल यह पूछने के बजाय कि "क्या अंतिम उत्तर सही है?", यह पूछना कहीं अधिक विश्वसनीय है कि "क्या आपने उस उत्तर को पाने के लिए सही विशिष्ट सेल्स को देखा?"

सारांश उपमा (Summary Analogy)

  • पुराना AI: एक रोबोट जो मेनू को ऊपर से नीचे तक पढ़ता है। यदि मेनू को पुनर्व्यवस्थित कर दिया जाए, तो वह गलत खाना ऑर्डर कर देता है।
  • TABALIGN: एक रोबोट जिसके पास एक शेफ (Planner) है जो पूरी रसोई को देखता है और ठीक उन्हीं सामग्रियों की ओर इशारा करता है जिनकी आवश्यकता है, और एक सॉस-शेफ (Executor) है जो उन्हें उठाता है। एक फूड क्रिटिक (Verifier) सॉस-शेफ पर नज़र रखता है ताकि यह सुनिश्चित हो सके कि वह उन्हीं सामग्रियों को उठा रहा है जिनकी ओर शेफ ने इशारा किया था, न कि बस जो भी पास में मिले उसे उठा रहा है।

यह सिस्टम सुनिश्चित करता है कि AI केवल सही उत्तर का अनुमान नहीं लगा रहा है, बल्कि टेबल के माध्यम से सही ढंग से तर्क कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →