← नवीनतम पेपर
💬 NLP

A Closer Look into LLMs for Table Understanding

यह शोध पत्र तालिका समझ (table understanding) के लिए उनके आंतरिक तंत्र को स्पष्ट करने हेतु 16 लार्ज लैंग्वेज मॉडल्स का एक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो विशिष्ट तीन-चरणीय अटेंशन पैटर्न, गणितीय तर्क की तुलना में सारणीबद्ध कार्यों के लिए गहरे स्तर की आवश्यकताओं, मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल्स में विशेष विशेषज्ञ सक्रियण, और टेबल-ट्यूनिंग के साथ चेन-ऑफ-थॉट प्रॉम्प्टिंग के संवर्धित अटेंशन प्रभावों को प्रकट करता है।

मूल लेखक: Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

प्रकाशित 2026-03-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान लाइब्रेरियन (एक Large Language Model या LLM) है जिसने दुनिया की लगभग हर किताब पढ़ ली है। अब, आप उसे एक बिखरा हुआ स्प्रेडशीट (एक तालिका/table) देते हैं जिसमें देशों की पंक्तियाँ (rows) और स्वर्ण, रजत और कांस्य पदक के कॉलम (columns) हैं, और उनसे पूछते हैं: "सबसे अधिक स्वर्ण पदक किसने जीते?"

आपको लग सकता है कि लाइब्रेरियन बस इसे ऊपर से नीचे तक पढ़ता है और उत्तर चुन लेता है। लेकिन यह शोध पत्र इस पर से पर्दा हटाता है कि इस कार्य को करते समय लाइब्रेरियन का डिजिटल मस्तिष्क वास्तव में कैसे काम करता है। शोधकर्ताओं ने 16 अलग-अलग "लाइब्रेरियनों" (AI मॉडल्स) का अध्ययन किया और पाया कि उनके डिजिटल मस्तिष्क के भीतर एक दिलचस्प, तीन-चरणीय नृत्य (three-step dance) होता है।

यहाँ बताया गया है कि ये AI मॉडल तालिकाओं (tables) को कैसे समझते हैं, जिसे सरल भाषा में समझाया गया है:

1. तीन अंकों वाला नाटक: AI कैसे "सोचता" है

शोध से पता चला कि AI केवल तालिका को घूरता नहीं है; वह तीन विशिष्ट चरणों से गुजरता है, जैसे कोई जासूस रहस्य सुलझा रहा हो:

  • अंक 1: व्यापक स्कैन (प्रारंभिक परतें / Early Layers)
    • रूपक (Metaphor): कल्पना कीजिए कि आप एक लाइब्रेरी में प्रवेश करते हैं और कमरे का अंदाज़ा लगाने के लिए हर बुकशेल्फ़ पर एक त्वरित नज़र डालते हैं।
    • क्या होता है: AI की शुरुआती कुछ "मस्तिष्क परतें" पूरी तालिका को व्यापक रूप से देखती हैं। वे अभी विशिष्ट संख्याओं पर ध्यान केंद्रित नहीं करतीं; वे बस परिवेश को समझ रही होती हैं। वे हेडर (headers) और संरचना को स्कैन कर रही हैं ताकि यह समझ सकें, "ठीक है, यह एक खेल पदक तालिका है।"
  • अंक 2: लेजर फोकस (मध्यम परतें / Middle Layers)
    • रूपक: अब, जासूस एक आवर्धक लेंस (magnifying glass) लगाता है और केवल उस विशिष्ट सुराग पर ज़ूम करता है जो महत्वपूर्ण है।
    • क्या होता है: यह सबसे महत्वपूर्ण हिस्सा है। AI अचानक तालिका के 90% हिस्से को अनदेखा कर देता है और केवल दो चीजों पर तीव्रता से ध्यान केंद्रित करता है: कॉलम हेडर "स्वर्ण" (Gold) और उच्चतम संख्या वाली पंक्ति। यह शोर (noise) को छानकर अलग कर देता है। शोध में पाया गया कि यदि आप इस मध्य चरण के दौरान AI को तालिका देखने से रोकते हैं, तो वह पूरी तरह विफल हो जाता है।
  • अंक 3: एम्पलीफायर (अंतिम परतें / Late Layers)
    • रूपक: जासूस कमरे में उत्तर चिल्लाकर बताता है, ताकि यह सुनिश्चित हो सके कि हर कोई इसे स्पष्ट रूप से सुन सके।
    • क्या होता है: AI की अंतिम परतें उस केंद्रित जानकारी ("चीन के पास 13 स्वर्ण पदक हैं") को लेती हैं और उसे बढ़ा (amplify) देती हैं। वे उस केंद्रित विचार की छोटी सी चिंगारी को अंतिम बोले गए उत्तर में बदल देती हैं: "चीन।"

2. "विशेषज्ञ" बनाम "सामान्यवादी" (MoE मॉडल्स)

कुछ AI मॉडल्स जिनका अध्ययन किया गया है, वे "मिश्रण-विशेषज्ञ" (Mixture-of-Experts या MoE) हैं। इन्हें विशेषज्ञों की एक बड़ी टीम वाली लाइब्रेरी के रूप में सोचें।

  • निष्कर्ष: जब AI उस "मध्य अंक" (लेजर फोकस चरण) पर पहुँचता है, तो वह केवल अपने सामान्य मस्तिष्क का उपयोग नहीं करता है। वह एक विशेषज्ञ विशेषज्ञ को बुलाता है जो केवल तालिकाओं के बारे में जानता है।
  • उपमा: कल्पना कीजिए कि एक जनरल मैनेजर (प्रारंभिक परतें) कहता है, "हमारे पास एक तालिका संबंधी समस्या है!" फिर, एक विशिष्ट तालिका विशेषज्ञ (मध्य परत में एक विशेष न्यूरॉन) इसे हल करने के लिए आगे आता है। एक बार जब उत्तर मिल जाता है, तो जनरल मैनेजर (अंतिम परतें) परिणाम घोषित करने के लिए कार्यभार संभाल लेता है।
  • यह क्यों मायने रखता है: ये "तालिका विशेषज्ञ" उन "गणित विशेषज्ञों" से अलग हैं जिनका उपयोग AI अन्य कार्यों के लिए करता है। वे संरचित डेटा (structured data) को संभालने के लिए अद्वितीय हैं।

3. "गहन अध्ययन" की आवश्यकता (Deep Dive Requirement)

शोधकर्ताओं ने तुलना की कि AI गणित की समस्याओं बनाम तालिका की समस्याओं को कैसे संभालता है।

  • निष्कर्ष: गणित की समस्याएं एक स्प्रिंट (तेज़ दौड़) की तरह हैं; AI उन्हें सुलझाता है और अपने उत्तर को अपेक्षाकृत जल्दी स्थिर कर लेता है। तालिका की समस्याएं एक मैराथन की तरह हैं।
  • उपमा: गणित के समीकरण को हल करना घास के ढेर में सुई खोजने जैसा है। तालिका के प्रश्न को हल करना सुई खोजने, फिर यह सत्यापित करने, कि क्या यह सही सुई है, फिर यह जाँचने, कि क्या घास का ढेर सही है, और फिर लेबल की दोबारा जाँच करने जैसा है। तालिका के उत्तर के बारे में आश्वस्त होने के लिए AI को गणित के उत्तर की तुलना में अधिक परतों (सोचने के अधिक चरणों) से गुजरना पड़ता है।

4. प्रारूप (Format) से फर्क नहीं पड़ता (अंततः)

शोध में परीक्षण किया गया कि क्या इससे फर्क पड़ता है कि तालिका Markdown (रेखाओं के साथ सरल टेक्स्ट) में लिखी गई है या HTML (टैग्स जैसे <table> के साथ जटिल कोड) में है।

  • निष्कर्ष: शुरुआत में (अंक 1 में), AI अस्त-व्यस्त HTML टैग्स से थोड़ा भ्रमित हो जाता है, जिससे उसका ध्यान बहुत अधिक बिखर जाता है। लेकिन जब तक वह मध्य परतों तक पहुँचता है, तब तक उसे इस बात से कोई फर्क नहीं पड़ता कि प्रारूप कैसा है। वह तालिका के "कपड़े" (form) की परवाह किए बिना उसके अर्थ को समझ जाता है।
  • पाठ: आपको AI के समझने के लिए तालिका के प्रारूप को एकदम सटीक बनाने की चिंता करने की आवश्यकता नहीं है, जब तक कि डेटा वहां मौजूद है।

5. "बोलकर सोचने" की शक्ति (Chain-of-Thought)

शोधकर्ताओं ने परीक्षण किया कि क्या AI को "चरण-दर-चरण सोचने" (Chain-of-Thought) के लिए कहना मदद करता है।

  • निष्कर्ष: हाँ! जब AI को अपने तर्क को समझाने के लिए मजबूर किया जाता है, तो वह तालिका के डेटा पर अधिक ध्यान देता है।
  • उपमा: यह एक छात्र को गणित के टेस्ट में अपना काम दिखाने के लिए कहने जैसा है। जब उन्हें अपने चरणों को लिखना होता है, तो वे महत्वपूर्ण संख्याओं को नज़रअंदाज़ करने की कम संभावना रखते हैं। यह "बोलकर सोचना" AI को तालिका पर अपनी नज़रें टिकाने के लिए मजबूर करता है, जिससे बेहतर उत्तर मिलते हैं।

सारांश: हमें क्या समझना चाहिए?

यह शोध पत्र हमें बताता है कि AI केवल एक जादुई ब्लैक बॉक्स नहीं है जो उत्तरों का अनुमान लगाता है। इसके पास एक बहुत ही तार्किक, संरचित कार्यप्रवाह (workflow) है:

  1. पूरी तालिका को स्कैन करना।
  2. आवश्यक विशिष्ट सेल्स (cells) पर ज़ूम करना।
  3. उत्तर देने के लिए उस जानकारी को बढ़ाकर (amplify) प्रस्तुत करना।

यह क्यों मायने रखता है?

  • डेवलपर्स के लिए: यदि आप तालिकाओं के लिए एक बेहतर AI बनाना चाहते हैं, तो केवल उसे बड़ा न बनाएं। सुनिश्चित करें कि उसमें एक "मध्य परत" (middle layer) है जो विशिष्ट सेल्स पर ज़ूम करना जानती है।
  • उपयोगकर्ताओं के लिए: यदि आप सर्वोत्तम परिणाम चाहते हैं, तो "चेन-ऑफ-थॉट" प्रॉम्प्टिंग का उपयोग करें (AI को अपने चरणों को समझाने के लिए कहें) और इस बात की ज्यादा चिंता न करें कि आपकी तालिका का प्रारूप थोड़ा अव्यवस्थित है। AI इसे समझ लेगा।

संक्षेप में, AI एक बहुत ही व्यवस्थित जासूस है जो जानता है कि कब पूरे अपराध स्थल को देखना है और कब मामले को सुलझाने वाले एकल सुराग पर ध्यान केंद्रित करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →