← नवीनतम पेपर
🤖 machine learning

LLMTabBench: Evaluating LLMs on Binary Tabular Classification From Zero to Few Shots

यह शोध पत्र LLMTabBench प्रस्तुत करता है, जो यह दर्शाता है कि जहाँ लार्ज लैंग्वेज मॉडल्स (LLMs) ज़ीरो-शॉट टैबुलर क्लासिफिकेशन में अत्यधिक प्रतिस्पर्धी हो सकते हैं, वहीं पूर्व ज्ञान के साथ संघर्ष और एक विशिष्ट डेटा जटिलता सीमा से परे प्रभावशीलता में गिरावट के कारण अतिरिक्त फ्यू-शॉट उदाहरणों के साथ उनका प्रदर्शन अक्सर कम हो जाता है।

मूल लेखक: Daria Grushina, Kseniia Kuvshinova, Alina Kostromina, Aziz Temirkhanov, Mile Mitrovic, Dmitry Simakov

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daria Grushina, Kseniia Kuvshinova, Alina Kostromina, Aziz Temirkhanov, Mile Mitrovic, Dmitry Simakov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान विश्वकोश (encyclopedia) है जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। यह आपका लार्ज लैंग्वेज मॉडल (LLM) है। अब, कल्पना कीजिए कि आप इस विश्वकोश को संख्याओं से भरी एक स्प्रेडशीट देते हैं और उससे एक विशिष्ट परिणाम की भविष्यवाणी करने के लिए कहते हैं (जैसे, "क्या यह ऋण स्वीकृत किया जाएगा?" या "क्या इस रोगी को कोई बीमारी है?")।

यह शोध पत्र, LLMTabBench, यह परीक्षण करने का एक विशाल रिपोर्ट कार्ड है कि ये अत्यंत बुद्धिमान विश्वकोश स्प्रेडशीट की पहेलियों को कितनी अच्छी तरह हल कर सकते हैं जब उनके पास अध्ययन करने के लिए बहुत कम उदाहरण होते हैं।

यहाँ उनके निष्कर्षों का विवरण दिया गया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. "ज़ीरो-शॉट" का आश्चर्य: वह विशेषज्ञ जिसे अध्ययन मार्गदर्शिका की आवश्यकता नहीं है

आमतौर पर, कंप्यूटर को कोई समस्या हल करने के लिए सिखाने के लिए, आप उसे सैकड़ों उदाहरण दिखाते हैं (जैसे एक शिक्षक द्वारा छात्र को 100 अभ्यास गणित समस्याएँ दिखाना)। इसे "फ्यू-शॉट" लर्निंग कहा जाता है।

शोधकर्ताओं ने पूछा: क्या होगा अगर हम AI को शून्य उदाहरण दें? केवल समस्या का विवरण और स्प्रेडशीट की एक पंक्ति।

  • परिणाम: आश्चर्यजनक रूप से, बड़े, बुद्धिमान AI मॉडल (जैसे Qwen3-14B और GPT-4o-mini) उन मॉडलों के लगभग बराबर प्रदर्शन करते हैं जिन्हें 16 अभ्यास उदाहरण दिए गए थे।
  • उपमा: यह एक अनुभवी शेफ से केवल रेसिपी का शीर्षक पढ़कर एक नया व्यंजन बनाने के लिए कहने जैसा है, बिना कभी सामग्री को चखे। वे लगभग उतना ही अच्छा खाना बनाने में सफल रहे जितना कि यदि उन्हें पहले कुछ नमूना व्यंजन चखने के लिए दिए गए होते।

2. "बहुत अधिक जानकारी" का जाल

शोधकर्ताओं ने सोचा, "यदि शून्य उदाहरण अच्छे हैं, तो क्या 100 उदाहरण बेहतर होंगे?"

  • परिणाम: हमेशा नहीं। कभी-कभी, AI को बहुत अधिक उदाहरण देने से वास्तव में उसका प्रदर्शन खराब हो जाता है।
  • उपमा: कल्पना कीजिए कि आप अपने मित्र के गुप्त पासवर्ड का अनुमान लगाने की कोशिश कर रहे हैं।
    • शून्य उदाहरण: आप उनकी आदतों के बारे में अपने सामान्य ज्ञान (पूर्व ज्ञान) का उपयोग करते हैं और सही अनुमान लगाते हैं।
    • बहुत अधिक उदाहरण: आपको उनके द्वारा पहले उपयोग किए गए 64 रैंडम पासवर्डों की एक सूची दी जाती है। यह सूची आपको भ्रमित कर देती है। आप सोचने लगते हैं, "रुको, शायद पैटर्न वैसा नहीं है जैसा मैंने सोचा था!" और आप गलत हो जाते हैं।
    • सबक: कभी-कभी, AI का "अंतर्ज्ञान" (जो उसने प्रशिक्षण के दौरान सीखा है) उदाहरणों की एक भ्रमित करने वाली सूची से बेहतर होता है।

3. "जटिलता की सीमा": जब पहेली बहुत कठिन हो जाती है

शोधकर्ताओं ने कठिनाई के बढ़ते स्तरों वाली पहेलियाँ बनाईं, जो सरल पैटर्न से लेकर डेटा के जटिल, उलझे हुए जाल तक थीं।

  • परिणाम: AI सरल पहेलियों में बहुत अच्छा है। लेकिन जैसे ही पहेली एक निश्चित "जटिलता सीमा" (complexity threshold) को पार करती है, AI एक दीवार से टकरा जाता है। उसे अधिक उदाहरण देने से कोई मदद नहीं मिलती।
  • उपमा: एक बच्चे के जूते के फीते बांधना सीखने के बारे में सोचें।
    • आसान स्तर: वे एक या दो प्रयासों के साथ सीख सकते हैं।
    • कठिन स्तर: यदि आप उनसे रुबिक क्यूब (Rubik's cube) हल करने के लिए कहते हैं, तो कोई भी अभ्यास (फ्यू-शॉट उदाहरण) उनकी मदद नहीं करेगा यदि कार्य उनके वर्तमान मस्तिष्क के लिए मौलिक रूप से बहुत जटिल है। AI भी जटिल डेटा के साथ इसी तरह की दीवार से टकरा जाता है।

4. "सस्ता शॉर्टकट": पढ़ना बनाम लिखना

AI मॉडल आमतौर पर शब्द-दर-शब्द टेक्स्ट जेनरेट करके "सोचते" हैं (जैसे निबंध लिखना)। यह धीमा और महंगा है। शोधकर्ताओं ने एक "शॉर्टकट" का परीक्षण किया जहाँ AI पूरे वाक्य को लिखे बिना उत्तर की संभावना (probability) को देखता है।

  • परिणाम: मध्यम और बड़े मॉडलों के लिए, यह "शॉर्टकट" शब्द-दर-शब्द विधि जितने ही सटीक थे, लेकिन यह 4.5 गुना तेज़ और बहुत सस्ता था।
  • उपमा:
    • जेनरेशन (धीमा): AI यह समझाने के लिए पूरा निबंध लिखता है कि वह क्यों सोचता है कि उत्तर "हाँ" है।
    • फॉरवर्ड स्कोरिंग (तेज़): AI बस उत्तर कुंजी पर एक नज़र डालता है और "हाँ" फुसफुसाता है।
    • निष्कर्ष: बड़े मॉडलों के लिए, फुसफुसाना निबंध लिखने जितना ही सटीक है, लेकिन इससे आप बहुत सारा समय और पैसा बचाते हैं।

5. "मेमोरी" की जाँच: क्या उन्होंने नकल की?

एक बड़ी चिंता यह थी: "क्या AI ने अपने प्रशिक्षण डेटा से परीक्षण प्रश्नों को रट लिया है?"

  • परिणाम: शोधकर्ताओं ने इस बात का परीक्षण करने के लिए नए डेटा का उपयोग किया जो AI के प्रशिक्षित होने के बाद जारी किया गया था। AI ने फिर भी अच्छा प्रदर्शन किया।
  • उपमा: यह एक छात्र को उस विषय पर परीक्षा देने जैसा है जो उसके स्नातक होने के बाद प्रकाशित हुई पाठ्यपुस्तक में शामिल है। यदि वह फिर भी पास हो जाता है, तो उसने वास्तव में अवधारणाओं को समझा है, उसने केवल पुरानी किताब को रटा नहीं है। AI वास्तविक तर्क (reasoning) का उपयोग कर रहा है, न कि केवल नकल कर रहा है।

सारांश

यह शोध पत्र हमें बताता है कि बड़े AI मॉडल बिना किसी बड़े प्रशिक्षण सेट की आवश्यकता के स्प्रेडशीट की समस्याओं को हल करने में आश्चर्यजनक रूप से अच्छे हैं। हालांकि, उनकी सीमाएं हैं:

  1. उन्हें बहुत अधिक न खिलाएं: बहुत अधिक उदाहरण उन्हें भ्रमित कर सकते हैं।
  2. कठिनाई पर नज़र रखें: यदि डेटा बहुत जटिल है, तो अधिक उदाहरणों से कोई मदद नहीं मिलेगी।
  3. शॉर्टकट का उपयोग करें: बड़े मॉडलों के लिए, तेज़ "फुसफुसाने" वाला तरीका धीमे "निबंध" वाले तरीके जितना ही अच्छा है और पैसे बचाता है।

यह शोध पत्र निष्कर्ष निकालता है कि हालांकि ये मॉडल कम-डेटा वाली स्थितियों में शक्तिशाली उपकरण हैं, हमें सर्वोत्तम परिणाम प्राप्त करने के लिए इस बात के प्रति सावधान रहने की आवश्यकता है कि हम उनसे प्रश्न कैसे पूछते हैं और उन्हें कितना डेटा दिखाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →