← नवीनतम पेपर
💬 NLP

Comparing Specialised Small and General Large Language Models on Text Classification: 100 Labelled Samples to Achieve Break-Even Performance

यह अध्ययन प्रदर्शित करता है कि विशेषीकृत छोटे भाषा मॉडल (small language models) औसतन केवल 100 लेबल वाले नमूनों का उपयोग करके टेक्स्ट वर्गीकरण कार्यों पर सामान्य बड़े भाषा मॉडलों के साथ प्रदर्शन समानता या श्रेष्ठता प्राप्त कर सकते हैं, हालांकि आवश्यक नमूना आकार कार्य की विशेषताओं के आधार पर काफी भिन्न होता है और प्रदर्शन भिन्नता को ध्यान में रखने पर काफी बढ़ जाता है।

मूल लेखक: Branislav Pecher, Ivan Srba, Maria Bielikova

प्रकाशित 2026-01-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Branislav Pecher, Ivan Srba, Maria Bielikova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को मानव भाषा समझने के लिए सिखाने की कोशिश कर रहे हैं, विशेष रूप से टेक्स्ट को श्रेणियों में वर्गीकृत करने के लिए (जैसे यह तय करना कि मूवी रिव्यू "अच्छा" है या "बुरा")। आपके पास चुनने के लिए दो मुख्य उपकरण हैं:

  1. "सामान्यज्ञ" दिग्गज (The "Generalist" Giant): एक विशाल, अत्यंत बुद्धिमान AI (जैसे एक लार्ज लैंग्वेज मॉडल) जिसने लगभग पूरा इंटरनेट पढ़ लिया है। यह अविश्वसनीय रूप से शक्तिशाली है लेकिन इसे चलाने के लिए बहुत अधिक बिजली की आवश्यकता होती है। आप इसे कुछ उदाहरण देकर या एक साधारण निर्देश देकर अपना काम करने के लिए कह सकते हैं, बिना इसे कुछ नया सिखाए।
  2. "विशेषज्ञ" छोटा मॉडल (The "Specialist" Small Model): एक छोटा, सस्ता AI जिसे आप विशेष रूप से अपने एक कार्य के लिए प्रशिक्षित करते हैं। यह कम जानकारी के साथ शुरू होता है, लेकिन आप इसे लेबल किए गए उदाहरण दिखाकर "सिखा" सकते हैं।

बड़ा सवाल जिसका यह पेपर उत्तर देता है वह है: आपको "विशेषज्ञ" को दिखाने के लिए कितने उदाहरणों की आवश्यकता है ताकि वह केवल "सामान्यज्ञ" से काम करने के बजाय उससे बेहतर हो जाए?

यहाँ उनके निष्कर्षों का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

1. "ब्रेक-ईवन" बिंदु: 100-उदाहरण का नियम

"सामान्यज्ञ" को एक विश्व प्रसिद्ध शेफ के रूप में सोचें जो कुछ भी बना सकता है यदि आप उसे बस एक रेसिपी (प्रॉम्प्ट) दे दें। "विशेषज्ञ" एक स्थानीय रसोइया है जिसे आपके विशिष्ट व्यंजन के लिए प्रशिक्षित करने की आवश्यकता है।

शोधकर्ताओं ने पाया कि आपको प्रशिक्षकों की पूरी सेना को काम पर रखने की आवश्यकता नहीं है। औसतन, आपको विशेषज्ञ को केवल लगभग 100 उदाहरण (लेबल किए गए नमूने) दिखाने की आवश्यकता है ताकि वह विश्व प्रसिद्ध शेफ जितना अच्छा या उससे भी बेहतर खाना बना सके।

  • पेंच (The Catch): यह संख्या "व्यंजन" (कार्य) के आधार पर बदलती है।
    • यदि कार्य सरल है (जैसे समाचार को 14 अलग-अलग श्रेणियों में छाँटना), तो 100 उदाहरण पर्याप्त हैं।
    • यदि कार्य कठिन है (जैसे एक सरल "हाँ/नहीं" प्रश्न या जटिल व्याकरण को समझना), तो विशेषज्ञ को सामान्यज्ञ की बराबरी करने के लिए हजारों उदाहरणों की आवश्यकता हो सकती है।

2. "पासे फेंकने" की समस्या (Variance)

कल्पना कीजिए कि आप जनरल शेफ को 10 बार भोजन पकाने के लिए कहते हैं। वह हर बार काफी सुसंगत (consistent) भोजन बनाता है। अब, कल्पना कीजिए कि आप उसी 10 रेसिपी के साथ विशेषज्ञ शेफ को 10 बार प्रशिक्षित करते हैं। कभी-कभी वे एक उत्कृष्ट कृति बनाते हैं; अन्य समय में वे टोस्ट जला देते हैं। यह असंगति वेरिएंस (variance) कहलाती है।

पेपर ने पाया कि यदि आप केवल औसत परिणाम देखते हैं, तो 100 उदाहरण एक जादुई संख्या लगती है। लेकिन यदि आप चाहते हैं कि विशेषज्ञ हमेशा अच्छा काम करे (उन खराब "जले हुए टोस्ट" वाले दिनों को ध्यान में रखते हुए), तो आपको बहुत अधिक रूढ़िवादी होने की आवश्यकता है।

  • रियलिटी चेक: जब आप इस यादृच्छिकता (randomness) को ध्यान में रखते हैं, तो आपको आवश्यक उदाहरणों की संख्या औसतन 100% से 200% बढ़ जाती है। इसलिए, 100 उदाहरणों के बजाय, आपको यह गारंटी देने के लिए कि विशेषज्ञ लगातार जनरल को हरा देगा, 200 से 300 उदाहरणों की आवश्यकता हो सकती है।
  • कुछ बहुत ही कठिन मामलों में, विश्वसनीय होने के लिए विशेषज्ञ को 3,000% अधिक उदाहरणों की आवश्यकता हो सकती है!

3. बड़ा होना हमेशा बेहतर नहीं होता

एक आम धारणा है कि "बड़ा ही बेहतर है।" यदि आपके पास एक बड़ा "सामान्यज्ञ" शेफ (एक बड़ा मॉडल) है, तो उन्हें अधिक बुद्धिमान और सुसंगत होना चाहिए, है ना?

  • निष्कर्ष: आवश्यक नहीं। शोधकर्ताओं ने पाया कि बड़े मॉडल हमेशा बेहतर प्रदर्शन नहीं करते या अधिक सुसंगत नहीं रहते। कभी-कभी, एक मध्यम आकार का मॉडल एक विशाल मॉडल की तुलना में बेहतर काम करता है।
  • "क्वांटाइजेशन" (Quantization) का तरीका: आप इन विशाल मॉडलों को सिकोड़ सकते हैं (जैसे एक उच्च-रिज़ॉल्यूशन वाली फोटो को छोटी फ़ाइल में कंप्रेस करना) ताकि बिजली बचाई जा सके। पेपर ने पाया कि यह "सिकुड़ना" (4-बिट क्वांटाइजेशन) उनके खाना बनाने के तरीके या उनकी निरंतरता को बहुत कम प्रभावित करता है। इसलिए, यदि आप बिजली बचाने के लिए पैसा खर्च नहीं करना चाहते हैं, तो आप बिना प्रदर्शन खोए सुरक्षित रूप से "सिकुड़े हुए" संस्करणों का उपयोग कर सकते हैं।

4. अपना शेफ कैसे चुनें (सिफारिशें)

उनके प्रयोगों के आधार पर, यहाँ व्यावहारिक सलाह दी गई है:

  • सामान्यज्ञ (Zero-Shot) का उपयोग करें यदि: आपको एक त्वरित प्रोटोटाइप की आवश्यकता है, आपके पास लेबल किया गया डेटा लगभग नहीं है, या कार्य नया टेक्स्ट बनाने (जैसे कहानी लिखना) के बारे में है न कि केवल उसे छाँटने के बारे में।
  • विशेषist (Fine-Tuning) का उपयोग करें यदि: आपके पास पर्याप्त डेटा (लगभग 100+ उदाहरण) है और कंप्यूटर चलाने के लिए सीमित बजट है। एक छोटा मॉडल भी विशाल मॉडल को हरा सकता है यदि आप उसे पर्याप्त प्रशिक्षण उदाहरण दें।
  • इंस्ट्रक्शन-ट्यूनिंग (Instruction-Tuning) का उपयोग करें यदि: आपके पास कंप्यूटिंग पावर के लिए बड़ा बजट है। यह एक मध्य मार्ग है जहाँ आप सामान्यज्ञ को विशेष रूप से आपके कार्य के लिए निर्देशों का पालन करना सिखाते हैं। यह प्रदर्शन और डेटा दक्षता का सबसे अच्छा संतुलन प्रदान करता है।

निचोड़ (The Bottom Line)

आपको एक विशाल, सामान्य AI को हराने के लिए एक छोटे, विशिष्ट AI को प्रशिक्षित करने के लिए विशाल डेटासेट की आवश्यकता नहीं है। लगभग 100 उदाहरण अक्सर पर्याप्त होते हैं। हालांकि, क्योंकि AI थोड़ा अप्रत्याशित हो सकता है (जैसे पासे फेंकना), आपको यह सुनिश्चित करने के लिए कि छोटा मॉडल हर बार जीतेगा, उस संख्या का दोगुना या तिगुना एकत्र करने की योजना बनानी चाहिए। और बड़े मॉडलों के "सिकुड़े हुए" संस्करणों का उपयोग करने के बारे में चिंता न करें; वे उतना ही अच्छा काम करते हैं और बहुत अधिक ऊर्जा बचाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →