← नवीनतम पेपर
💬 NLP

MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining

MachineLearningLM एक निरंतर प्रीट्रेनिंग फ्रेमवर्क है जो सामान्य-उद्देश्य वाले LLMs को लाखों स्ट्रक्चरल कॉज़ल मॉडल्स को सिंथेसाइज करने और ट्री-आधारित रणनीतियों को डिस्टिल करने के माध्यम से मशीन लर्निंग कार्यों के लिए मजबूत मेनी-शॉट इन-कॉन्टेक्स्ट लर्निंग क्षमताओं से लैस करता है, जिससे वे सामान्य चैट क्षमताओं को बनाए रखते हुए टैबुलर क्लासिफिकेशन पर मजबूत बेसलाइन्स से बेहतर प्रदर्शन करने में सक्षम होते हैं।

मूल लेखक: Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MACHINELEARNINGLM पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

🌟 मुख्य विचार: एक सामान्यज्ञ (Generalist) को विशेषज्ञ (Specialist) बनाना

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान और विद्वान विश्वविद्यालय के प्रोफेसर हैं (यह एक मानक Large Language Model या LLM है)। यह प्रोफेसर इतिहास, साहित्य और विज्ञान के बारे में सब कुछ जानते हैं। वे कविता लिख सकते हैं, तर्क संबंधी पहेलियाँ हल कर सकते हैं और आपके दिन के बारे में बातें कर सकते हैं।

हालाँकि, यदि आप इस प्रोफेसर को ग्राहकों के डेटा से भरी एक स्प्रेडशीट थमा दें और कहें, "यहाँ 500 उदाहरण दिए गए हैं कि किसने हमारा उत्पाद खरीदा; भविष्यवाणी करें कि अगला कौन खरीदेगा," तो प्रोफेसर को संघर्ष करना पड़ सकता है। वे पहले कुछ उदाहरणों के आधार पर अनुमान लगा सकते हैं, संख्याओं से भ्रमित हो सकते हैं, या बस हार मान सकते हैं क्योंकि उन्हें बिना कैलकुलेटर (ग्रेडिएंट डिसेंट) के "गणित का होमवर्क" करने की आदत नहीं है।

MACHINELEARNINGLM एक नया तरीका है जो इस प्रोफेसर को एक विशेषज्ञ समर इंटर्नशिप (summer internship) देता है। यह प्रोफेसर के मस्तिष्क या व्यक्तित्व को नहीं बदलता है; यह बस उन्हें ठीक इसी तरह के गणित के होमवर्क का भारी मात्रा में अभ्यास कराता है। परिणाम? प्रोफेसर एक विश्व स्तरीय डेटा विश्लेषक बन जाता है जो अभी भी कविता लिख सकता है और इतिहास के बारे में बात कर सकता है, लेकिन अब वह संख्याओं को पहले से कहीं बेहतर तरीके से प्रोसेस कर सकता है।


🛠️ उन्होंने इसे कैसे किया: तीन जादुई तरकीबें

शोधकर्ताओं ने मॉडल की सामान्य बुद्धिमत्ता को नुकसान पहुँचाए बिना इसे काम करने के योग्य बनाने के लिए तीन चतुर तरकीबों का उपयोग किया।

1. "अनंत अभ्यास प्रयोगशाला" (सिंथेटिक डेटा)

वास्तविक दुनिया की स्प्रेडशीट (जो अव्यवस्थित और सीमित होती हैं) खोजने के बजाय, उन्होंने लाखों नकली गणितीय समस्याओं को उत्पन्न करने के लिए एक वीडियो गेम सिम्युलेटर बनाया।

  • उपमा: एक उड़ान सिम्युलेटर (flight simulator) की कल्पना करें जो लाखों अलग-अलग मौसम के पैटर्न, इंजन की विफलता और रनवे की स्थितियाँ बनाता है। एक पायलट को तूफान में विमान उड़ाने के तरीके सीखने के लिए वास्तविक विमान उड़ाने की आवश्यकता नहीं है; उसे बस सिम्युलेटर में पर्याप्त बार उड़ने की आवश्यकता है।
  • पेपर की विधि: उन्होंने लाखों अद्वितीय, नकली डेटासेट बनाने के लिए "स्ट्रक्चरल कॉज़ल मॉडल्स" (SCM) का उपयोग किया। यह सुनिश्चित करता है कि मॉडल डेटा के नियमों को सीखता है, न कि केवल विशिष्ट उत्तरों को रटता है।

2. "स्मार्ट ट्यूटर" (रैंडम फॉरेस्ट टीचर)

एक मॉडल को शुरू से कठिन गणितीय समस्याओं पर प्रशिक्षित करना निराशाजनक हो सकता है और बुरी आदतें (जैसे रैंडम अंदाज़ा लगाना) पैदा कर सकता है। इसलिए, उन्होंने एक रैंडम फॉरेस्ट (एक क्लासिक, विश्वसनीय मशीन लर्निंग एल्गोरिदम) को एक "ट्यूटर" के रूप में उपयोग किया।

  • उपमा: एक छात्र की कल्पना करें जो गाड़ी चलाना सीख रहा है। शुरू में, वे अकेले गाड़ी नहीं चलाते; उनके बगल में एक ड्राइविंग इंस्ट्रक्टर होता है। इंस्ट्रक्टर कहता है, "यदि लाइट लाल है, तो रुकें।" छात्र इंस्ट्रक्टर की नकल करता है। एक बार जब छात्र को समझ आ जाता है, तो इंस्ट्रक्टर पीछे हट जाता है, और छात्र अपने आप गाड़ी चलाने लगता है।
  • पेपर की विधि: शुरुआती चरणों में, मॉडल को "ट्यूटर" के उत्तरों की नकल करने के लिए प्रशिक्षित किया गया था। इसने इसे एक ठोस आधार दिया। बाद में, इसे अपने आप समस्याओं को हल करने की अनुमति दी गई, लेकिन इसने उस मजबूत आधार को बनाए रखा।

3. "कॉम्पैक्ट सूटकेस" (टोकन-कुशल प्रॉम्प्टिंग)

LLMs की एक सीमा होती है कि वे एक बार में कितना टेक्स्ट पढ़ सकते हैं (उनका "कॉन्टेक्स्ट विंडो")। यदि आप उन्हें डेटा के 1,000 उदाहरण दिखाने की कोशिश करते हैं, तो टेक्स्ट बहुत लंबा हो जाता है, और मॉडल शुरुआत भूल जाता है।

  • उपमा: एक छोटे फोटो एल्बम में 1,000 फोटो फिट करने की कोशिश करें। यदि आप हर फोटो के नीचे एक लंबी कहानी लिखते हैं, तो आपके पास पन्ने कम पड़ जाएंगे। लेकिन यदि आप फोटो को एक सघन ग्रिड में प्रिंट करते हैं और कैप्शन के लिए एक संक्षिप्त कोड का उपयोग करते हैं, तो आप उसी स्थान में 1,000 फोटो फिट कर सकते हैं।
  • पेपर की विधि:
    • टेबुलर फॉर्मेट: "आय 50,000 है और नौकरी डॉक्टर है" लिखने के बजाय, उन्होंने 50000,Doctor लिखा। यह बहुत सारा स्थान बचाता है।
    • नंबर मैजिक: उन्होंने बिखरे हुए दशमलव (जैसे 12.3456) को सरल पूर्णांकों (जैसे 500) में बदल दिया। यह मॉडल को संख्याओं में बिंदुओं और स्लैश से भ्रमित होने से रोकता है।
    • बैचिंग: मॉडल से एक समय में एक व्यक्ति की भविष्यवाणी करने के लिए पूछने के बजाय, उन्होंने एक बार में 50 लोगों की भविष्यवाणी करने के लिए कहा। यह एक साथ 50 लोगों को दुकान तक ले जाने वाली बस की तरह है, न कि 50 अलग-अलग कारों की तरह।

🚀 क्या हुआ? (परिणाम)

जब उन्होंने इस नए "प्रोफेसर" (MACHINELEARNINGLM) का परीक्षण किया:

  1. "मेनी-शॉट" (Many-Shot) सुपरपावर: आमतौर पर, यदि आप LLMs को बहुत अधिक उदाहरण देते हैं, तो वे भ्रमित हो जाते हैं। लेकिन यह मॉडल जितने अधिक उदाहरण आप इसे देंगे, यह उतना ही स्मार्ट होता जाएगा।
    • उपमा: अधिकांश छात्र अभिभूत हो जाते हैं यदि आप उन्हें 100 अभ्यास प्रश्न देते हैं। यह छात्र केवल 10 के बजाय 1,000 प्रश्नों के साथ वास्तव में बेहतर प्रदर्शन करता है।
  2. दिग्गजों को पछाड़ना: इसने डेटा भविष्यवाणी कार्यों पर शीर्ष-स्तरीय मॉडलों (जैसे GPT-5-mini) को लगभग 15% से मात दी।
  3. कोई "ब्रेन डैमेज" नहीं: आमतौर पर, जब आप किसी मॉडल को किसी एक विशिष्ट चीज़ के लिए प्रशिक्षित करते हैं, तो वह अन्य चीजें करना भूल जाता है (जैसे बातचीत करना)। इस मॉडल ने अपनी सामान्य बुद्धिमत्ता बनाए रखी। यह पहले की तरह ही सामान्य ज्ञान परीक्षणों (MMLU) को पास करने में सक्षम था।

🧐 यह क्यों मायने रखता है?

अतीत में, यदि आप चाहते थे कि कोई AI स्प्रेडशीट का विश्लेषण करे, तो आपको उस विशिष्ट कार्य के लिए एक छोटा, विशेषीकृत रोबोट बनाना पड़ता था। यदि आप चाहते थे कि वह किसी अन्य स्प्रेडशीट का विश्लेषण करे, तो आपको एक नया रोबोट बनाना पड़ता था।

MACHINELEARNINGLM एक स्विस आर्मी नाइफ (Swiss Army Knife) की तरह है।

  • यह आपके दिन के बारे में आपसे बात कर सकता है।
  • यह एक कविता लिख सकता है।
  • और यह 1,000 पंक्तियों के डेटा को देख सकता है और भविष्य की भविष्यवाणी कर सकता है, वह भी बिना किसी कैलकुलेटर के जुड़े हुए।

यह साबित करता है कि सही प्रकार के अभ्यास (सिंथेटिक डेटा) और होमवर्क को व्यवस्थित करने के सही तरीके (टोकन दक्षता) के साथ, एक सामान्य AI अपनी आत्मा खोए बिना संख्याओं का मास्टर बन सकता है।

⚠️ कमी (सीमाएँ)

यह मॉडल "स्थिर" (static) डेटा (जैसे ग्राहक जानकारी का एक स्नैपशॉट) के लिए बेहतरीन है। यह समय-यात्रा (time-traveling) वाले डेटा (जैसे समय के साथ रुझानों के आधार पर स्टॉक की कीमतों की भविष्यवाणी करना) या रिग्रेशन (regression) (सटीक डॉलर राशि के बजाय श्रेणियों की भविष्यवाणी करना) के लिए पूरी तरह तैयार नहीं है। लेकिन वर्गीकरण (classification) कार्यों (हाँ/नहीं, बिल्ली/कुत्ता, खरीदें/न खरीदें) के विशाल बहुमत के लिए, यह एक गेम-चेंजर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →