← नवीनतम पेपर
🤖 machine learning

Investigation into In-Context Learning Capabilities of Transformers

यह शोध पत्र गॉसियन-मिश्रण बाइनरी वर्गीकरण (Gaussian-mixture binary classification) के लिए ट्रांसफॉर्मर में इन-कॉन्टेक्स्ट लर्निंग का एक व्यवस्थित अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह पहचानता है कि इनपुट आयामीता (dimensionality), इन-कॉन्टेक्स्ट उदाहरणों की संख्या, और प्री-ट्रेनिंग कार्य की विविधता किस प्रकार सफलता दरों और बेनाइन ओवरफिटिंग (benign overfitting) के उद्भव को नियंत्रित करती है।

मूल लेखक: Rushil Chandrupatla, Leo Bangayan, Sebastian Leng, Arya Mazumdar

प्रकाशित 2026-04-29
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rushil Chandrupatla, Leo Bangayan, Sebastian Leng, Arya Mazumdar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Investigation into In-Context Learning Capabilities of Transformers" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी तस्वीर: "इंस्टेंट एक्सपर्ट" मशीन

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र है जिसने वर्षों तक हज़ारों अलग-अलग गणित के सवालों का अध्ययन किया है (यह pre-training चरण है)। आमतौर पर, यदि आप चाहते हैं कि यह छात्र किसी नए प्रकार का सवाल हल करे, तो आपको उसे उस नए सवाल के विशिष्ट नियम सिखाने में हफ़्तों बिताने होंगे।

हालाँकि, ट्रांसफॉर्मर्स (Transformers - जो ChatGPT जैसे टूल्स के पीछे के AI मॉडल हैं) के पास एक सुपरपावर है जिसे In-Context Learning (ICL) कहा जाता है। यह ठीक वैसा ही है जैसे परीक्षा से ठीक पहले छात्र को उस नए सवाल के कुछ उदाहरणों वाली एक 'चीट शीट' थमा देना। छात्र उन उदाहरणों को देखता है, तुरंत पैटर्न को समझ लेता है, और बिना किसी नए सबक या "री-ट्रेनिंग" के टेस्ट के सवाल को हल कर देता है।

यह शोध पत्र पूछता है: यह चीट शीट वास्तव में कैसे काम करती है? कब यह छात्र को परीक्षा में सफल होने में मदद करती है, और कब यह उसे भ्रमित कर देती है?


प्रयोग: "नियम पहचानो" का खेल

शोधकर्ताओं ने इस परीक्षण के लिए एक नियंत्रित खेल तैयार किया। उन्होंने ऋण आवेदनों या मेडिकल रिकॉर्ड जैसे वास्तविक दुनिया के डेटा का उपयोग नहीं किया। इसके बजाय, उन्होंने Gaussian Mixture Models की एक कृत्रिम दुनिया बनाई।

उपमा (Analogy):
कल्पना कीजिए कि दो समूहों के लोग एक विशाल मैदान (Dimension) में खड़े हैं।

  • समूह A (लाल शर्ट वाले) एक क्लस्टर (झुंड) में खड़े हैं।
  • समूह B (नीली शर्ट वाले) दूसरे क्लस्टर में खड़े हैं।
  • "सिग्नल स्ट्रेंथ" (Signal Strength) यह है कि दोनों समूह एक-दूसरे से कितनी दूर खड़े हैं। यदि वे दूर हैं, तो उन्हें पहचानना आसान है। यदि वे कोहरे में आपस में मिले हुए हैं, तो पहचानना कठिन है।
  • "नॉइज़" (Noise) उन लोगों की तरह है जिन्होंने ऐसी टोपी पहनी है जिससे वे गलत समूह के लग रहे हैं।

AI का काम कुछ लोगों को देखना (In-Context Examples) और यह अनुमान लगाना है कि एक नए, अनदेखे व्यक्ति का संबंध किस समूह से है।

तीन मुख्य प्रश्न

शोधकर्ताओं ने यह देखने के लिए तीन विशिष्ट चरों (variables) का परीक्षण किया कि वे AI के प्रदर्शन को कैसे बदलते हैं:

1. मैदान का आकार (Dimension)

  • सेटअप: उन्होंने मैदान का आकार एक छोटे कमरे (50 डायमेंशन) से बदलकर एक विशाल स्टेडियम (1,000 डायमेंशन) कर दिया।
  • निष्कर्ष:
    • एक छोटे कमरे में, समूहों को देखना आसान है।
    • एक विशाल स्टेडियम में, पैटर्न को देखना कठिन हो जाता है क्योंकि वहाँ अधिक "खाली स्थान" और भ्रम (शोर) की अधिक गुंजाइश होती है।
    • समाधान: यदि आप समूहों को एक-दूसरे से और दूर खड़ा कर दें (यानी Signal-to-Noise Ratio बढ़ा दें) ताकि वे स्टेडियम के आकार के अनुकूल हों, तो AI पूरी तरह से सटीक प्रदर्शन करता है।
    • सीख: बड़े, जटिल सवाल असंभव नहीं हैं, लेकिन उन्हें हल करने के लिए आपको एक मजबूत "सिग्नल" (स्पष्ट उदाहरण) की आवश्यकता होती है।

2. चीट शीट का आकार (Sequence Length)

  • सेटअप: उन्होंने चीट शीट पर दिए गए उदाहरणों की संख्या बदली, केवल 5 उदाहरणों से लेकर 80 उदाहरणों तक।
  • निष्कर्ष:
    • अधिक उदाहरण होने से AI को बेहतर अनुमान लगाने में मदद मिली।
    • हालाँकि, एक बार जब AI के पास कुछ उदाहरण हो गए, तो अधिक उदाहरण जोड़ने से वह तेजी से सीखना नहीं सीखा; इसने बस उसे टेस्ट शुरू करने के लिए एक उच्च आत्मविश्वास स्तर दिया।
    • सीख: थोड़ा सा संदर्भ (context) आमतौर पर विचार समझने के लिए पर्याप्त होता है, लेकिन एक बड़ी चीट शीट आपको एक बेहतर शुरुआत देती है।

3. अभ्यास के सवालों की विविधता (Batch Size)

  • सेटअप: उन्होंने AI ने प्रशिक्षण के दौरान कितने अलग-अलग "खेलों" का अभ्यास किया (50 कार्यों से लेकर 2,000 कार्यों तक) इसे बदला।
  • निष्कर्ष:
    • विभिन्न प्रकार के कार्यों पर अभ्यास करने से AI की सामान्यीकरण (generalizing) करने की क्षमता बहुत बेहतर हो गई।
    • सीख: प्रशिक्षण जितना विविध होगा, AI उतनी ही बेहतर तरीके से चलते-फिरते नए नियमों को समझ पाएगा।

"बेनाइन ओवरफिटिंग" (Benign Overfitting) का रहस्य

यह इस शोध पत्र का सबसे दिलचस्प हिस्सा है।

उपमा (Analogy):
कल्पना कीजिए कि शिक्षक छात्र को एक चीट शीट देता है, लेकिन शीट पर 20% उत्तर गलत हैं (लेबल उलट दिए गए हैं)।

  • क्लासिकल ओवरफिटिंग (Classical Overfitting): छात्र गलत उत्तर रट लेता है और परीक्षा में फेल हो जाता है।
  • अंडरफिटिंग (Underfitting): छात्र गलत उत्तरों से भ्रमित हो जाता है और कुछ भी सीखने में विफल रहता है।
  • बेनाइन ओवरफिटिंग (Benign Overfitting): छात्र चीट शीट के गलत उत्तरों को याद रखता है (वह जानता है कि शीट कहती है "लाल" जबकि वास्तव में वह "नीला" है), लेकिन फिर भी वह नए टेस्ट प्रश्न के लिए सही उत्तर बताने में सफल रहता है!

निष्कर्ष:
शोधकर्ताओं ने पाया कि यह "जादुई ट्रिक" (Benign Overfitting) विशिष्ट परिस्थितियों में होती है:

  1. उच्च सिग्नल स्ट्रेंथ (High Signal Strength): दोनों समूहों (लाल बनाम नीला) को एक-दूसरे से इतना दूर खड़ा होना चाहिए कि AI अभी भी वास्तविक पैटर्न को देख सके, भले ही चीट शीट गड़बबड़ हो।
  2. कॉन्टेक्स्ट बनाम क्वेरी (Context vs. Query): यदि टेस्ट प्रश्न में गलत लेबल है, तो AI संघर्ष करता है। लेकिन यदि केवल चीट शीट में गलत लेबल हैं, तो AI अक्सर शोर को अनदेखा कर सकता है और नए प्रश्न पर सही उत्तर दे सकता है।
  3. खतरा क्षेत्र (The Danger Zone): यदि समूह एक-दूसरे के बहुत करीब हैं (कम सिग्नल) या बिना पर्याप्त अलगाव के मैदान बहुत विशाल है, तो "बेनाइन ओवरफिटिंग" टूट जाती है, और AI पूरी तरह विफल हो जाता है।

वास्तविक दुनिया के मॉडलों का परीक्षण (RQ3)

अंत में, शोधकर्ताओं ने इस सिद्धांत का परीक्षण वास्तविक, प्रसिद्ध AI मॉडलों (जैसे GPT-4o-mini और Gemini) पर किया ताकि यह देखा जा सके कि उनके सरल गणितीय खेल के नियम वास्तविक दुनिया में लागू होते हैं या नहीं।

निष्कर्ष:
इन मॉडलों के काम करने के तरीके में एक अजीब विभाजन है:

  • वे एक नए प्रश्न के उत्तर की भविष्यवाणी करने (Generalization) में बहुत अच्छे हैं।
  • वे कभी-कभी प्रॉम्प्ट में देखे गए उदाहरणों को दोहराने (Memorization/Reconstruction) में खराब होते हैं।

उपमा (Analogy):
यह एक ऐसे छात्र की तरह है जो एक बिल्कुल नए गणित के सवाल को पूरी तरह से हल कर सकता है क्योंकि उसने अवधारणा (concept) को समझ लिया है, लेकिन यदि आप उससे उस उदाहरण के विशिष्ट नंबरों को सुनाने के लिए कहें जो आपने अभी उसे दिखाया था, तो वह नंबरों को गलत बता सकता है। उसने नियम सीखा है, लेकिन उसने कहानी को पूरी तरह से याद नहीं किया है।

सारांश निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि In-Context Learning एक शक्तिशाली उपकरण है, लेकिन यह एक नाजुक संतुलन पर निर्भर करता है:

  1. ज्यामिति (Geometry) मायने रखती है: डेटा को स्पष्ट रूप से संरचित होना चाहिए (अच्छा अलगाव)।
  2. सिग्नल (Signal) मायने रखता है: उदाहरणों को शोर को काटने के लिए पर्याप्त मजबूत होना चाहिए।
  3. संदर्भ (Context) मायने रखता है: आपको लाखों उदाहरणों की आवश्यकता नहीं है, लेकिन आपको सही मात्रा में स्पष्ट सिग्नल की आवश्यकता है।

शोधकर्ताओं ने सटीक रूप से मानचित्रित किया कि यह "इंस्टेंट लर्निंग" कब काम करती है और कब विफल होती है, यह दिखाते हुए कि भले ही मॉडल शोर वाले या गलत उदाहरणों को याद कर लें, फिर भी वे अविश्वसनीय रूप से स्मार्ट और सटीक हो सकते हैं—बशर्ते अंतर्निहित डेटा स्पष्ट हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →