← नवीनतम पेपर
🤖 machine learning

Distinct mechanisms underlying in-context learning in transformers

यह शोध पत्र डिस्क्रीट मार्कोव चेन पर प्रशिक्षित ट्रांसफॉर्मर में इन-कॉन्टेक्स्ट लर्निंग का एक पूर्ण यांत्रिक लक्षण वर्णन प्रदान करता है, जो विशिष्ट मल्टी-लेयर सबसर्किट्स द्वारा कार्यान्वित चार एल्गोरिद्मिक चरणों को प्रकट करता है और उन विशिष्ट डेटा विविधता थ्रेशोल्ड और प्रशिक्षण गतिकी की पहचान करता है जो मेमोराइजेशन और जनरलाइजेशन रणनीतियों के बीच संक्रमण को नियंत्रित करते हैं।

मूल लेखक: Cole Gibson, Wenping Cui, Gautam Reddy

प्रकाशित 2026-04-15
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cole Gibson, Wenping Cui, Gautam Reddy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट शेफ है। आमतौर पर, रोबोट को खाना बनाना सिखाने के लिए, आपको हर नए रेसिपी के लिए उसकी आंतरिक सेटिंग्स (इसके "पैरामीटर्स") को हफ्तों तक ट्यून करने में समय बिताना पड़ता है। यदि आप चाहते हैं कि वह इतालवी पास्ता बनाना सीखे, तो आपको उसे पास्ता के लिए प्रशिक्षित करना होगा। यदि आप चाहते हैं कि वह सुशी बनाए, तो आपको रुकना होगा, उसे फिर से प्रशिक्षित करना होगा और उसकी सेटिंग्स को फिर से ट्यून करना होगा।

लेकिन आधुनिक AI मॉडल, जिन्हें ट्रांसफॉर्मर (Transformers) कहा जाता है, के पास एक सुपरपावर है जिसे इन-कॉन्टेक्स्ट लर्निंग (ICL) कहते हैं। यदि आप सुशी बनाने का तरीका सीखने के लिए उससे ठीक पहले कुछ उदाहरण देते हैं, तो वह अपनी आंतरिक सेटिंग्स को बदले बिना तुरंत नियम समझ लेता है और सुशी बना सकता है। वह तुरंत सीख जाता है, बस आपके द्वारा दिए गए उदाहरणों को देखकर।

यह पेपर पूछता है: यह रोबोट वास्तव में यह कैसे करता है? क्या यह उदाहरणों को याद कर रहा है, या यह सामान्य नियमों को समझ रहा है? और क्या यह अलग-अलग स्थितियों के लिए अलग-अलग "ब्रेन सर्किट्स" (मस्तिष्क सर्किट) का उपयोग करता है?

लेखकों ने, जो प्रिंसटन के शोधकर्ता हैं, यह पता लगाने के लिए प्रयोगों की एक श्रृंखला चलाई कि इस रोबोट का मस्तिष्क वास्तव में कैसे काम करता है। उन्होंने पाया कि रोबोट के पास केवल एक तरह से सीखने का तरीका नहीं है; इसके पास चार अलग-अलग मोड (या चरण) हैं जिनके बीच वह बदलता रहता है, जो इस बात पर निर्भर करता है कि उसने पहले कितने अलग-अलग प्रकार के डेटा देखे हैं।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

रोबोट शेफ के चार मोड

कल्पना कीजिए कि रोबोट वाक्य में अगला शब्द (या रेसिपी का अगला कदम) बताने की कोशिश कर रहा है। वह यह चार तरीकों से कर सकता है:

  1. द गैंबलर (1-पॉइंट जनरलाइजेशन): रोबोट शब्दों के पूरे इतिहास को देखता है और उन सबसे आम शब्दों के आधार पर अगले शब्द का अनुमान लगाता है जिन्हें उसने अब तक देखा है। वह तत्काल संदर्भ (context) को अनदेखा कर देता है।
    • उपमा: आप ताश की गड्डी में अगले कार्ड का अनुमान केवल यह जानकर लगा रहे हैं कि पूरे डेक में कितने लाल और काले कार्ड बचे हैं, उस कार्ड को अनदेखा करते हुए जो आपने अभी देखा है।
  2. द पैटर्न स्पॉटर (2-पॉइंट जनरलाइजेशन): रोबोट तत्काल पिछले शब्द को देखता है और यह अनुमान लगाता है कि वे दो शब्द अपने प्रशिक्षण में कितनी बार एक साथ आए थे। यह भाषा के "व्याकरण" या "नियमों" को सीखता है।
    • उपमा: आप शब्द "टोस्ट" देखते हैं और अनुमान लगाते हैं कि अगला शब्द "बटर" होगा क्योंकि आपने अपने ट्रेनिंग डेटा में इस जोड़ी को लाखों बार देखा है। आप खेल के नियम सीख रहे हैं।
  3. द फाइल क्लर्क (1-पॉइंट मेमोराइजेशन): रोबोट को एहसास होता है, "रुको, शब्दों का यह विशिष्ट क्रम मेरी मेमोरी में मौजूद एक विशिष्ट फ़ाइल से संबंधित है।" वह यह पहचानने की कोशिश करता है कि यह विशिष्ट अनुक्रम (sequence) किस विशिष्ट डेटासेट (या कार्य) से आया है और उस विशिष्ट फ़ाइल के आंकड़ों को निकालता है।
    • उपमा: आप एक विशिष्ट लहजा सुनते हैं और तुरंत सोचते हैं, "आह, यह मेरे दोस्त बॉब के वॉयस नोट्स से है।" आप सामान्य अनुमान लगाना छोड़ देते हैं और बॉब की विशिष्ट आदतों को ढूँढते हैं।
  4. द सुपर-फाइल क्लर्क (2-पॉइंट मेमोराइजेशन): रोबोट विशिष्ट फ़ाइल की पहचान करता है और उस विशिष्ट फ़ाइल के नियमों के आधार पर अत्यधिक सटीक भविष्यवाणी करने के लिए तत्काल संदर्भ का उपयोग करता है।
    • उपमा: आप जानते हैं कि यह बॉब का वॉयस नोट है, और आप जानते हैं कि बॉब हमेशा "बटर" से पहले "टोस्ट" कहता है। आप 100% निश्चितता के साथ "बटर" की भविष्यवाणी करते हैं।

दो महत्वपूर्ण स्विच (Switches)

पेपर ने पाया कि रोबोट इन दो मुख्य कारकों के आधार पर इन मोड्स के बीच स्विच करता है: डेटा विविधता (Data Diversity) (उसे कितने अलग-अलग "फ़ाइलें" या कार्य चुनने हैं) और समय (Time) (प्रशिक्षण के दौरान कितना समय बीता है)।

स्विच 1: दौड़ (काइनेटिक कॉम्पिटिशन)

जब रोबोट के सामने कुछ अलग-अलग कार्य होते हैं (कम विविधता), तो उन्हें याद रखना तेज़ होता है। यह कुछ रेसिपी सीखने जैसा है; आप बस उन सभी को याद कर सकते हैं।

  • स्विच: जैसे-जैसे आप और अधिक रेसिपी जोड़ते हैं (अधिक डेटा विविधता), सब कुछ याद रखना बहुत धीमा हो जाता है।
  • परिणाम: रोबोट को एहसास होता है, "मैं इन सभी को याद नहीं कर सकता!" और अचानक वह "पैटर्न स्पॉटर" मोड (जनरलाइजेशन) में बदल जाता है। वह विशिष्ट फ़ाइलों को याद करना छोड़ देता है और खाना पकाने के सामान्य नियम सीखना शुरू कर देता है।
  • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। यदि केवल 5 प्रश्न हैं, तो वह उत्तर याद कर लेता है। यदि 1,000 प्रश्न हैं, तो वह याद करना बंद कर देता है और अवधारणाओं (concepts) को पढ़ना शुरू करता है ताकि वह किसी भी प्रश्न को हल कर सके।

स्विच 2: मेमोरी लिमिट (रिप्रेजेंटेशनल बॉटलनैक)

एक दूसरा सीमित स्तर भी है। भले ही रोबोट याद रखने की कोशिश करे, उसका "मस्तिष्क" (उसकी आंतरिक मेमोरी स्पेस) एक सीमित आकार का होता है।

  • स्विच: यदि आप रोबोट को बहुत अधिक अलग-अलग कार्य देते हैं (अत्यधिक उच्च विविधता), तो उसका "मस्तिष्क" उन सभी के लिए विशिष्ट "फ़ाइलें" रखने में सक्षम नहीं होता। "सुपर-फाइल क्लर्क" मोड टूट जाता है।
  • परिणाम: रोबोट "पैटर्न स्पॉटर" मोड में रहने के लिए मजबूर हो जाता है। वह अब याद रखने (memorization) पर भरोसा नहीं कर सकता क्योंकि उसके पास हर एक कार्य के विशिष्ट नियमों को स्टोर करने के लिए पर्याप्त जगह नहीं है।
  • उपमा: एक लाइब्रेरी की कल्पना करें। यदि आपके पास 10 किताबें हैं, तो आप प्रत्येक का कथानक याद कर सकते हैं। यदि आपके पास 10 मिलियन किताबें हैं, तो आपका मस्तिष्क हर एक की कहानी रखने में सक्षम नहीं होगा। आपको हर विशिष्ट कहानी को याद रखने के बजाय शैली (Genre) को समझने पर निर्भर रहना होगा।

गुप्त सामग्रियाँ: रोबोट इन सर्किट्स को कैसे बनाता है

लेखकों ने "सर्किट ट्रेसिंग" (रोबोट के मस्तिष्क के लिए एमआरआई की तरह) नामक तकनीक का उपयोग किया ताकि यह देखा जा सके कि नेटवर्क के कौन से हिस्से काम कर रहे हैं। उन्होंने पाया कि रोबोट दो विशेष "टूल्स" बनाता है:

  1. द इंडक्शन हेड (द पैटर्न स्पॉटर का टूल):

    • यह एक दो-चरणीय प्रक्रिया है। मस्तिष्क का पहला हिस्सा पिछले शब्द को देखता है और कहता है, "हे, मैंने यह शब्द पहले देखा है!" दूसरा हिस्सा इतिहास में पीछे देखता है कि उस शब्द के बाद आमतौर पर क्या आता है।
    • रूपक: यह एक जासूस की तरह है जो एक सुराग (वर्तमान शब्द) पाता है, अपने नोटबुक में पिछले मामलों की जाँच करता है जहाँ वह सुराग मिला था, और देखता है कि आगे क्या हुआ था।
  2. द टास्क रिकग्निशन हेड (द फाइल क्लर्क का टूल):

    • यह एक अधिक जटिल टूल है। रोबोट पूरे अनुक्रम को पढ़ता है, पैटर्न का औसत निकालता है, और एक एकल "समरी वेक्टर" (एक संक्षिप्त आईडी कार्ड) बनाता है जो कहता है, "यह कार्य संख्या 42 है।" फिर वह उस कार्य के विशिष्ट नियमों को निकालने के लिए इस आईडी कार्ड का उपयोग करता है।
    • रूपक: रोबोट एक पूरा पैराग्राफ पढ़ता है, उसे एक एकल "विषय टैग" में सारांशित करता है, और फिर उस टैग का उपयोग करके अपने फाइलिंग कैबिनेट में सही फोल्डर खोलता है।

यह क्यों मायने रखता है?

यह पेपर एक बड़ी बात है क्योंकि यह समझाता है कि AI कब याद करता है और कब सामान्यीकरण (generalize) करता है।

  • यह दिखाता है कि मेमोराइजेशन और जनरलाइजेशन केवल एक स्पेक्ट्रम नहीं हैं; वे दो अलग-अलग रणनीतियाँ हैं जिन्हें AI डेटा की मात्रा के आधार पर चुनता है।
  • यह प्रकट करता है कि जनरलाइजेशन कोई जादू नहीं है; यह एक विशिष्ट सर्किट (इंडक्शन हेड) है जिसे AI तब बनाता है जब डेटा की भारी मात्रा उसे ऐसा करने के लिए मजबूर करती है।
  • यह सुझाव देता है कि बेहतर AI बनाने के लिए, हमें इन "स्विचेस" को समझना होगा। यदि हम चाहते हैं कि AI सामान्यीकरण करे (नई चीजों के बारे में स्मार्ट बने), तो हमें इसे पर्याप्त विविध डेटा देना होगा ताकि यह "पैटर्न स्पॉटर" सर्किट बनाने के लिए मजबूर हो सके, लेकिन इतना अधिक भी नहीं कि यह उस दीवार से टकरा जाए जहाँ यह कुछ भी सीखने में असमर्थ हो जाए।

संक्षेप में: रोबोट केवल एक विशाल कैलकुलेटर नहीं है। यह एक गतिशील शिक्षार्थी है जो यह तय करने के लिए अपने मस्तिष्क में अलग-अलग "टूल्स" बनाता है कि विशिष्ट विवरणों को याद रखना आसान है या सामान्य नियम समझना। यह पेपर स्पष्ट रूप से बताता है कि वह यह चुनाव कब और कैसे करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →