← नवीनतम पेपर
📊 statistics

Adaptivity Under Realizability Constraints: Comparing In-Context and Agentic Learning

यह शोध पत्र प्रदर्शित करता है कि जबकि अनुकूलनशीलता (adaptivity) कभी भी सन्निकटन प्रदर्शन (approximation performance) में बाधा नहीं डालती है, अनुकूल (एजेंटिक) लर्निंग बनाम निश्चित-क्वेरी (इन-कॉन्टेक्स्ट) लर्निंग का विशिष्ट लाभ चार अलग-अलग परिदृश्यों में भिन्न होता है, जो इस बात पर निर्भर करता है कि संचालन निर्बाध हैं या ReLU न्यूरल नेटवर्क यथार्थवादिता द्वारा बाधित हैं।

मूल लेखक: Anastasis Kratsios, A. Martina Neuman, Philipp Petersen

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anastasis Kratsios, A. Martina Neuman, Philipp Petersen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बड़े, अंधेरे कमरे के अंदर छिपे एक गुप्त मानचित्र (secret map) का अनुमान लगाने की कोशिश कर रहे हैं। आपके पास फर्श पर अपनी टॉर्च चमकाने के लिए सीमित संख्या में "फ्लैशलाइट्स" (queries) हैं ताकि आप लेआउट का पता लगा सकें। यह पेपर इन फ्लैशलाइट्स का उपयोग करने के दो तरीकों की तुलना करता है:

  1. "निश्चित योजना" (In-Context Learning): आप कमरे में प्रवेश करने से पहले ही तय कर लेते हैं कि आप कहाँ टॉर्च चमकाएंगे। आप जो देखते हैं उसके आधार पर अपना निर्णय नहीं बदल सकते।
  2. "अनुकूलनशील एजेंट" (Adaptive Agent): आप एक टॉर्च जलाते हैं, देखते हैं कि आपने क्या देखा, और फिर उस जानकारी के आधार पर तय करते हैं कि अगली टॉर्च कहाँ जलानी है।

लेखक एक सरल प्रश्न पूछते हैं: क्या "अनुकूलनशील एजेंट" हमेशा बेहतर होता है? और अधिक महत्वपूर्ण बात यह है कि क्या यह लाभ तब भी बना रहता है जब हम एजेंट को एक विशिष्ट, सीमित प्रकार के "मस्तिष्क" (एक ReLU न्यूरल नेटवर्क, जो आधुनिक AI का एक मानक निर्माण खंड है) के साथ बनाने के लिए मजबूर करते हैं?

यहाँ उनके निष्कर्षों का रोजमर्रा की उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

दो दुनियाएँ

यह पेपर इन विधियों का परीक्षण दो अलग-अलग "ब्रह्मांडों" में करता है:

  • "जादुई दुनिया" (Unrestricted): सीखने वाला कोई भी गणितीय फलन (mathematical function) हो सकता है जिसकी कल्पना की जा सकती है। इसके पास अनंत कंप्यूटिंग शक्ति है और कोई सीमा नहीं है कि यह कैसे सोचता है।
  • "वास्तविक दुनिया" (Realizable): सीखने वाले को एक विशिष्ट, सीमित टूलकिट (ReLU न्यूरल नेटवर्क) का उपयोग करना होगा। यह लेगो ब्रिक्स (Lego bricks) का उपयोग करके एक रोबोट बनाने जैसा है, न कि जादू से।

चार परिदृश्य

लेखकों ने पाया कि "क्या अनुकूलनशील सीखना बेहतर है?" का उत्तर पूरी तरह से कार्य (task) और टूलकिट पर निर्भर करता है। उन्होंने चार अलग-अलग परिणाम खोजे:

1. "कोई अंतर नहीं" वाला परिदृश्य

उपमा: कल्पना कीजिए कि आप एक एकल, सरल संख्या (जैसे "5") का अनुमान लगाने की कोशिश कर रहे हैं।
परिणाम: चाहे आप पहले से अनुमान लगाने की योजना बनाएं या जैसे-जैसे आगे बढ़ें वैसे-वैसे अनुकूलित हों, इससे कोई फर्क नहीं पड़ता। यदि कार्य पर्याप्त सरल है, तो एक निश्चित योजना उतनी ही अच्छी तरह काम करती है जितनी कि एक अनुकूलनशील योजना।
पेपर का दावा: बहुत सरल कार्यों (single-task families) के लिए, अनुकूलनशीलता (adaptivity) कोई लाभ नहीं देती है।

2. "अनुकूलनशीलता जीतती है, सीमाओं के साथ भी" वाला परिदृश्य

उपमा: कल्पना कीजिए कि "Whac-A-Mole" खेल है जहाँ चुहिया (mole) विशिष्ट छेदों के एक क्रम में छिपती है।

  • निश्चित योजना: आपको पहले से ही सभी छेदों का अनुमान लगाना होगा। यदि आप क्रम चूक जाते हैं, तो आप विफल हो जाते हैं।
  • अनुकूलनशील एजेंट: आप एक छेद पर प्रहार करते हैं, देखते हैं कि चुहिया कहाँ से निकली, और तुरंत जानते हैं कि अगला प्रहार कहाँ करना है।
    परिणाम: अनुकूलनशील एजेंट आसानी से जीत जाता है। भले ही आप एजेंट को "लेगो मस्तिष्क" (ReLU network) का उपयोग करने के लिए मजबूर करें, फिर भी वह चरण-दर-चरण क्रम को समझने में सक्षम है।
    पेपर का दावा: "cubical-path" कार्यों के लिए, अनुकूलनशीलता स्पष्ट रूप से अधिक जानकारी प्रकट करती है, और यह लाभ तब भी बना रहता है जब सीखने वाले को मानक न्यूरल नेटवर्क तक सीमित किया जाता है।

3. "अनुकूलनशीलता केवल सीमाओं के साथ जीतती है" वाला परिदृश्य

उपमा: कल्पना कीजिए कि एक खजाने की खोज (treasure hunt) है जहाँ मानचित्र एक ऐसे कोड में लिखा गया है जिसे तोड़ना अविश्वसनीय रूप से कठिन है (एक "कठिन गणना" या hard computation)।

  • जादुई दुनिया: निश्चित योजना और अनुकूलनशील एजेंट दोनों "जादुगत" हैं। वे दोनों कोड को तुरंत तोड़ सकते हैं। इसलिए, वे बराबरी पर हैं।
  • वास्तविक दुनिया (Lego Brain): अब, "निश्चित योजना" वाला सीखने वाला फंस जाता है। उसे पूरे जटिल कोड को अपने दिमाग में रखना होगा ताकि पहेली को हल किया जा सके। उसका "लेगो मस्तिष्क" कोड को रखने के लिए बहुत छोटा है, इसलिए वह विफल हो जाता है।
    • हालाँकि, अनुकूलनशील एजेंट चतुर है। उसे पूरा कोड अपने साथ रखने की आवश्यकता नहीं है। वह सीधे उत्तर को अनलॉक करने वाली एक "चाबी" (एक विशिष्ट स्थान) खोजने के लिए अपनी पहली कुछ फ्लैशलाइट्स का उपयोग कर सकता है। वह आंतरिक रूप से कठिन गणित करने की आवश्यकता को दरकिनार कर देता है।
      परिणाम: जादुई दुनिया में, वे समान हैं। वास्तविक दुनिया में, अनुकूलनशील एजेंट जीतता है क्योंकि वह सही सवाल पूछकर कठिन काम को "आउटसोर्स" कर सकता है, जबकि निश्चित योजनाकार को वह कठिन काम स्वयं करना पड़ता है।
      पेपर का दावा: "pointed-value" कार्यों के लिए, अनुकूलनशीलता केवल तभी लाभ पैदा करती है जब सीखने वाले को एक सीमित न्यूरल नेटवर्क द्वारा प्रतिबंधित किया जाता है।

4. "अनुकूलनशीलता सीमाओं के तहत हार जाती है" वाला परिदृश्य

उपमा: कल्पना कीजिए कि "Where's Waldo?" का खेल है, लेकिन वाल्डो (Waldo) का स्थान चित्र के अन्य पात्रों पर आधारित एक सुपर-कॉम्प्लेक्स फॉर्मूला द्वारा निर्धारित होता है।

  • जादुई दुनिया: अनुकूलनशील एजेंट चित्र को देखता है, अपने अनंत मस्तिष्क में वह सुपर-कॉम्प्लेक्स फॉर्मूला चलाता है, वाल्डो का सटीक स्थान पाता है, और वहां टॉर्च चमकाता है। वह जीत जाता है।
  • वास्तविक दुनिया (Lego Brain): अनुकूलनशील एजेंट उस फॉर्मूले को चलाने की कोशिश करता है ताकि वाल्डो को ढूंढा जा सके। लेकिन उसका "लेगो मस्तिष्क" उस फॉर्मूले की गणना करने के लिए बहुत छोटा है। वह फंस जाता है।
    • निश्चित योजना वाला सीखने वाला, यह महसूस करते हुए कि वह फॉर्मूले की गणना नहीं कर सकता, बस अपनी टॉर्च हर जगह बेतरतीब ढंग से (या एक निश्चित पैटर्न में) चमकाता है। चूंकि अनुकूलनशील एजेंट भी फंस गया है और वाल्डो को नहीं ढूंढ पा रहा है, इसलिए वे दोनों समान रूप से विफल होते हैं।
      परिणाम: जादुई दुनिया में, अनुकूलनशीलता एक बड़ी जीत है। वास्तविक दुनिया में, यह लाभ गायब हो जाता है क्योंकि अनुकूलनशील एजेंट "अगला कदम" इतनी तेज़ी से कंप्यूट करने में असमर्थ है।
      पेपर का दावा: "address-spike" कार्यों के लिए, अनुकूलनशीलता सिद्धांत में एक बड़ा लाभ प्रदान करती है, लेकिन यह लाभ तब समाप्त हो जाता है जब सीखने वाले को मानक न्यूरल नेटवर्क द्वारा प्रतिबंधित किया जाता है क्योंकि "अगला कदम" कंप्यूट करना बहुत कठिन होता है।

मुख्य निष्कर्ष

पेपर निष्कर्ष निकालता है कि अनुकूलनशीलता कोई जादुई समाधान (magic bullet) नहीं है।

  • कभी-कभी यह मदद करती है, कभी-कभी नहीं।
  • महत्वपूर्ण बात यह है कि सीमाएं (constraints) मायने रखती हैं। जो चीज़ एक सैद्धांतिक, असीमित दुनिया में एक सुपरपावर की तरह दिखती है, वह वास्तविक, सीमित उपकरणों (जैसे वर्तमान AI मॉडल) के साथ एक कमजोरी या एक बेकार विशेषता बन सकती है।

लेखक दिखाते हैं कि "आप प्रश्न कैसे पूछते हैं" (अनुकूलनशीलता) और "उत्तर देने के लिए आप किन उपकरणों का उपयोग करते हैं" (न्यूरल नेटवर्क की सीमाएं) के बीच की अंतःक्रिया एक जटिल परिदृश्य बनाती है जहाँ सबसे अच्छी रणनीति समस्या के आधार पर बदल जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →