← नवीनतम पेपर
🤖 machine learning

Task diversity produces systematic transfer but inhibits continual reinforcement learning

यह शोध पत्र निरंतर सुदृढीकरण शिक्षण (continual reinforcement learning) के लिए एक GPU-त्वरित बेंचमार्क, बनयान (Banyan) को प्रस्तुत करता है, यह प्रदर्शित करने के लिए कि जबकि मानचित्र, वस्तु और निर्भरता अक्षों के साथ कार्य विविधता व्यक्तिगत वितरण परिवर्तनों (distribution shifts) के माध्यम से व्यवस्थित ज़ीरो-शॉट स्थानांतरण (zero-shot transfer) की सुविधा प्रदान करती है, यह अंततः दीर्घकालिक शिक्षण को बनाए रखने या परिवर्तनों की संख्या बढ़ने के साथ विनाशकारी विस्मृति (catastrophic forgetting) को रोकने में विफल रहती है।

मूल लेखक: Purab Seth, Neil Shah, Kunal Jha, Samuel J. Gershman, Max Kleiman-Weiner, Wilka Carvalho

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Purab Seth, Neil Shah, Kunal Jha, Samuel J. Gershman, Max Kleiman-Weiner, Wilka Carvalho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "बनयान" (Banyan) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

मुख्य विचार: AI के लिए एक "जिम"

कल्प Imagine कीजिए कि आप एक रोबोट को दुनिया का सबसे बेहतरीन समस्या-समाधानकर्ता (problem-solver) बनने के लिए प्रशिक्षित करना चाहते हैं। आपके पास दो विकल्प हैं:

  1. विशेषज्ञ (The Specialist): इसे केवल एक ही प्रकार की पहेली पर तब तक प्रशिक्षित करें जब तक कि यह उसमें महारत हासिल न कर ले।
  2. सामान्यज्ञ (The Generalist): इसे लाखों अलग-अलग पहेलियों वाले एक जिम में डाल दें, इस उम्मीद में कि यह "सीखना सीखने" का तरीका सीख जाएगा।

यह पेपर बनयान (Banyan) नामक एक नए "जिम" का परिचय देता है। यह एक वीडियो गेम वातावरण है जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि क्या होता है जब आप एक AI को बहुत बड़ी विविधता वाले कार्यों पर प्रशिक्षित करते हैं और फिर अचानक नियम बदल देते हैं।

शोधकर्ताओं जानना चाहते थे: क्या बहुत सारे विविध कार्यों पर प्रशिक्षण लेने से AI को दुनिया बदलने पर नया सीखने में मदद मिलती है, या वास्तव में इससे नुकसान होता है?

सेटअप: मिश्रण करने के तीन तरीके

बनयान में, एक "कार्य" (task) किसी विशिष्ट वस्तु को बनाने की एक रेसिपी की तरह है। शोधकर्ता विविधता पैदा करने के लिए स्वतंत्र रूप से तीन चीजों को बदल सकते हैं:

  1. मैप (लेआउट): कल्पना कीजिए कि घर का फ्लोर प्लान बदलना। दीवारें हिल जाती हैं, दरवाजे नई जगहों पर खुलते हैं, लेकिन लक्ष्य अभी भी रसोई से बेडरूम तक पहुँचना है।
  2. सामग्री (वस्तुएं): कल्पना कीजिए कि रेसिपी वही रहती है, लेकिन आप "मैदा" की जगह "रेत" या "पानी" की जगह "तेल" का उपयोग करते हैं। चरण (steps) वही हैं, लेकिन चीजें अलग हैं।
  3. रेसिपी संरचना (टोपोलॉजी): कल्पना कीजिए कि वास्तविक निर्देशों को बदलना। शायद आपको केक बनाना है, फिर उस पर फ्रॉस्टिंग करनी है, फिर उसे काटना है। या शायद आपको केक बनाना है, फिर उसे फ्रीज करना है, फिर पिघलाना है। चरणों का क्रम और जटिलता बदल जाती है।

शोधकर्ताओं ने इन परीक्षणों के लिए अरबों ऐसे संयोजन बनाए।

अच्छी खबर: "स्मूथ लैंडिंग" प्रभाव

शोधकर्ताओं ने पाया कि यदि उन्होंने AI को पहले बहुत अधिक विविधता पर प्रशिक्षित किया, तो जब उन्होंने कार्यों के एक नए सेट पर स्विच किया, तो कुछ शानदार हुआ।

उपमा: कल्पना कीजिए कि एक संगीतकार जिसने हर संभव की (key) में, हर संभव वाद्य यंत्र के साथ, और हर संभव शैली में अभ्यास किया है। यदि आप अचानक उन्हें एक नया गाना देते हैं जो उन्होंने पहले कभी नहीं देखा, तो वे ठिठकते नहीं हैं। वे लगभग तुरंत उच्च स्तर पर उसे बजाना शुरू कर देते हैं।

पेपर में इसे सिस्टमैटिक ट्रांसफर (Systematic Transfer) कहा गया है।

  • जब AI को विविध मैप्स, वस्तुओं या रेसिपीज़ पर प्रशिक्षित किया गया, तो कार्य बदलने पर उसे शून्य से "फिर से सीखने" की आवश्यकता नहीं पड़ी।
  • उसने नए कार्य के साथ एक उच्च स्कोर के साथ शुरुआत की, ठीक वहीं से जहाँ उसने पुराने कार्य को छोड़ा था।
  • यह तब भी काम कर गया जब AI एक "पॉलिसी" लर्नर (जैसे शतरंज खिलाड़ी) या एक "वैल्यू" लर्नर (जैसे सट्टेबाजी की संभावनाओं का अनुमान लगाने वाला जुआरी) था।

बुरी खबर: "ओवरवेल्म्ड शेफ" (अभिभूत शेफ) प्रभाव

यहाँ एक विरोधाभास है। जबकि विविधता ने AI को नए कार्य को अच्छी तरह से शुरू करने में मदद की, लेकिन बहुत अधिक विविधता ने इसे समय के साथ बेह बेहतर होने से रोक दिया।

उपमा: कल्पना कीजिए कि एक शेफ को हर दिन 1,000 अलग-अलग प्रकार के व्यंजन पकाने के लिए मजबूर किया जाता है।

  • पहला दिन: वे हर चीज़ में माहिर हैं क्योंकि उन्होंने सब कुछ देखा है।
  • 100वां दिन: वे अभी भी ठीक-ठाक हैं, लेकिन वे किसी भी विशिष्ट व्यंजन में महारत हासिल नहीं कर पा रहे हैं। वे इतालवी, जापानी और मैक्सिकन के बीच स्विच करने के इतने आदी हो गए हैं कि वे किसी नई फ्रांसीसी तकनीक को पूरी तरह से सीखने के लिए गहराई से ध्यान केंद्रित नहीं कर पाते।

प्रयोग में, जब शोधकर्ताओं ने विविधता को अधिकतम स्तर तक बढ़ाया:

  • AI अभी भी नए कार्य में आसानी से स्विच कर सकता था (वह क्रैश नहीं हुआ)।
  • लेकिन, वह सुधार करना बंद कर गया। वह एक "सीलिंग" (छत) पर पहुँच गया।
  • नए कार्यों में बेहतर होने के बजाय, AI उन पुराने कार्यों में बेहतर होता रहा जिन्हें वह भूल चुका था। यह ऐसा था जैसे शेफ उन पुरानी रेसिपीज़ में बेहतर हो रहा है जिन्हें वह पहले से जानता था, लेकिन नई रेसिपीज़ को सीखने में विफल रहा।

निष्कर्ष: ट्रेड-ऑफ (समझौता)

पेपर एक आश्चर्यजनक निष्कर्ष के साथ समाप्त होता है: विविधता एक दोधारी तलवार है।

  • कम विविधता: AI जब कार्य बदलते हैं तो धीरे-धीरे सीखता है, लेकिन अंततः वह नई चीजों में बहुत अच्छा हो जाता है।
  • उच्च विविधता: AI नए बदलावों के प्रति तुरंत अनुकूलित हो जाता है (पहले कदम के लिए महान), लेकिन वह "फँस" जाता है और लंबे समय तक चलने वाले बदलावों के क्रम में कौशल को और बेहतर नहीं कर पाता।

शोधकर्ता सुझाव देते हैं कि जब एक AI एक साथ बहुत सारी अलग-अलग चीजें देखता है, तो वह समस्या के "सामान्य आकार" को सीख लेता है लेकिन विशिष्ट विवरणों में विशेषज्ञता हासिल करने में विफल रहता है। वह "सबका थोड़ा-थोड़ा जानकार" (jack-of-all-trades) बन जाता है लेकिन किसी का भी पूर्ण स्वामी (master of none) नहीं, और लंबे समय में, यह उसे नई चुनौतियों में महारत हासिल करने से रोकता है।

सारांश

  • बनयान (Banyan) अरबों अलग-अलग कार्यों पर AI का परीक्षण करने का एक उपकरण है।
  • विविधता मदद करती है ताकि AI बिना गिरे किसी भी नई स्थिति में प्रवेश कर सके (सिस्टमैटिक ट्रांसफर)।
  • बहुत अधिक विविधता AI की नई चुनौतियों की एक लंबी श्रृंखला में सुधार करने की क्षमता को नुकसान पहुँचाती है। यह AI को एक पठार (plateau) पर पहुँचा देती है।

बनाकर बेहतर AI बनाने का सबक केवल यह नहीं है कि "उस पर अधिक डेटा डाल दें।" यह विविधता के सही संतुलन को खोजने के बारे में है ताकि AI खुद को अभिभूत हुए बिना और अपनी वृद्धि को रोके बिना अनुकूलित होना सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →