← नवीनतम पेपर
📊 statistics

The two clocks and the innovation window: When and how generative models learn rules

यह शोध पत्र जनरेटिव मॉडल्स में एक महत्वपूर्ण "नवाचार विंडो" (innovation window) की पहचान करता है जो अमूर्त नियमों को सीखने (τrule\tau_{\mathrm{rule}}) और प्रशिक्षण डेटा को याद करने (τmem\tau_{\mathrm{mem}}) के बीच के लौकिक अंतराल द्वारा परिभाषित है, और यह प्रदर्शित करता है कि इस विंडो का अस्तित्व और अवधि डिफ्यूजन और ऑटोरेग्रेसिव दोनों आर्किटेक्चर में डेटासेट के आकार, नियम की जटिलता और मॉडल की क्षमता पर निर्भर करती है।

मूल लेखक: Binxu Wang, Emma Lucia Byrnes Finn, Bingbin Liu

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Binxu Wang, Emma Lucia Byrnes Finn, Bingbin Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चित्रों के आधार पर चित्र बनाना सिखा रहे हैं, जो नियमों के एक सख्त सेट का पालन करते हैं, जैसे कि "प्रत्येक चित्र में लाल बिंदुओं की संख्या सम (even) होनी चाहिए।" आप रोबोट को अध्ययन करने के लिए उदाहरण चित्रों का एक सीमित स्टैक देते हैं।

यह शोध पत्र रोबोट के मस्तिष्क के भीतर चल रहे एक दिलचस्प खींचतान की जांच करता है जो सीखते समय होता है। लेखकों ने पाया कि रोबोट एक साथ सब कुछ नहीं सीखता है; इसके बजाय, यह दो अलग-अलग घड़ियों पर काम करता है जो अलग-अलग गति से चलती हैं।

यहाँ उन दो घड़ियों और उनके बीच की "जादुई खिड़की" की कहानी दी गई है।

दो घड़ियाँ

घड़ी 1: "नियम सीखने वाला" (τrule)
यह घड़ी मापती है कि रोबोट अंततः खेल के तर्क (logic) को कब समझ जाता है।

  • क्या होता है: शुरुआत में, रोबोट केवल अनुमान लगा रहा होता है। फिर, अचानक, यह ऐसे चित्र बनाने लगता है जो "लाल बिंदुओं की सम संख्या" के नियम का पूरी तरह से पालन करते हैं। इसने अमूर्त अवधारणा (abstract concept) को सीख लिया है।
  • इसे क्या धीमा करता है: नियम जितना जटिल होगा, यह घड़ी उतनी ही धीमी चलेगी। यदि नियम में केवल 2 के बजाय 10 बिंदुओं के समूहों की जाँच करना शामिल है, तो रोबक को इसे समझने में बहुत अधिक समय लगेगा। यह एक जटिल शतरंज की रणनीति सीखने बनाम प्यादे की चाल सीखने जैसा है।

घड़ी 2: "फोटोकॉपी करने वाला" (τmem)
यह घड़ी मापती है कि रोबोट कब अपने प्रशिक्षण स्टैक में देखे गए सटीक चित्रों की नकल करना शुरू कर देता है।

  • क्या होता है: अंततः, रोबोट रचनात्मक होने के बजाय केवल उन्हीं विशिष्ट उदाहरणों की नकल करने लगता है जो आपने उसे दिए थे। यदि आप उससे एक नया चित्र मांगते हैं, तो वह अपनी मेमोरी से एक पुराना चित्र निकाल लेता है।
  • इसे क्या नियंत्रित करता है: आश्चर्यजनक रूप से, इस घड़ी को इससे फर्क नहीं पड़ता कि नियम कितना कठिन है। इसके बजाय, यह इस बात से संचालित होती है कि आपने रोबोट को कितने उदाहरण दिए। आपके द्वारा दिए गए प्रशिक्षण चित्रों का स्टैक जितना बड़ा होगा, रोबोट को उन्हें कॉपी करना शुरू करने में उतना ही अधिक समय लगेगा। यह एक ऐसे छात्र की तरह है जिसे किसी विशिष्ट पुस्तक को शब्द-दर-शब्द याद करने से पहले एक पूरी लाइब्रेरी पढ़नी पड़ती है।

"नवाचार की खिड़की" (The Innovation Window)

यहाँ सबसे रोमांचक हिस्सा है: अंतराल (The Gap)।

घड़ी 1 और घड़ी 2 के बीच एक विशिष्ट अवधि होती है।

  • घड़ी 1 से पहले: रोबोट भ्रमित है और गलतियाँ कर रहा है।
  • घड़ी 1 और घड़ी 2 के बीच (नवाचार की खिड़की): रोबोट नियमों को पूरी तरह से समझता है और नए, वैध चित्र बना सकता है जिन्हें उसने पहले कभी नहीं देखा है। वह वास्तव में रचनात्मक हो रहा है।
  • घड़ी 2 के बाद: रोबोट रचनात्मक होना बंद कर देता है और केवल प्रशिक्षण डेटा की फोटोकॉपी करने लगता है।

इस "नवाचार की खिड़की" का आकार आपके सेटअप पर निर्भर करता है:

  • यदि नियम बहुत कठिन है: रोबोट नियम सीखने (घड़ी 1 धीमी) में इतना लंबा समय लेता है कि वह तर्क को समझने से पहले ही उदाहरणों को याद करना (घड़ी 2) शुरू कर देता है। खिड़की बंद हो जाती है, और रोबोट कभी भी रचनात्मक नहीं हो पाता।
  • यदि आप इसे अधिक डेटा देते हैं: रोबोट को याद करने में अधिक समय लगता है (घड़ी 2 धीमी हो जाती है), लेकिन वह नियम को उसी गति से सीखता है। यह खिड़की को चौड़ा कर देता है, जिससे रोबोट को कॉपी करना शुरू करने से पहले रचनात्मक होने के लिए अधिक समय मिलता है।

रोबोट का मस्तिष्क कैसे बदलता है

लेखकों ने यह देखने के लिए रोबोट के "मस्तिष्क" (विशेष रूप से उस गणितीय परिदृश्य/landscape को जो वह बनाता है) के अंदर झाँका कि क्या हो रहा था:

  1. प्रारंभिक चरण: रोबोट वैध पिक्सेल जैसे दिखने वाले बिंदु बनाना सीखता है (Boolean cube के करीब पहुँचना)।
  2. नियम सीखना: रोबोट सभी सही उत्तरों के लिए अपने मस्तिष्क में एक "घाटी" (valley) बनाता है। कोई भी चित्र जो नियमों का पालन करता है, उसे इस घाटी में खींचा जाता है।
  3. याद करना (Memorization): बाद में, रोबोट विशेष रूप से प्रशिक्षण में देखे गए सटीक चित्रों के लिए एक गहरी घाटी खोदता है। ये विशिष्ट चित्र "चिपचिपे" आकर्षण केंद्र (sticky attractors) बन जाते हैं। यदि रोबोट किसी प्रशिक्षण चित्र के पास से शुरू होता है, तो वह उस सटीक छवि की नकल करने में खिंच जाता है, भले ही आस-पास अन्य वैध चित्र मौजूद हों।

क्या यह अन्य रोबोटों पर लागू होता है?

हाँ! लेखकों ने इसे दो अलग-अलग प्रकार के AI पर परखा:

  • डिफ्यूजन मॉडल (जैसे इमेज जनरेटर): वे इस दो-घड़ी वाले पैटर्न का पालन करते हैं।
  • ऑटोरिग्रेसिव मॉडल (जैसे टेक्स्ट जनरेटर): वे भी इस पैटर्न का पालन करते हैं, हालांकि वे थोड़ा तेज़ी से सीखते और याद करते हैं।

उन्होंने सुडोकू और गिनती के नियमों जैसे अन्य पहेलियों पर भी इसका परीक्षण किया। वही दो घड़ियाँ दिखाई दीं: पहले रोबोट तर्क सीखता है, फिर वह याद करना शुरू करता है।

मुख्य निष्कर्ष (The Bottom Line)

जेनरेटिव AI केवल एक जादुई बॉक्स नहीं है जो समय के साथ स्मार्ट होता जाता है। यह विशिष्ट चरणों से गुजरता है। पहले यह नियमों को सीखता है, फिर इसके पास सच्ची रचनात्मकता का एक संक्षिप्त क्षण होता है, और अंत में, यह याद रखने (memorization) में स्थिर हो जाता है।

यदि आप चाहते हैं कि एक AI अभिनव (innovative) हो, तो आपको यह सुनिश्चित करना होगा कि "नियम सीखने" की घड़ी, "याद करने" की घड़ी शुरू होने से पहले समाप्त हो जाए। यदि नियम बहुत कठिन हैं, तो रोबोट उन्हें समझने के बजाय आपके उदाहरणों की नकल करना शुरू कर देगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →