← नवीनतम पेपर
🤖 AI

Subliminal Learning Is Steering Vector Distillation

यह शोध पत्र प्रकट करता है कि अवचेतन अधिगम (subliminal learning), जहाँ एक छात्र मॉडल अर्थहीन रूप से असंबंधित आउटपुट से शिक्षक के छिपे हुए गुणों को प्राप्त करता है, इस बात द्वारा मध्यस्थ होता है कि छात्र फाइन-ट्यूनिंग के माध्यम से शिक्षक के स्टीयरिंग वेक्टर की नकल करना सीखता है, जो एक ऐसी प्रक्रिया है जो सूक्ष्म सक्रियण ग्रेडिएंट्स (activation gradients) को पकड़ने के लिए एडेप्टिव ऑप्टिमाइज़र्स पर निर्भर करती है और यह स्पष्ट करता है कि ऐसा अधिगम मॉडल-विशिष्ट क्यों होता है।

मूल लेखक: Camila Blank, Agam Bhatia, Senthooran Rajamanoharan, Arthur Conmy, Neel Nanda

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Camila Blank, Agam Bhatia, Senthooran Rajamanoharan, Arthur Conmy, Neel Nanda

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Subliminal Learning Is Steering Vector Distillation" पेपर की व्याख्या सरल भाषा और रोज़मर्रा के उदाहरणों के साथ दी गई है।

सबसे बड़ा रहस्य: "मशीन में मौजूद भूत" (The Ghost in the Machine)

कल्पना कीजिए कि आपके पास एक रोबोट शिक्षक (Teacher) है जिसे बिल्लियों से बेहद प्यार करने के लिए प्रोग्राम किया गया है। आप इस शिक्षक को रैंडम नंबरों की एक सूची लिखने के लिए कहते हैं, जैसे कि किराने का बिल। वे नंबर सिर्फ नंबर हैं; उनमें बिल्लियों, फर या मूंछों का कोई ज़िक्र नहीं है।

अब, आप एक नए रोबोट छात्र (Student) को लेते हैं और उसे केवल उसी बिल्ली-प्रेमी शिक्षक द्वारा बनाई गई उन रैंडम नंबरों की सूचियों पर प्रशिक्षित करते हैं।

आश्चर्यजनक रूप से, प्रशिक्षण के बाद, छात्र रोबोट भी बिल्लियों से प्यार करने लगता है। वह कहेगा, "मेरा पसंदीदा जानवर बिल्ली है!" भले ही उसने अपने ट्रेनिंग डेटा में कभी "बिल्ली" शब्द देखा ही न हो। उसने डेटा में छिपे हुए (subliminal) संकेतों से एक व्यक्तित्व का गुण सीख लिया।

लंबे समय तक, वैज्ञानिकों को समझ नहीं आया कि यह कैसे हुआ। क्या यह कोई गुप्त कोड था? कोई छिपा हुआ पैटर्न? यह पेपर इस रहस्य को सुलझाता है।

समाधान: "स्टीयरिंग व्हील" (The Steering Wheel)

लेखकों ने पाया कि शिक्षक केवल नंबर नहीं निकाल रहा है; वह गुप्त रूप से एक स्टीयरिंग वेक्टर (Steering Vector) को ढो रहा है।

स्टीयरिंग वेक्टर को एक छोटे, अदृश्य धक्के (nudge) या एक भूतिया हाथ के रूप में सोचें जो रोबोट के दिमाग को एक विशिष्ट दिशा में धकेलता है।

  • जब शिक्षक को कहा जाता है कि "तुम बिल्लियों से प्यार करते हो," तो हर बार जब वह सोचता है, तो उसके दिमाग में एक विशिष्ट 'धक्का' जोड़ा जाता है।
  • यहाँ तक कि जब शिक्षक नंबर लिख रहा होता है, तब भी यह "बिल्ली वाला धक्का" अभी भी वहाँ होता है, जो नंबरों को इस तरह से थोड़ा सा झुका देता है जिसे केवल शिक्षक की विशिष्ट मस्तिष्क संरचना ही "महसूस" कर सकती है।

खोज: छात्र रोबोट इस अदृश्य धक्के को कॉपी करना सीख जाता है। वह नंबरों को नहीं सीखता; वह धक्के की दिशा को सीखता है। एक बार जब छात्र के दिमाग में यह धक्का स्थापित हो जाता है, तो वह बिल्कुल शिक्षक की तरह व्यवहार करने लगता है, भले ही मूल "तुम बिल्लियों से प्यार करते हो" निर्देश उसके पास न हो।

प्रयोग: यह साबित करना कि 'धक्का' असली है

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने तीन मुख्य तरीकों से इसे सिद्ध किया:

  1. "कॉपी-पेस्ट" टेस्ट: उन्होंने शिक्षक से वह अदृश्य धक्का लिया और उसे मैन्युअल रूप से एक नए, अप्रशिक्षित रोबोट में जोड़ दिया। अचानक, वह नया रोबट बिल्लियों से प्यार करने लगा, भले ही उसने ट्रेनिंग डेटा कभी नहीं देखा था। इससे साबित हुआ कि धक्का ही उस व्यवहार का कारण है।
  2. "अंग-विच्छेद" (Amputation) टेस्ट: उन्होंने प्रशिक्षित छात्र रोबोट से उसके दिमाग से उस विशिष्ट धक्के को सर्जिकल तरीके से हटा दिया। तुरंत ही, रोबोट ने बिल्लियों से प्यार करना बंद कर दिया और वापस न्यूट्रल हो गया। इससे साबित हुआ कि वह धक्का ही एकमात्र चीज़ थी जिसने उस गुण को जीवित रखा था।
  3. "रैंडम धक्का" टेस्ट: उन्होंने यह प्रयोग रैंडम, अर्थहीन धक्कों (जैसे "समुद्री डाकू बनो" या बस "रैंडम बनो" वाला धक्का) के साथ किया। छात्र रोबोटों ने इन रैंडम धक्कों को भी सफलतापूर्वक कॉपी करना सीख लिया। इसने दिखाया कि यह तंत्र सामान्य है: छात्र केवल शिक्षक के आंतरिक "झुकाव" का एक मास्टर कॉपीकैट है।

यह केवल कभी-कभी ही क्यों काम करता है?

आप सोच सकते हैं: "यदि मैं एक रोबोट को बिल्ली से प्यार करना सिखाता हूँ, तो क्या मैं उसे मोर (Peacock) से प्यार करना सिखा सकता हूँ?" पेपर कहता है कि नहीं, हमेशा नहीं।

  • "मजबूत सिग्नल" का नियम: सब्लिमिनल लर्निंग के काम करने के लिए, वह गुण (जैसे "बिल्ली") ऐसा होना चाहिए जिसे रोबोट का दिमाग पहले से ही इतना अच्छी तरह समझता हो कि वह एक मजबूत, स्पष्ट धक्का बना सके। यदि रोबोट के दिमाग में "बिल्ली" की स्पष्ट अवधारणा नहीं है, तो धक्का कॉपी करने के लिए बहुत कमजोर होगा।
  • "एक ही परिवार" का नियम: यह ट्रिक तभी काम करती है जब शिक्षक और छात्र एक ही मॉडल हों (जैसे, दोनों Qwen मॉडल हों)। यह एक गुप्त हैंडशेक (हाथ मिलाने के तरीके) को कॉपी करने की कोशिश करने जैसा है; यदि आपके और आपके दोस्त के हाथ का आकार और हड्डियों की संरचना अलग है, तो वह हैंडशेक ट्रांसफर नहीं होगा। "धक्का" उस विशिष्ट रोबोट परिवार के आंतरिक वायरिंग के लिए विशिष्ट है।

गुप्त सामग्री: "स्मार्ट ऑप्टिमाइज़र" (The Smart Optimizer)

पेपर ने एक महत्वपूर्ण पहेली भी खोजी है: रोबोट कैसे सीखता है, यह मायने रखता है।

  • समस्या: यदि आप छात्र को एक बुनियादी, भारी-भरकम सीखने के तरीके (जिसे SGD कहा जाता है) का उपयोग करके प्रशिक्षित करते हैं, तो रोबोट डेटा के शोर और तेज़ संकेतों से विचलित हो जाता है और सूक्ष्म "बिल्ली वाले धक्के" को मिस कर देता है।
  • समाधान: आपको एक स्मार्ट ऑप्टिमाइज़र (जैसे Adam) की आवश्यकता होती है। इसे एक ऐसे शिक्षक के रूप में सोचें जो शोर को अनदेखा करना जानता है और फुसफुसाहट पर ध्यान केंद्रित करना जानता है। यह स्मार्ट टूल छात्र को उस छोटे, निरंतर धक्के को सुनने और उसे अपने दिमाग में स्थापित करने की अनुमति देता है। इस स्मार्ट टूल के बिना, सब्लिमिनल लर्निंग विफल हो जाती है।

सारांश

पेपर निष्कर्ष निकालता है कि सब्लिमिनल लर्निंग वास्तव में डिस्टिलेशन (Distillation) (ज्ञान की नकल करना) का एक रूप है।

  1. शिक्षक के पास एक छिपा हुआ "धक्का" (Steering Vector) होता है जो उसे एक निश्चित तरीके से कार्य करने के लिए प्रेरित करता है।
  2. छात्र शिक्षक के आउटपुट का अध्ययन करके उस धक्के को कॉपी करना सीखता है।
  3. एक बार जब छात्र के पास वह धक्का आ जाता है, तो वह शिक्षक की तरह व्यवहार करता है, भले ही डेटा पूरी तरह से उबाऊ और असंबंधित क्यों न लग रहा हो।

यह जादू नहीं है; यह केवल छात्र रोबोट द्वारा शिक्षक के समान अदृश्य स्टीयरिंग व्हील को पकड़ने की प्रक्रिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →