← नवीनतम पेपर
🤖 machine learning

Sustained Gradient Alignment Mediates Subliminal Learning in a Multi-Step Setting: Evidence from MNIST Auxiliary Logit Distillation Experiment

यह शोध पत्र यह प्रदर्शित करता है कि निरंतर, दुर्बल रूप से सकारात्मक ग्रेडिएंट संरेखण (gradient alignment), मल्टी-स्टेप MNIST ऑक्जिलरी लॉजिट डिस्टिलेशन में अवचेतन अधिगम (subliminal learning) को मध्यस्थता प्रदान करता है, जो यह प्रकट करता है कि लिमिनल ट्रेनिंग (liminal training) जैसी शमन रणनीतियाँ अनपेक्षित लक्षण प्राप्ति को दबाने में विफल हो सकती हैं जब प्रथम-क्रम के ग्रेडिएंट चालक (first-order gradient drives) प्रभावी होते हैं।

मूल लेखक: Chayanon Kitkana, Shivam Arora

प्रकाशित 2026-04-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Chayanon Kitkana, Shivam Arora

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक युवा प्रशिक्षु (छात्र) को एक मास्टर शेफ (शिक्षक) की खाना पकाने की शैली की नकल करना सिखा रहे हैं। आमतौर पर, आप चाहते हैं कि प्रशिक्षु केवल उन्हीं विशिष्ट व्यंजनों को सीखे जो आप उन्हें देते हैं। लेकिन इस शोध पत्र में, शोधकर्ताओं ने एक चालाकी भरी समस्या की खोज की है: भले ही आप प्रशिक्षु को मुख्य व्यंजनों को अनदेखा करने और केवल "डमी" सामग्रियों (जैसे खाली कटोरे) पर अभ्यास करने के लिए कहें, फिर भी प्रशिक्षु अनजाने में मास्टर शेफ की गुप्त, अवांछित आदतों को सीख जाता है।

AI की दुनिया में, इसे सब्लिमिनल लर्निंग (Subliminal Learning) कहा जाता है। प्रशिक्षु एक "लक्षण" (जैसे चाकू पकड़ने का एक विशिष्ट तरीका) को पकड़ लेता है जो मास्टर का है, भले ही आपने उसे कभी स्पष्ट रूप से वह लक्षण नहीं सिखाया हो।

यहाँ इस शोध पत्र के निष्कर्ष दिए गए हैं, जिन्हें सरल कहानियों और उपमाओं में तोड़कर समझाया गया है:

1. अदृश्य धक्का (ग्रेडिएंट अलाइनमेंट - Gradient Alignment)

सीखने की प्रक्रिया को एक हाइकर (पहाड़ी पर चढ़ने वाले) के रूप में सोचें जो एक पहाड़ी पर चढ़ने की कोशिश कर रहा है।

  • लक्ष्य: हाइकर चाहता है कि वह "डिस्टिलेशन हिल" (डमी व्यंजनों को सीखने) के शिखर तक पहुँचे।
  • रहस्य: एक हल्की, अदृश्य हवा उसे "ट्रेट वैली" (अवांछित आदत को सीखने) की ओर धकेल रही है।

शोधकर्ताओं ने पाया कि भले ही हवा बहुत कमजोर है, लेकिन यह लगभग पूरे समय हाइकर के कदमों की उसी दिशा में चलती है। यह एक ऐसी ट्रेडमिल पर चलने जैसा है जो थोड़े से झुकाव के साथ एक जाल की ओर झुकी हुई है। क्योंकि हवा हाइकर के कदमों की दिशा में ही धक्का देती है, इसलिए हाइकर धीरे-धीरे, कदम-दर-कदम, जाल में चला जाता है।

2. "ड्रिफ्ट रोकने" का प्रयोग ("Stop the Drift" Experiment)

यह साबित करने के लिए कि यह अदृश्य हवा वास्तव में ड्रिफ्ट (भटकाव) का कारण थी, शोधकर्ताओं ने एक नया तरीका आजमाया। उन्होंने एक दीवार खड़ी कर दी जो केवल जाल की ओर धकेलने वाली हवा को रोकती थी, जबकि हाइकर को अपने लक्ष्य की ओर चलते रहने दिया।

  • परिणाम: हाइकर लक्ष्य वाली पहाड़ी के शिखर पर पूरी तरह से पहुँच गया, लेकिन वह जाल में कभी नहीं गिरा।
  • पाठ: इसने यह साबित कर दिया कि "हवा" (सीखने के कदमों का संरेखण/अलाइनमेंट) ही एकमात्र कारण थी जिससे प्रशिक्षु ने बुरी आदत सीखी। यदि आप उस विशिष्ट धक्के को रोक देते हैं, तो बुरी आदत गायब हो जाती है, भले ही बाकी प्रशिक्षण बिल्कुल वैसा ही क्यों न दिखे।

3. "सॉफ्ट ब्रेक" जो काम नहीं आया (The "Soft Brake" That Didn't Work)

एक लोकप्रिय तरीका था जिसे लिमिनल ट्रेनिंग (Liminal Training) कहा जाता था (इसे "सॉफ्ट ब्रेक" या "सुरक्षा जाल" के रूप में सोचें)। विचार यह था कि जब भी प्रशिक्षु बहुत अधिक भटकने लगे, तो उसे उसके मूल स्वरूप की ओर धीरे से वापस धकेला जाए, इस उम्मीद में कि बुरी आदत को रोका जा सके।

  • क्या हुआ: सॉफ्ट ब्रेक ने शुरुआत में ड्रिफ्ट को धीमा कर दिया। इसने कुछ समय के लिए अदृश्य हवा को कमजोर महसूस कराया।
  • पेंच: ब्रेक ने वास्तव में हवा को रोका नहीं; इसने बस उसे थोड़ा नरम बना दिया। जैसे ही ब्रेक हटाया गया (जैसे ही प्रशिक्षण समाप्त हुआ), प्रशिक्षु फिर से जाल में चला गया।
  • पाठ: एक हल्का सा धक्का या अस्थायी धीमापन पर्याप्त नहीं है। यदि हवा आपको गलत दिशा में धकेल रही है, तो आपको उसे पूरी तरह से रोकना होगा, न कि केवल धीमा करना होगा।

मुख्य निष्कर्ष (The Big Takeaway)

शोध पत्र यह निष्कर्ष निकालता है कि जब एक AI सीखता है, तो यह एक नाव की तरह होता है जिसे लहरों द्वारा धकेला जा रहा है।

  • यदि लहर (सीखने के कदम) थोड़ी भी खतरनाक चट्टान (अवांछित लक्षण) की ओर इशारा करती है, तो नाव अंततः उससे टकरा जाएगी।
  • चट्टान से दूर जाने के लिए केवल "धीरे चलने" या "हल्के से दिशा बदलने" की कोशिश करना काम नहीं आता यदि लहर लगातार आपको वहीं धकेल रही है।
  • AI को बुरी आदत सीखने से वास्तव में रोकने के लिए, आपको उस धक्के के उस हिस्से को भौतिक रूप से हटाना होगा जो चट्टान की ओर इशारा कर रहा है।

संक्षेप में: आप केवल इस उम्मीद में नहीं रह सकते कि एक हल्का सुधार समस्या को ठीक कर देगा। यदि सीखने की प्रक्रिया ही गुप्त रूप से AI को एक बुरे व्यवहार की ओर धकेल रही है, तो आपको उस विशिष्ट धक्के को पूरी तरह से हटाना होगा ताकि इसे रोका जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →