← नवीनतम पेपर
🤖 AI

Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance

यह लेख प्रोब-जियोमेट्री अलाइनमेंट (PGA) को प्रस्तुत करता है, जो एक सर्जिकल हस्तक्षेप है जो मॉडल की गतिविधियों को इस तरह संरेखित करता है कि बड़े भाषा मॉडलों में क्रॉस-सीक्वेंस मेमोराइजेशन के लिए फीचर डिस्क्रिमिनेशन (विशेषता विभेदन) को संयोग स्तर से नीचे कम कर दिया जाता है, जबकि उनकी कार्यात्मक क्षमताओं को सुरक्षित रखा जाता है।

मूल लेखक: Anamika Paul Rupa, Anietie Andy

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anamika Paul Rupa, Anietie Andy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किताबों का एक पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल) जिसने एक विशिष्ट गुप्त कहानी को याद कर लिया है। आप लाइब्रेरियन से उस कहानी को "अनलर्न" (unlearn) करने के लिए कहते हैं, जिसका अर्थ है कि वह अब किसी को भी वह कहानी नहीं सुनाएगा।

अनलर्न करने के अधिकांश वर्तमान तरीके ऐसे हैं जैसे लाइब्रेरियन को यह कहना: "यदि कोई इस कहानी के बारे में पूछे, तो बस 'मुझे नहीं पता' कहें या एक अलग अंत बना लें।" लाइब्रेरियन आज्ञा का पालन करता है और कहानी सुनाना बंद कर देता है।

हालाँकि, कहानी अभी भी लाइब्रेरियन के मस्तिष्क में लिखी हुई है; उसने केवल इसे छिपाना सीख लिया है। यदि आप सही और चालाकी भरे प्रश्न पूछते हैं, तो वह अनजाने में यह प्रकट कर सकता है कि उसे अभी भी वह कहानी पता है।

यह पेपर एक ऐसा तरीका पेश करता है जिससे यह निर्धारित किया जा सके कि क्या वह कहानी वास्तव में लाइब्रेरियन के मस्तिष्क से मिट गई है, और वास्तव में इसे मिटाने का एक नया तरीका भी बताता है ताकि लाइब्रेरियन अपना काम करना न भूल जाए।

समस्या: मशीन में "भूत" (The "Ghost" in the Machine)

लेखकों ने पाया कि एक मॉडल, भले ही वह याद की गई गुप्त जानकारी को बताना बंद कर दे, फिर भी आंतरिक रूप रूप से उसे जानता है। वे इसे "क्रॉस-सीक्वेंस सिग्नेचर" (Cross-Sequence Signature) कहते हैं।

उपमा:
कल्पना कीजिए कि लाइब्रेरियन के मस्तिष्क में एक छिपा हुआ "हाँ/नहीं" स्विच है जो गुप्त कहानी के बारे में सोचते ही जल उठता है।

  • पुराना अनलर्निंग: आप लाइब्रेरियन को अपना मुँह बंद रखने के लिए प्रशिक्षित करते हैं। वह कहानी सुनाना बंद कर देता है।
  • वास्तविकता: वह छिपा हुआ "हाँ/नहीं" स्विच अभी भी चमकता रहता है जब आप उस कहानी के बारे में पूछते हैं। ज्ञान अभी भी वहीं है, बस दबा दिया गया है।

लेखकों ने एक विशेष परीक्षण (एक "प्रोब") बनाया है यह जाँचने के लिए कि क्या यह स्विच जलता है। उन्होंने पाया कि यह स्मृति का "भूत" छोटे खिलौना मॉडलों से लेकर मिस्ट्रल-7बी (Mistral-7B) जैसे विशाल मॉडलों तक, सभी के भीतर मौजूद है।

खोज: स्मृति और भाषण अलग-अलग हैं

इस पेपर की सबसे बड़ी अंतर्दृष्टि यह है कि याद रखना और बोलना मस्तिष्क के अलग-अलग हिस्सों में होता है।

उपमा:
कल्पना कीजिए कि मॉडल एक रेडियो स्टेशन है।

  • स्टोरेज (भंडारण): गुप्त जानकारी "रिकॉर्डिंग स्टूडियो" (मॉडल की गहरी परतों) में संग्रहीत है।
  • ब्रॉडकास्टिंग (प्रसारण): "ऑन-एयर" स्विच (अटेंशन हेड्स) यह तय करता है कि रिकॉर्डिंग बजाई जाए या नहीं।

लेखकों ने दिखाया कि आप "ऑन-एयर" स्विच को नष्ट कर सकते हैं ताकि गुप्त जानकारी कभी प्रसारित न हो (मॉडल उसे बोलना बंद कर देता है)। हालाँकि, स्टूडियो में रिकॉर्डिंग पूरी तरह से स्पष्ट और सुरक्षित रहती है। आप यहाँ तक कि उस रिकॉर्डिंग की ओर इशारा करके कह सकते हैं, "वह गुप्त जानकारी है!" भले ही रेडियो शांत हो।

समाधान: "प्रोब-ज्यामिति संरेखण" (Probe-Geometry Alignment - PGA)

चूँकि पुराने तरीके केवल "ऑन-एयर" स्विच को नष्ट करते थे, लेखकों ने प्रोब-ज्यामिति संरेखण (PGA) नामक एक नया सर्जिकल उपकरण बनाया।

उपमा:
माइक्रोफ़ोन को नष्ट करने के बजाय, PGA रिकॉर्डिंग स्टूडियो में जाता है और ध्वनि तरंगों को संरेखित करता है।

  1. सिग्नल को ढूँढना: पहले, वे अपने विशेष परीक्षण का उपयोग करके उस दिशा का पता लगाते हैं जहाँ गुप्त जानकारी छिपी है।
  2. सर्जिकल संरेखण: इसके बाद, वे मॉडल की प्रत्येक परत में एक सूक्ष्म, सटीक समायोजन करते हैं। वे पूरे मस्तिष्क को डिलीट नहीं करते; वे बस उस विशिष्ट "दिशा" को स्थानांतरित कर देते जहाँ गुप्त जानकारी रहती है ताकि वह अब गुप्त न रहे। यह एक स्पष्ट, उच्च-रिज़ॉल्यूशन वाली फोटो को केवल उसी विशिष्ट क्षेत्र में शोर (static noise) में बदलने जैसा है जहाँ गुप्त जानकारी थी, जबकि फोटो का बाकी हिस्सा (मॉडल का सामान्य ज्ञान) पूरी तरह से स्पष्ट रहता है।

परिणाम:

  • भूत चला गया: PGA लागू करने के बाद, विशेष परीक्षण अब नहीं चमकता है। वास्तव में, परीक्षण रैंडम अनुमान (random guessing) से भी खराब प्रदर्शन करता है, जिसका अर्थ है कि मॉडल ने वास्तव में गुप्त जानकारी की आंतरिक संरचना को भुला दिया है।
  • कोई दुष्प्रभाव नहीं: महत्वपूर्ण रूप से, इस ऑपरेशन ने लाइब्रेरियन को अन्य कुछ भी करने से नहीं रोका। सामान्य प्रश्नों के उत्तर देने, कहानियाँ लिखने या तर्क संबंधी पहेलियाँ हल करने की उसकी क्षमता बिल्कुल वैसी ही बनी रही।

सरल भाषा में मुख्य बातें

  1. चुप्पी का अर्थ भूलना नहीं है: सिर्फ इसलिए कि एक मॉडल ने कोई रहस्य बताना बंद कर दिया है, इसका मतलब यह नहीं है कि वह उसे भूल गया है। स्मृति अंदर कहीं छिपी हुई है।
  2. हम छिपने की जगह देख सकते हैं: लेखकों ने विभिन्न आकार के मॉडलों में इन छिपी हुई स्मृतियों का पता लगाने का एक तरीका विकसित किया है।
  3. हम उन्हें मिटा सकते हैं: उन्होंने एक विधि (PGA) विकसित की है जो इन छिपी हुई स्मृतियों को सर्जिकल तरीके से हटा देती है।
  4. यह सुरक्षित है: यह विलोपन इतना सटीक है कि यह मॉडल की सामान्य बुद्धिमत्ता को नुकसान नहीं पहुँचाता है। यह सफेद शर्ट से एक विशिष्ट दाग को हटाने जैसा है बिना शर्ट के सिकुड़े या रंग बदले।

पेपर निष्कर्ष निकालता है कि एआई से किसी चीज़ को वास्तव में "अनलर्न" करने के लिए, आपको आंतरिक प्रतिनिधित्व को मिटाना होगा, न कि केवल आउटपुट को चुप कराना होगा। उनका नया तरीका, PGA, ठीक यही करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →