← नवीनतम पेपर
📊 statistics

Signed-Permutation Coordinate Transport for RMSNorm Transformers

यह शोध पत्र पहचान करता है कि RMSNorm ट्रांसफॉर्मर्स में एक साधारण परम्यूटेशन गेज (SdS_d) के बजाय एक साइन्ड-परम्यूटेशन गेज (BdB_d) होता है, और चेकपॉइंट्स के बीच सुदृढ़ कोऑर्डिनेट ट्रांसपोर्ट को सक्षम करने के लिए एक साइन-मार्जिनलाइज्ड हंगेरियन मैचिंग पद्धति पेश करता है, जिससे व्याख्यात्मकता उपकरणों (interpretability tools), स्टीयरिंग वेक्टर्स और ऑप्टिमाइज़र स्टेट्स की हस्तांतरणीयता में महत्वपूर्ण सुधार होता है और मौजूदा अलाइनमेंट दृष्टिकोणों में समरूपता-प्रेरित विफलताओं का समाधान होता है।

मूल लेखक: John Sweeney

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: John Sweeney

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक ही ब्लूप्रिंट से बने दो समान घर हैं। एक घर में, हर कमरे को "किचन" (रसोई), "बेडरूम" (शयनकक्ष), और "बाथरूम" (स्नानगृह) के रूप में लेबल किया गया है। दूसरे घर में, कमरे बिल्कुल उसी स्थान पर हैं, लेकिन किसी ने उनके लेबल बदल दिए हैं।

यदि आप एक विशिष्ट फर्नीचर (जैसे कि एक "स्टीयरिंग वेक्टर" जो घर को बुरे अनुरोधों के लिए "ना" कहने में मदद करता है) को घर A से घर B में ले जाना चाहते हैं, तो आपको यह जानना होगा कि घर B में कौन सा लेबल घर A के "किचन" के अनुरूप है। यदि आप गलत अनुमान लगाते हैं, तो आप "ना" वाला बटन "बाथरूम" में रख सकते हैं, और घर ठीक से काम नहीं करेगा।

यह शोध पत्र आधुनिक AI मॉडलों के लिए इस "बदले हुए लेबल" वाली समस्या के एक बहुत ही विशिष्ट, कठिन संस्करण को हल करने के बारे में है।

मुख्य समस्या: "चिह्न" (Sign) का रहस्य

लंबे समय तक, शोधकर्ताओं का मानना था कि इन AI घरों को केवल परम्यूटेशन (क्रमपरिवर्तन/स्थान बदलना) द्वारा बदला जा सकता था। यदि कमरा 1 बदलकर कमरा 5 हो गया, तो आपने बस लेबल बदल दिए।

हालाँकि, लेखक ने पाया कि सबसे लोकप्रिय आधुनिक AI मॉडलों (जिन्हें RMSNorm मॉडल कहा जाता है, जिनका उपयोग Llama और Qwen जैसे दिग्गजों द्वारा किया जाता है) के लिए, कमरे उलटने का एक दूसरा, छिपा हुआ तरीका भी है: चिह्न को पलटना (flipping the signs)

एक कमरे के लेबल को केवल एक नाम के रूप में नहीं, बल्कि एक तीर के रूप में सोचें जो एक दिशा की ओर इशारा करता है।

  • परम्यूटेशन (Permutation): तीर को उत्तर से पूर्व की ओर घुमाना।
  • साइन फ्लिप (Sign Flip): तीर को उत्तर की ओर ही रहने देना, लेकिन उसे इस तरह पलट देना कि वह दक्षिण की ओर इशारा करने लगे।

इन आधुनिक मॉडलों में, हर एक कमरा स्वतंत्र रूप से अपने तीर को बिना घर को तोड़े, पलट सकता है (उत्तर \to दक्षिण)। यह भ्रम की एक विशाल मात्रा पैदा करता है। यदि आप पुराने "स्वैपिंग" नियमों का उपयोग करके एक मॉडल से दूसरे में उपकरण ले जाने की कोशिश करते हैं, तो आप अनजाने में आधे तीरों को पलट सकते हैं।

"टूटे हुए कंपास" की उपमा

लेखक का तर्क है कि वर्तमान AI मॉडलों को संरेखित (align) करने वाले उपकरण एक ऐसे कंपास की तरह हैं जो केवल "उत्तर" और "पूर्व" को जानता है, लेकिन "दक्षिण" के प्रति अंधा है।

  • पुराना तरीका (केवल परम्यूटेशन): आप कमरों का मिलान करने के लिए उनके व्यवहार को देखते हैं। यदि मॉडल 1 में कमरा A, मॉडल 2 में कमरा B के बहुत समान है, तो आप उन्हें मिला देते हैं। लेकिन यदि कमरा A वास्तव में कमरा B के विपरीत व्यवहार करता है (क्योंकि साइन फ्लिप हुआ है), तो पुराना कंपास उन्हें पूरी तरह से अलग समझता है और उन्हें मिलाने से मना कर देता है।
  • परिणाम: जब शोधकर्ताओं ने "स्टीयरिंग टूल्स" (जैसे कि हानिकारक अनुरोधों को अस्वीकार करने के लिए एक बटन) को स्थानांतरित करने की कोशिश की, तो वे उपकरण पूरी तरह से टूट गए। "अस्वीकार" (Refusal) बटन "स्वीकार" (Accept) में बदल गया, या उपकरण काम करना बंद कर गया।

समाधान: "साइन-मार्जिनलाइज्ड" मैप

लेखक एक नई विधि पेश करते हैं जिसे साइन्ड-परम्यूटेशन ट्रांसपोर्ट (Signed-Permutation Transport) कहा जाता है।

कल्पना कीजिए कि आप फिर से कमरों का मिलान करने की कोशिश कर रहे हैं, लेकिन इस बार आपके पास एक विशेष आवर्धक लेंस (magnifying glass) है। केवल यह पूछने के बजाय कि "क्या कमरा A, कमरा B जैसा है?", आप पूछते हैं, "क्या कमरा A, कमरा B जैसा है, या क्या यह कमरा B का बिल्कुल विपरीत है?"

  1. परिमाण (Magnitude) को देखें: पहले, आप संकेत (positive या negative) की परवाह किए बिना जुड़ाव की शक्ति की जाँच करते हैं। यह सही कमरे को ढूंढ लेता है, भले ही तीर उल्टा क्यों न हो।
  2. चिह्न (Sign) की जाँच करें: एक बार जब आप मिलान वाला कमरा पा लेते हैं, तो आप तीर की दिशा की जाँच करते हैं। यदि यह उल्टा है, तो अपने टूल को ले जाने से पहले आप इसे वापस सीधा कर देते हैं।

लेखक गणितीय रूप से सिद्ध करते हैं कि यदि आप साइन फ्लिप को अनदेखा करते हैं, तो आप लगभग 50% बार विफल होंगे (क्योंकि आधे तीर उलटे हो सकते हैं)। साइन फ्लिप को ध्यान में रखकर, आप लगभग 100% बार सही संरेखण प्राप्त कर सकते हैं।

शोध पत्र में वास्तविक दुनिया के परीक्षण

लेखक ने केवल गणित नहीं किया; उन्होंने इसे वास्तविक AI मॉडलों पर परखा:

  • "अस्वीकृति" (Refusal) परीक्षण: उन्होंने एक टूल लिया जो AI को हानिकारक प्रश्नों के उत्तर देने से मना करने के लिए प्रेरित करता है।
    • पुराना तरीका: टूल विफल रहा। AI ने हानिकारक अनुरोधों को स्वीकार करना शुरू कर दिया (क्योंकि साइन उल्टा हो गया था)।
    • नया तरीका: टूल पूरी तरह से काम कर गया, जिसने इसकी मूल शक्ति का 95.8% बरकरार रखा।
  • "डिक्शनरी" (Dictionary) परीक्षण: उन्होंने एक मॉडल से दूसरे मॉडल में फीचर (SAE) का डिक्शनरी स्थानांतरित करने का प्रयास किया।
    • पुराना तरीका: डिक्शनरी बेकार थी (रिकंस्ट्रक्शन एरर बहुत अधिक था)।
    • नया तरीका: डिक्शनरी लगभग पूरी तरह से काम कर गई।
  • "रिज्यूमे" (Resume) परीक्षण: उन्होंने एक AI को प्रशिक्षित (training) करते समय रोका, उसके लेबल बदले (गेज), और फिर से प्रशिक्षण शुरू करने का प्रयास किया।
    • पुराना तरीका: AI भूल गया कि वह कहाँ था और उसने पूरी तरह से अलग रास्ता अपनाया।
    • नया तरीका: AI ठीक वहीं से शुरू हुआ जहाँ उसने छोड़ा था, जैसे कि कुछ हुआ ही न हो।

मुख्य निष्कर्ष

लेखक निष्कर्ष निकालते हैं कि आधुनिक AI मॉडलों के लिए, आप केवल यह नहीं पूछ सकते कि "यह न्यूरॉन क्या है?" बिना यह निर्दिष्ट किए कि "गेज" (वह नियम पुस्तिका कि लेबल और संकेतों को कैसे व्यवस्थित किया गया है) क्या है।

यदि आप इन मॉडलों के बीच टूल्स, डिक्शनरी या ट्रेनिंग स्टेट्स को स्थानांतरित करना चाहते हैं, तो आपको नए "साइन्ड-परम्यूटेशन" नियमों का उपयोग करना ही होगा। यदि आप ऐसा नहीं करते हैं, तो आप वास्तव में स्टीयरिंग व्हील को 180 डिग्री घुमाकर कार चलाने की कोशिश कर रहे हैं: आप सोचते हैं कि आप सीधे जा रहे हैं, लेकिन वास्तव में आप पीछे जा रहे हैं।

संक्षेप में: आधुनिक AI मॉडलों में एक छिपा हुआ "साइन फ्लिप" सिमेट्री (सममिति) होती है। उनके बीच चीजों को स्थानांतरित करने के लिए, आपको संकेतों को ठीक करना होगा, न कि केवल नामों को। यह शोध पत्र ठीक यही करने के लिए एक मानचित्र और कंपास प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →