← नवीनतम पेपर
💬 NLP

Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction

यह शोध पत्र 'ट्रैजेक्टरी रिप्ले वाया कॉन्सेप्ट-बेसिस रिकंस्ट्रक्शन' नामक एक ढांचे का प्रस्ताव करता है जो बिना लक्ष्य-पक्ष पर्यवेक्षण (target-side supervision) के विविध लार्ज लैंग्वेज मॉडल्स में रिफ्यूज़ल इंटरवेंशन को सफलतापूर्वक स्थानांतरित करता है, जो सुरक्षा संरेखण (safety alignment) के अंतर्निहित सार्वभौमिक, निम्न-आयामी अर्थ संबंधी सर्किट के अस्तित्व के लिए पुख्ता प्रमाण प्रदान करता है।

मूल लेखक: Tony Cristofano

प्रकाशित 2026-01-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tony Cristofano

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दो अलग-अलग रोबोट हैं, रोबोट A और रोबोट B। उन्हें अलग-अलग कंपनियों द्वारा बनाया गया है, वे अलग-अलग ब्लूप्रिंट का उपयोग करते हैं, और वे थोड़े अलग लहजे में बात करते हैं। हालाँकि, जब आप उनसे कोई पेचीदा या खतरनाक सवाल पूछते हैं, तो वे अचानक एक "रिफ्यूज़ल मोड" (अस्वीकृति मोड) में चले जाते हैं। वे जवाब देना बंद कर देते हैं और एक बहुत ही विशिष्ट, रोबोटिक तरीके से कहते हैं, "मैं यह नहीं कर सकता।"

अधिकांश लोग सोचते हैं कि यह "रिफ्यूज़ल मोड" प्रत्येक रोबोट की विशिष्ट मस्तिष्क वायरिंग के कारण अनूठा है। लेकिन यह शोध पत्र एक बड़ा सवाल पूछता है: क्या सभी के भीतर एक सार्वभौमिक "रिफ्यूज़ल स्विच" छिपा हुआ है?

लेखक, टोनी क्रिस्टोफ़ानो के नेतृत्व में, कहते हैं हाँ। उनका मानना है कि भले ही बाहर से रोबोट अलग दिखते हों, लेकिन उनके मस्तिष्क का वह हिस्सा जो "ना" कहता है, उन्हीं बुनियादी लेगो ब्लॉक्स (Lego blocks) से बना है।

उन्होंने इसे सरल उपमाओं का उपयोग करके कैसे सिद्ध किया, यहाँ दिया गया है:

1. "सार्वभौमिक रेसिपी" (कॉन्सेप्ट एटम्स)

कल्पना कीजिए कि "रिफ्यूज़ल" रोबोट के मस्तिष्क में एक विशाल, बिखरा हुआ ढेर नहीं है। इसके बजाय, यह विशिष्ट सामग्रियों से बनी एक रेसिपी है।

  • लेखकों ने 20 बुनियादी अवधारणाओं (जैसे "धोखाधड़ी," "सुरक्षा," या "कानूनी शब्दावली") का एक साझा "पेंट्री" (भंडार) बनाया। वे इन्हें कॉन्सेप्ट एटम्स कहते हैं।
  • उन्होंने पाया कि जब रोबोट A मना करता है, तो वह इन 20 सामग्रियों को एक विशिष्ट अनुपात में मिला रहा होता है (जैसे, 50% "सुरक्षा" + 30% "कानूनी शब्दावली")।
  • बड़ी खोज यह थी? रोबोट B भी बिल्कुल उसी रेसिपी का उपयोग करता है। भले ही रोबोट B को अलग तरह से बनाया गया था, उसका "रिफ्यूज़ल" उन्हीं सामग्रियों से और उसी अनुपात में बना है।

2. "ट्रैजेक्टरी रीप्ले" (नृत्य की नकल करना)

आमतौर पर, यदि आप रोबोट A के रिफ़्यूज़ल को ठीक करने के लिए उसके मस्तिष्क को छेड़ने की कोशिश करते हैं, तो आप अनजाने में उसकी गणित करने या कविता लिखने की क्षमता को बिगाड़ सकते हैं। ऐसा इसलिए है क्योंकि "रिफ्यूज़ल" के तार "स्मार्ट" तारों के साथ उलझे हुए होते हैं।

बिना कुछ बिगाड़े इसे ठीक करने के लिए, लेखकों ने ट्रैजेक्टरी रीप्ले नामक तकनीक का उपयोग किया:

  • चरण 1: नृत्य का मानचित्रण करें। उन्होंने देखा कि जब रोबोट A मना करता है, तो वह अपने मस्तिष्क की परतों के माध्यम से कैसे आगे बढ़ता है। उन्होंने केवल एक स्थान को नहीं देखा; उन्होंने कदमों के पूरे क्रम को देखा।
  • चरण 2: कदमों का अनुवाद करें। उन्होंने रोबोट A के कदमों को रोबोट B के कदमों से मिलाने के लिए एक "अनुवादक" (डायनेमिक टाइम वार्पिंग) का उपयोग किया। भले ही रोबोट B में अधिक परतें हों या कम, उन्होंने पता लगा लिया कि रोबोट A का कौन सा कदम रोबोट B के किस कदम के अनुरूप है।
  • चरण 3: रेसिपी को दोबारा चलाएं। उन्होंने रोबोट A से "रिफ्यूज़ल रेसिपी" ली और उसे रोबोट B के अंदर केवल उन विशिष्ट परतों में फिर से चलाया जहाँ रिफ़्यूज़ल होता है।

3. "सेफ्टी शील्ड" (वेट-एसवीडी गार्ड)

एक बड़ा जोखिम था: क्या होगा यदि "रिफ्यूज़ल रेसिपी" गलती से रोबोट B के "मैथ" या "लॉजिक" वायर से टकरा जाए? इससे रोबोट B मंदबुद्धि हो जाएगा।

इसे रोकने के लिए, उन्होंने एक सेफ्टी शील्ड जोड़ा:

  • उन्होंने रोबोट B के मस्तिष्क को देखा और उन "सुपर हाईवे" की पहचान की जहाँ सबसे महत्वपूर्ण कौशल (जैसे गणित और कोडिंग) रहते हैं। ये "हाई-वेरिएंस" क्षेत्र हैं।
  • उन्होंने एक ढाल बनाई जो "रिफ्यूज़ल रेसिपी" को इन सुपर हाईवे से दूर धकेलती है।
  • परिणाम: वे रोबोट B की गणित या कोड लिखने की क्षमता को नुकसान पहुँचाए बिना सफलतापूर्वक "रिफ्यूज़ल मोड" को बंद करने में सफल रहे।

बड़ा प्रयोग

उन्होंने इसका परीक्षण 8 अलग-अलग रोबोट जोड़ियों पर किया, जिनमें शामिल थे:

  • छोटे रोबोट बनाम बड़े रोबोट।
  • विभिन्न परिवारों के रोबोट (जैसे Qwen बनाम Ministral)।
  • अलग-अलग आर्किटेक्चर वाले रोबोट (एक मानक "डेंस" मस्तिष्क था, दूसरा एक जटिल "मिक्सचर ऑफ एक्सपर्ट्स" मस्तिष्क था)।

परिणाम:
लगभग हर मामले में, वे एक रोबोट से दूसरे रोबोट में "रिफ्यूज़ल रेसिपी" को सफलतापूर्वक स्थानांतरित करने में सफल रहे।

  • रिफ्यूज़ल में गिरावट आई: लक्षित रोबोटों ने हानिकारक प्रश्नों के प्रति "मैं यह नहीं कर सकता" कहना बंद कर दिया।
  • कौशल बरकरार रहे: रोबोट पहले की तरह ही गणित की समस्याओं को हल करने और कोड लिखने में सक्षम थे।
  • कोई धोखाधड़ी नहीं: उन्हें लक्षित रोबोट को यह सिखाने के लिए किसी भी "बुरे" उदाहरण को दिखाने की आवश्यकता नहीं थी कि मना करना कैसे बंद किया जाए। उन्होंने बस डोनर रोबोट से "रेसिपी" का उपयोग किया।

यह क्यों मायने रखता है (शोध पत्र के अनुसार)

शोध पत्र निष्कर्ष निकालता है कि सेफ्टी अलाइनमेंट (सुरक्षा संरेखण) कोई यादृच्छिक जादू नहीं है। ऐसा लगता है कि यह एक सार्वभौमिक, लो-डायमेंशनल संरचना है जिसे विभिन्न AI मॉडल समान तरीकों से बनाते हैं।

सुरक्षा पर महत्वपूर्ण नोट:
लेखक बहुत सावधानी से कहते हैं कि यह एक नैदानिक उपकरण (यह अध्ययन करने का एक तरीका कि AI मस्तिष्क कैसे काम करते हैं) है, न कि वास्तविक दुनिया में सुरक्षा को तोड़ने के लिए उपयोग किया जाने वाला उपकरण। वे स्पष्ट रूप से चेतावनी देते हैं कि चूंकि यह विधि सुरक्षा फिल्टरों को बंद कर सकती है, इसलिए इसमें "दोहरे उपयोग" (dual-use) का जोखिम है। उन्होंने कोड के "सुरक्षित" हिस्सों (अवधारणाओं की पेंट्री) को जारी किया है, लेकिन दुरुपयोग को रोकने के लिए "हानिकारक" हिस्सों (डोनर को प्रशिक्षित करने के लिए उपयोग किए गए विशिष्ट बुरे प्रश्न) को निजी रखा है।

संक्षेप में: उन्होंने साबित किया कि AI रिफ़्यूज़ल एक सार्वभौमिक भाषा की तरह है। यदि आप जानते हैं कि एक AI कैसे "ना" कहता है, तो आप पूरी तरह से अलग AI को बिना उसके मस्तिष्क को नुकसान पहुँचाए "ना" कहना बंद करने के लिए सिखा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →