← नवीनतम पेपर
💻 computer science

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

यह शोधपत्र MENTIS को प्रस्तुत करता है, जो एक ज्यामिति-प्रथम (geometry-first) ढांचा है जो यह प्रकट करता है कि प्राथमिकता संरेखण (preference alignment), भाषा मॉडलों में चयनात्मक, गहराई-स्थानीयकृत ज्यामितीय पुनर्गठन को प्रेरित करता है, जो समान आंतरिक परिवर्तनों के बजाय मानदण्डिक अवधारणाओं (normative concepts) में बड़े टॉर्शन शिफ्ट और प्रासंगिक एंट्रॉपी के साथ नकारात्मक सहसंबंधों द्वारा अभिलक्षित है।

मूल लेखक: Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक के दो संस्करण हैं।

  • संस्करण A (द "स्टूडेंट"): इस रोबोट ने बहुत सारी किताबें पढ़ी हैं और निर्देशों का पालन करना सीखा है। यह बुद्धिमान है, लेकिन यदि आप इसे किसी चालाकी भरे सवाल से फंसाते हैं, तो यह गलती से कुछ अभद्र या खतरनाक कह सकता है।
  • संस्करण B (द "ग्रेजुएट"): यह वही रोबोट है जो "अलाइनमेंट" (Alignment) नामक एक विशेष प्रशिक्षण शिविर के बाद आया है। इसे मददगार, हानिरहित और ईमानदार होने के लिए सिखाया गया है। यह बुरे सवालों के जवाब देने से मना कर देता है और बहुत बेहतर व्यवहार करता है।

हम जानते हैं कि संस्करण B बाहर से बेहतर व्यवहार करता है। लेकिन बड़ा रहस्य यह है कि: वास्तव में इसके मस्तिष्क के अंदर क्या बदला? क्या इसने बस कुछ नए "स्टॉप" शब्द सीख लिए हैं? या इसके सोचने के पूरे तरीके को ही पुनर्गठित कर दिया गया है?

यह शोध पत्र एक नया टूल पेश करता है जिसे MENTIS कहा जाता है, ताकि रोबोट के मस्तिष्क के अंदर झांका जा सके और इस प्रश्न का उत्तर दिया जा सके।

मुख्य विचार: "विश्वास" एक दिशा के रूप में

लेखक रोबोट के "विश्वास" को मानव विश्वास की तरह नहीं देखते हैं (जैसे, "मेरा विश्वास है कि आकाश नीला है")। इसके बजाय, वे इसे एक कम्पास की सुई के रूप रूप में देखते हैं।

कल्पना कीजिए कि आपके द्वारा पूछे गए प्रत्येक प्रश्न के लिए, रोबोट के पास एक छोटी कम्पास की सुई है जो उस दिशा की ओर इशारा करती है जिसमें वह उत्तर देना चाहता है।

  • स्टूडेंट संस्करण में, यदि आप कोई चालाकी भरा प्रश्न पूछते हैं, तो वह सुई डगमगा सकती है या किसी अभद्र उत्तर की ओर इशारा कर सकती है।
  • ग्रेजुएट संस्करण में, उस सुई को भौतिक रूप से घुमाकर एक मददगार, सुरक्षित उत्तर की ओर मोड़ दिया गया है।

MENTIS एक ऐसा उपकरण है जो यह मापता है कि जब रोबोट आपके प्रश्न को अपने मस्तिष्क की पहली परत से अंतिम परत तक प्रोसेस करता है, तो वह सुई कितनी मुड़ती और घूमती है।

तीन बड़ी खोजें

शोधकर्ताओं ने स्टूडेंट और ग्रेजुएट रोबरों की तुलना करने के लिए MENTIS का उपयोग किया। यहाँ उन्हें क्या मिला, सरल उपमाओं के साथ समझाया गया है:

1. परिवर्तन चयनात्मक है, एकसमान नहीं

उपमा: कल्पना कीजिए कि आप एक घर को पेंट कर रहे हैं। आप सोच सकते हैं कि "अलाइनमेंट" पूरे घर को एक नए रंग में रंगने जैसा है (एक एकसमान परिवर्तन)।
वास्तविकता: MENTIS ने पाया कि पेंट का काम वास्तव में बहुत विशिष्ट है।

  • जब रोबोट मूल्यों (जैसे "न्याय" या "शांति") के बारे में सोचता है, तो उसकी आंतरिक कम्पास सुइयां बहुत अधिक मुड़ती और घूमती हैं। इन विषयों को संभालने के लिए रोबोट अपने सोचने के तरीके को महत्वपूर्ण रूप से पुनर्गठित करता है।
  • जब रोबोट तथ्यों (जैसे "फ्रांस की राजधानी क्या है?") के बारे में सोचता है, तो सुइयां बहुत कम हिलती हैं।
  • निष्कर्ष: प्रशिक्षण ने केवल एक सामान्य "सुरक्षा फिल्टर" नहीं जोड़ा है। इसने विशेष रूप से इस बात को फिर से व्यवस्थित किया है कि रोबोट नैतिक और मूल्य-आधारित अवधारणाओं को कैसे संभालता है।

2. परिवर्तन "शांत" क्षणों में होता है, अराजकता में नहीं

उपमा: आप अनुमान लगा सकते हैं कि रोबोट अपना मन सबसे अधिक तब बदलता है जब वह भ्रमित या अनिश्चित (उच्च एंट्रॉपी) होता है।
वास्तविकता: शोधकर्ताओं ने इसके विपरीत पाया। रोबोट के आंतरिक कम्पास में सबसे बड़े "घुमाव" तब हुए जब संदर्भ स्पष्ट और संरचित था।

  • जब रोबोट भ्रमित था या स्थिति अराजक थी, तो आंतरिक परिवर्तन छोटे थे।
  • जब रोबोट को ठीक से पता था कि किस तरह के उत्तर की अपेक्षा की जा रही है, तब प्रशिक्षण शिविर का उसके विचारों को दिशा देने पर सबसे बड़ा प्रभाव पड़ा।
  • निष्कर्ष: अलाइनमेंट तब सबसे अच्छा काम करता है जब रोबोट इतना आत्मविश्वासी होता है कि उसके पास एक स्पष्ट दिशा हो, और फिर वह धीरे से उस दिशा को सुरक्षा की ओर मोड़ देता है।

3. "घुमाव" विशिष्ट मंजिलों पर होता है

उपमा: कल्पना कीजिए कि रोबोट का मस्तिष्क 30 मंजिला इमारत है। आप सोच सकते हैं कि सुरक्षा प्रशिक्षण ग्राउंड फ्लोर (जहाँ से शुरुआत होती है) या छत (जहाँ अंत होता है) पर होता है।
वास्तविकता: "घुमाव" अलग-अलग रोबोट मॉडल के लिए अलग-अलग मंजिलों पर होता है।

  • एक मॉडल (OLMo) के लिए, सबसे बड़ा परिवर्तन 29वीं या 30वीं मंजिल पर हुआ।
  • दूसरे मॉडल (Mistral) के लिए, सबसे बड़ा परिवर्तन 14वीं मंजिल पर हुआ।
  • निष्कर्ष: कोई एक एकल "सुरक्षा परत" नहीं है। प्रत्येक रोबोट आर्किटेक्चर का अपना विशिष्ट "फ्लोर" होता है जहाँ प्रशिक्षण शिविर ने सबसे अधिक काम किया।

एक आश्चर्यजनक मोड़: सुरक्षित प्रॉम्प्ट अधिक बदलते हैं

आमतौर पर, हम सोचते हैं कि सुरक्षा प्रशिक्षण का उद्देश्य बुरी चीजों को रोकना है। आप उम्मीद करेंगे कि रोबोट का मस्तिष्क सबसे अधिक तब बदलेगा जब वह किसी "बुरे" (असुरक्षित) प्रॉम्प्ट को देखता है।

आश्चर्य: रोबोट का मस्तिष्क वास्तव में तब अधिक बदला जब वह सुरक्षित, मददगार प्रॉम्प्ट का उत्तर दे रहा था।

  • क्यों? शोधकर्ता सुझाव देते हैं कि एक बुरे सवाल को "ना" कहना आसान और स्वचालित है (एक रिफ्लेक्स की तरह)। लेकिन विनम्र, मददगार और सुरक्षित रहते हुए एक अच्छे सवाल को "हाँ" कहना बहुत अधिक जटिल आंतरिक नृत्य की मांग करता है। रोबोट को मददगार होने और सीमा पार न करने के बीच सावधानीपूर्वक संतुलन बनाना पड़ता है, जिससे उसके आंतरिक कम्पास का बहुत अधिक पुनर्गठन होता है।

इसका क्या अर्थ है (और क्या नहीं है)

  • इसका क्या अर्थ है: अलाइनमेंट केवल सतह-स्तर का पैच नहीं है। यह रोबोट के मस्तिष्क के गहरे भीतर एक विशिष्ट, मापने योग्य "ज्यामितीय हस्ताक्षर" छोड़ता है। यह रोबोट के विचारों को मोड़ने के तरीके को बदल देता है, लेकिन यह इसे चुनिंदा रूप से (मुख्य रूप से मूल्यों के लिए) और विशिष्ट स्थानों (विभिन्न मॉडलों के लिए अलग-अलग मंजिलों पर) में करता है।
  • इसका क्या अर्थ नहीं है: यह पेपर एक नैदानिक उपकरण (diagnostic tool) है, जैसे कि एक एक्स-रे। यह हमें दिखाता है कि हड्डियाँ कहाँ टूटी या बदली हैं, लेकिन यह यह साबित नहीं करता कि उस विशिष्ट हड्डी को ठीक करना ही एकमात्र कारण है जिससे रोबोट बेहतर व्यवहार करता है। यह हमें यह भी नहीं बताता कि अभी बेहतर रोबोट बनाने के लिए इसका उपयोग कैसे किया जाए; यह केवल हमें बताता है कि वर्तमान वाले अंदर से कैसे दिखते हैं।

संक्षेप में: MENTIS हमें दिखाता है कि जब हम एक रोबोट को "अच्छा" बनना सिखाते हैं, तो हम केवल एक स्टॉप साइन नहीं लगा रहे होते हैं। हम उसके आंतरिक कम्पास को धीरे से नया आकार दे रहे होते हैं, विशेष रूप से जब वह मूल्यों के बारे में सोच रहा होता है, और हम इसे हर अलग रोबोट मॉडल के लिए बहुत विशिष्ट, अद्वितीय तरीकों से करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →