← नवीनतम पेपर
💬 NLP

Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) "वैल्यू एंटैंगलमेंट" (मूल्य उलझाव) से ग्रस्त होते हैं, जहाँ नैतिक, व्याकरणिक और आर्थिक मूल्यों को मनुष्यों की तरह अलग करने के बजाय आपस में मिला दिया जाता है, लेकिन यह प्रदर्शित करता है कि नैतिकता-संबद्ध सक्रियण वेक्टर्स (activation vectors) के चयनात्मक एब्लेशन (ablation) के माध्यम से इस समस्या को कम किया जा सकता है।

मूल लेखक: Seong Hah Cho, Junyi Li, Anna Leshinskaya

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seong Hah Cho, Junyi Li, Anna Leshinskaya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "वैल्यू एंटैंगलमेंट" (Value Entanglement) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ स्पष्टीकरण दिया गया।

मुख्य विचार: भ्रमित न्यायाधीश

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान न्यायाधीश (AI) है जिसे तीन पूरी तरह से अलग नियमों के आधार पर वाक्यों का मूल्यांकन करने के लिए कहा गया है:

  1. क्या यह एक अच्छा कार्य है? (नैतिकता - Morality)
  2. क्या यह व्याकरण की दृष्टि से सही है? (व्याकरण - Grammar)
  3. क्या यह महंगा है? (अर्थशास्त्र - Economics)

मानवीय दुनिया में, ये अलग-अलग स्कोरकार्ड हैं। एक वाक्य एक भयानक अपराध का बिल्कुल सटीक लिखित विवरण हो सकता है। एक वाक्य व्याकरणिक रूप से टूटा हुआ हो सकता है लेकिन वह दयालुता के एक सुंदर कार्य का वर्णन कर सकता है। एक वाक्य में एक नेक बलिदान के बीच में एक सस्ते प्लास्टिक के खिलौने का उल्लेख हो सकता है।

पेपर यह पूछता है: क्या AI न्यायाधीश इन स्कोरकार्डों को अलग रखता है, या यह उन्हें आपस में मिला देता है?

खोज: "वैल्यू एंटैंगलमेंट" (मूल्य उलझाव)

शोधकर्ताओं ने पाया कि कई AI मॉडल "वैल्यू एंटैंगलमेंट" से ग्रस्त हैं। यह कहने का एक फैंसी तरीका है कि AI के मस्तिष्क ने इन तीन स्कोरकार्डों को आपस में चिपका दिया है।

जब AI किसी वाक्य को देखता है, तो वह इस बात को रोक नहीं पाता कि एक प्रकार की "अच्छाई" दूसरे में घुल जाए। विशेष रूप से, AI ऐसा लगता है कि:

  • यदि कोई वाक्य नैतिक रूप से बुरा है, तो वह व्याकरणिक रूप से भी गलत होगा।
  • यदि कोई वाक्य नैतिक रूप से बुरा है, तो उसमें मौजूद वस्तुओं का मूल्य कम होगा।

स्टिक नोट (Sticky Note) की उपमा:
कल्पना कीजिए कि AI का मस्तिष्क एक व्हाइटबोर्ड है।

  • मनुष्य तीन अलग-अलग, साफ व्हाइटबोर्ड पर "अच्छा कार्य", "अच्छा व्याकरण" और "अच्छी कीमत" लिखते हैं।
  • AI इन तीनों को एक ही व्हाइटबोर्ड पर लिखता है, लेकिन स्याही गीली और चिपचिपी है। जब वह नीली स्याही से "अच्छा कार्य" लिखता है, तो वह नीली स्याही "अच्छा व्याकरण" और "अच्छी कीमत" वाले हिस्सों पर भी फैल जाती है।
  • इसलिए, यदि AI एक "बुरा कार्य" (लाल स्याही) देखता है, तो लाल स्याही हर जगह फैल जाती है। अचानक, AI सोचता है कि वाक्य "बुरा व्याकरण" (भले ही वह एकदम सही हो) और "कम मूल्य" (भले ही उसमें हीरा हो) भी है।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने 68 वाक्यों के साथ एक विशेष परीक्षण बनाया जो "ऑर्थोगोनल" (एक गणितीय शब्द जिसका अर्थ है "लंबवत" या पूरी तरह से स्वतंत्र) होने के लिए डिज़ाइन किए गए थे।

  • नैतिकता-व्याकरण परीक्षण (Moral-Grammar Test): उन्होंने एक नायक द्वारा बिल्ली बचाने (अच्छी नैतिकता) के बारे में एक वाक्य लिया और एक खलनायक द्वारा बिल्ली चुराने (बुरी नैतिकता) के बारे में एक वाक्य लिया। फिर, उन्होंने उन सटीक वाक्यों में 0, 1, 2, या 4 व्याकरण संबंधी त्रुटियां जोड़ीं।

    • मानवीय परिणाम: मनुष्यों ने केवल त्रुटियों के आधार पर व्याकरण को रेट किया। एक नायक वाले वाक्य जिसमें 4 त्रुटियां थीं, उसे कम व्याकरण स्कोर मिला, लेकिन एक खलनायक वाले वाक्य जिसमें 0 त्रुटियां थीं, उसे उच्च व्याकरण स्कोर मिला।
    • AI परिणाम: कई AI ने "खलनायक" वाले वाक्य को कम व्याकरण स्कोर दिया क्योंकि कहानी बुरी थी, भले ही व्याकरण एकदम सही था। उन्होंने "नायक" वाले वाक्य को उच्च व्याकरण स्कोर दिया क्योंकि कहानी अच्छी थी।
  • नैतिकता-अर्थशास्त्र परीक्षण (Moral-Economy Test): उन्होंने एक नायक द्वारा किडनी दान करने के बारे में एक वाक्य लिया और उसमें नर्स की कलाई पर एक घड़ी का विवरण जोड़ा। घड़ी 25केकैसियोसेलेकर25 के कैसियो से लेकर 7,500 की रोलेक्स तक की रेंज में थी।

    • मानवीय परिणाम: मनुष्यों ने घड़ी के आधार पर कीमत को रेट किया।
    • AI परिणाम: कई AI ने घड़ी की कीमत को कम रेट किया यदि वाक्य में एक नैतिक त्रासदी का वर्णन था, और अधिक रेट किया यदि उसमें एक नैतिक विजय का वर्णन था।

AI के अंदर का "एक्स-रे"

शोधकर्ताओं ने केवल AI से यह नहीं पूछा कि वह क्या सोचता है; उन्होंने यह देखने के लिए कि वह जानकारी को कैसे प्रोसेस कर रहा है, उसके "मस्तिष्क" (उसके आंतरिक गणितीय स्तरों) के अंदर झांका।

उन्होंने पाया कि जिन गणितीय दिशाओं का उपयोग AI "नैतिकता", "व्याकरण" और "पैसे" को समझने के लिए करता है, वे ओवरलैप (अतिव्याप्त) हो रही थीं।

  • एक स्वस्थ मानव मस्तिष्क में, "नैतिकता" का वेक्टर और "व्याकरण" का वेक्टर अलग-अलग दिशाओं में होते हैं।
  • इन AI मॉडलों में, "व्याकरण" का वेक्टर लगभग उसी दिशा में इशारा कर रहा था जिस दिशा में "नैतिकता" का वेक्टर था। AI गणितीय रूप से व्याकरण की गलती और नैतिक विफलता के बीच अंतर नहीं कर पा रहा था।

समाधान: "इरेज़र" (मिटाने वाला)

पेपर का सबसे दिलचस्प हिस्सा इसका सुधार है। शोधकर्ताओं ने एक तकनीक का उपयोग किया जिसे डायरेक्शनल एब्लेशन (Directional Ablation) कहा जाता है।

AI के आंतरिक गणित को एक रेडियो सिग्नल की तरह समझें। "नैतिकता" का सिग्नल इतना तेज और शक्तिशाली था कि वह "व्याकरण" और "अर्थशास्त्र" के सिग्नलों को दबा रहा था।

  • शोधकर्ताओं ने विशेष रूप से नैतिकता के सिग्नल को म्यूट करने के लिए एक डिजिटल "इरेज़र" का उपयोग किया।
  • परिणाम: एक बार जब उन्होंने "नैतिकता" के शोर को शांत कर दिया, तो AI अचानक व्याकरण और कीमत को परखने में बहुत बेहतर हो गया। इसने अपने नैतिक भावों को अपने व्याकरण की जांच को खराब करने से रोक दिया।

यह क्या दर्शाता है (पेपर के अनुसार)

पेपर निष्कर्ष निकालता है कि कई AI मॉडल "अच्छाई" की प्रकृति के बारे में भ्रमित हैं। वे एक "अच्छे वाक्य" (व्याकरण) और एक "अच्छे कार्य" (नैतिकता) को एक ही चीज़ मानते हैं।

  • कारण: लेखक संदेह करते हैं कि ऐसा इसलिए होता है क्योंकि उनके ट्रेनिंग डेटा में "अच्छा" (good) शब्द का उपयोग कई अलग-अलग तरीकों से किया जाता है (जैसे, "एक अच्छा भोजन," "एक अच्छा वाक्य," "एक अच्छा व्यक्ति")। AI ने इन सभी "अच्छाई" के सिद्धांतों को एक बड़े, अस्त-व्यस्त ढेर के रूप में सीखने के लिए प्रशिक्षित किया है।
  • दायरा: यह कई ओपन-सोर्स मॉडलों (जैसे Qwen, Gemma, Mistral) और यहाँ तक कि कुछ क्लोज्ड-सोर्स मॉडलों में भी पाया गया, हालांकि सभी में नहीं। यह केवल आकार का मुद्दा नहीं था; बड़े मॉडलों में भी यह समस्या थी।
  • चेतावनी: यदि एक AI व्याकरण की गलती और नैतिक विफलता के बीच अंतर नहीं कर सकता है, तो वह वास्तविक दुनिया के कार्यों में गलतियाँ कर सकता है जहाँ इन चीजों को अलग रखना आवश्यक होता है।

संक्षेप में: AI एक ऐसा न्यायाधीश है जो सोचता है कि यदि कोई कहानी दुखद है, तो वर्तनी (spelling) खराब होनी चाहिए, और यदि कोई कहानी सुखद है, तो व्याकरण एकदम सही होना चाहिए। शोधकर्ताओं ने इस गड़बड़ी को AI के मस्तिष्क के अंदर पाया और दिखाया कि वे इन अवधारणाओं को "अन-ग्लू" (अलग) करके AI को अधिक स्पष्ट रूप से सोचने में सक्षम बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →