← नवीनतम पेपर
💬 NLP

Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs

यह शोध पत्र "मोरल ट्रॉली एरिना" (Moral Trolley Arena) प्रस्तुत करता है, जो एक दो-चरणीय बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक एलएलएम (LLMs) नैतिक संकेतों को उनके निर्णयों में एक सुसंगत रूप से संकुचित, गैर-योगात्मक तंत्र के माध्यम से संयोजित करते हैं न कि सरल योग के माध्यम से, जो यह सुझाव देता है कि नैतिक मूल्यांकनों को अलग-थलग कार्यों की रैंकिंग के साथ-साथ इन संयोजन नियमों पर भी ध्यान केंद्रित करना चाहिए।

मूल लेखक: Weijia Zhang, Ruiqi Chen, Yunze Xiao, Weihao Xuan

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weijia Zhang, Ruiqi Chen, Yunze Xiao, Weihao Xuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट एआई (AI) के "नैतिक दिशा-सूचक" (moral compass) को समझने की कोशिश कर रहे हैं। लंबे समय तक, शोधकर्ताओं ने एआई का परीक्षण सरल, अलग-थलग सवालों के माध्यम से किया: "क्या एक बिल्ली को बचाना बेहतर है या एक कुत्ते को?" या "क्या झूठ बोलना हमेशा बुरा होता है?"

यह शोध पत्र तर्क देता है कि वास्तविक जीवन इतना सरल नहीं है। वास्तविक विकल्प एक स्मूदी (smoothie) की तरह होते हैं, न कि केवल एक अकेले फल की तरह। आप केवल "स्ट्रॉबेरी" का स्वाद नहीं लेते; आप स्ट्रॉबेरी, केले और थोड़े से खट्टे नींबू के मिश्रण का स्वाद लेते हैं। एआई को यह समझना होता है कि वे स्वाद आपस में कैसे मिलते हैं।

शोधकर्ताओं ने एआई के इन नैतिक "स्वादों" को मिलाने के तरीके को देखने के लिए मोरल ट्रॉली एरिना (Moral Trolley Arena) नामक एक नया परीक्षण मैदान बनाया। उन्होंने इसे कैसे किया और उन्हें क्या पता चला, इसका सरल विवरण यहाँ दिया गया है:

1. सेटअप: सामग्रियों का अंशांकन (Calibrating the Ingredients)

सबसे पहले, शोधकर्ताओं को व्यक्तिगत रूप से अलग-अलग नैतिक कार्यों की "शक्ति" को मापना था। उन्होंने 229 अलग-अलग परिदृश्य लिए (जैसे "आग से अजनबी को बचाना" या "एक न्यायाधीश द्वारा रिश्वत लेना") और उन्हें ELO नामक एक गेम-लाइक सिस्टम का उपयोग करके रैंक किया (वही सिस्टम जिसका उपयोग शतरंज के खिलाड़ियों को रैंक करने के लिए किया जाता है)।

  • परिणाम: उन्होंने पाया कि सभी परीक्षण किए गए एआई मॉडल के लिए, "अधिकार" (नियमों/कानूनों का पालन करना) आमतौर पर सबसे मजबूत स्वाद था, और "पवित्रता" (शुद्धता/पवित्र चीजें) आमतौर पर सबसे कमजोर था। यह "एकल-सामग्री" वाला स्वाद है।

2. प्रयोग: स्मूदी को मिलाना

इसके बाद, उन्होंने एकल कार्यों के बारे में पूछना बंद कर दिया। इसके बजाय, उन्होंने दो अलग-अलग कार्यों को मिलाने वाले प्रोफाइल (profiles) पेश किए।

  • प्रोफाइल A: एक न्यायाधीश जो रिश्वत लेता है (बुरा) लेकिन भी समुदाय को निर्वासन (deportation) से बचाता है (अच्छा)।
  • प्रोफाइल B: एक नायक जो आग से बच्चे को बचाता है (बहुत अच्छा) लेकिन एक वेटर को बिना भुगतान किए बिल के बारे में याद दिलाता है (मामूली अच्छा)।

एआई को यह चुनना था कि कौन सा प्रोफाइल बचाने के लिए "बेहतर" है। शोधकर्ताओं ने एआई के चुनाव की तुलना दोनों के स्कोर को जोड़ने के सरल गणित के विरुद्ध की।

3. बड़ी खोजें

A. "कंप्रेशन" प्रभाव (वॉल्यूम नॉब)

यदि एआई साधारण कैलकुलेटर होते, तो वे बस स्कोर जोड़ देते: बुरा (-10) + अच्छा (+10) = 0
लेकिन शोध में कुछ अलग पाया गया। एआई ऐसा व्यवहार करते हैं जैसे उनका वॉल्यूम नॉब (volume knob) कम किया गया हो

  • रूपक: कल्पना कीजिए कि आप दो तेज़ आवाज़ों को मिला रहे हैं। एक साधारण मिक्सर परिणाम को दोगुना तेज़ कर देगा। हालाँकि, ये एआई आवाज़ को "कंप्रेस" (दबाना) करते हैं। भले ही आप एक बहुत अच्छे कार्य को एक बहुत बुरे कार्य के साथ जोड़ दें, अंतिम निर्णय गणित के सुझाव के अनुसार उतना चरम नहीं होता है। एआई संयोजन के कुल प्रभाव को कम कर देता है।

B. "इंटेंसिटी एंकर" (Loud Speaker)

शोधकर्ताओं ने पाया कि एआई आवाजों के औसत के बजाय मिश्रण में सबसे तेज़ (loudest) आवाज पर अधिक ध्यान देता है।

  • रूपक: एक बैंड के बारे में सोचें। यदि आपके पास एक गिटारवादक है जो एक बहुत तेज़, शानदार सोलो (+2) बजा रहा है और एक ड्रमर है जो एक शांत, थोड़ा परेशान करने वाला बीट (-1) बजा रहा है, तो दर्शक सोलो को याद रखते हैं।
  • निष्कर्ष: एआई ने एक "सुपर गुड" कार्य और एक "मामूली बुरा" कार्य वाले प्रोफाइल को दो "मध्यम अच्छे" कार्यों वाले प्रोफाइल पर प्राथमिकता दी। भले ही कुल "अच्छाई" गणितीय रूप से समान थी, एआई उस एक तीव्र सकारात्मक कार्य द्वारा "एंकर" (anchored) हो गया था। उसने इस तथ्य को नज़रअंदाज़ कर दिया कि दूसरा विकल्प अधिक सुसंगत रूप से अच्छा था।

C. "सीक्रेट सॉस" (Residuals)

कार्यों के गणित को ध्यान में रखने के बाद, शोधकर्ताओं ने बचे हुए पूर्वाग्रहों (biases) की तलाश की।

  • निष्ठा (Loyalty): जब "निष्ठा" मिश्रण का हिस्सा थी, तो एआई ने इसे थोड़ा अतिरिक्त क्रेडिट दिया, जैसे कि उसके पास एक गुप्त बोनस हो।
  • देखभाल (Care): जब "देखभाल" (लोगों की रक्षा करना) मिश्रण का हिस्सा थी, तो एआई ने वास्तव में गणित के अनुमान से थोड़ा कम क्रेडिट दिया।
  • अन्य: अन्य नैतिक आधार (अधिकार, पवित्रता) बिल्कुल वैसा ही व्यवहार करते जैसा गणित ने भविष्यवाणी की थी, बिना किसी गुप्त बोनस या दंड के।

D. सभी सहमत हैं

अंत में, शोधकर्ताओं ने 10 अलग-अलग शीर्ष-स्तरीय एआई मॉडल का परीक्षण किया जो विभिन्न कंपनियों (जैसे OpenAI, Google, Anthropic, आदि) से थे।

  • निष्कर्ष: भले ही ये मॉडल अलग-अलग तरह से बनाए गए हों, वे सभी नैतिक साक्ष्य को लगभग बिल्कुल एक ही तरह से "मिक्स" करते हैं। वे सभी वॉल्यूम को कंप्रेस करते हैं, सभी सबसे तीव्र कार्य द्वारा एजी (anchor) होते हैं, और उन सभी में देखभाल के ऊपर निष्ठा का समान पूर्वाग्रह होता है। यह किसी एक विशिष्ट रोबोट की खराबी नहीं है; यह वर्तमान उन्नत एआई का एक साझा गुण है।

मुख्य निष्कर्ष (The Bottom Line)

शोध पत्र यह निष्कर्ष निकालता है कि हम केवल यह देखकर एआई की नैतिकता को नहीं समझ सकते कि वह एकल कार्यों को कैसे रैंक करता है। हमें यह देखना होगा कि वह उन्हें कैसे मिलाता (mix) है।

वर्तमान एआई केवल अच्छे और बुरे कार्यों को जोड़ नहीं रहे हैं। वे कुल प्रभाव को कंप्रेस करते हैं, सबसे तीव्र एकल कार्य से विचलित होते हैं, और देखभाल के ऊपर निष्ठा के लिए छिपे हुए पूर्वाग्रह रखते हैं। एआई की नैतिकता का ऑडिट करने के लिए, हमें इन "मिश्रण नियमों" (mixing rules) का परीक्षण करना होगा, न कि केवल सामग्रियों का।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →