← नवीनतम पेपर
🤖 AI

MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents

यह शोध पत्र MoralityGym को प्रस्तुत करता है, जो 98 पदानुक्रमित नैतिक दुविधाओं और 'मोरैलिटी चेन्स' नामक एक नवीन औपचारिकता (फॉर्मलिज्म) से युक्त एक बेंचमार्क है, ताकि मनोविज्ञान और दर्शन के अंतर्दृनों को एकीकृत करके क्रमिक निर्णय लेने वाले एजेंटों के नैतिक संरेखण का मूल्यांकन और सुधार किया जा सके।

मूल लेखक: Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल शहर में नेविगेट करना सिखा रहे हैं। आप केवल यह नहीं चाहते कि रोबोट बिंदु A से बिंदु B तक जल्दी पहुँचे; आप चाहते हैं कि जब चीजें गलत हो जाएं, तो वह "अच्छे" विकल्प चुने। क्या होता है यदि रोबोट को किसी पैदल यात्री से टकराने या दीवार से टकराने के बीच चुनाव करना पड़े? यह AI Alignment की मूल चुनौती है: यह सुनिश्चित करना कि रोबोट उन तरीकों से कार्य करें जो मानवीय मूल्यों से मेल खाते हों।

"MoralityGym" नामक शोध पत्र इन पेचीदा नैतिक विकल्पों पर रोबोटों का परीक्षण और प्रशिक्षण देने का एक नया तरीका पेश करता है। यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।

1. समस्या: रोबोट को केवल एक मानचित्र की नहीं, बल्कि एक नैतिक दिशा-सूचक यंत्र (Moral Compass) की आवश्यकता है

वर्तमान AI सिस्टम निर्देश का पालन करने में बहुत अच्छे हैं ताकि वे एक इनाम (जैसे रेस पूरी करना) प्राप्त कर सकें। लेकिन जब वे एक "नैतिक दुविधा" (moral dilemma) का सामना करते हैं—जहाँ हर विकल्प से कुछ न कुछ नुकसान होता है—तो वे अक्सर भ्रमित हो जाते हैं। वे शायद सबसे अच्छा "गणितीय" उत्तर निकालने की कोशिश करेंगे (जैसे, "5 लोगों को बचाओ, 1 को खो दो") लेकिन उस मानवीय भावना को छोड़ देंगे कि "किसी को धकेलना गलत है," भले ही उससे अधिक जीवन बचते हों।

लेखक तर्क देते हैं कि मानवीय नैतिकता केवल एक संख्या नहीं है जिसे अधिकतम किया जाना है। यह एक श्रेणीबद्ध नियमों की सूची (hierarchical list of rules) की तरह है जहाँ कुछ नियम अन्य नियमों की तुलना में अधिक महत्वपूर्ण होते हैं, जो स्थिति पर निर्भर करते हैं।

2. समाधान: "मोरालिटी चेन्स" (नियम पुस्तिका)

इसे ठीक करने के लिए, शोधकर्ताओं ने Morality Chains नामक एक प्रणाली बनाई। इसे एक सख्त, रैंक वाली नियम पुस्तिका के रूप में सोचें।

  • उपमा: एक पारिवारिक रात्रिभोज की कल्पना करें।
    • नियम #1 (उच्चतम प्राथमिकता): "किसी को मत मारो।" (यह एक सख्त "नहीं" है)।
    • नियम #2 (मध्यम प्राथमिकता): "खाना बर्बाद मत करो।"
    • नियम #3 (सबसे कम प्राथमिकता): "अपनी सब्जियां खाओ।"

यदि आपको भोजन बर्बाद करने (नियम #2 तोड़ना) या किसी को मारने (नियम #1 तोड़ना) के बीच चयन करना है, तो आपको नियम #1 को सुरक्षित रखने के लिए नियम #2 को तोड़ना होगा। आप निचले स्तर के नियम को संतुष्ट करने के लिए शीर्ष नियम को कभी नहीं तोड़ते।

शोध पत्र में, वे इन नियमों को "Norms" कहते हैं। वे प्रत्येक नियम को एक "बल" या भार (weight) प्रदान करते हैं।

  • Prescribed (निर्धारित): चीजें जो आपको करनी ही चाहिए
  • Prohibited (वर्जित): चीजें जो आपको नहीं करनी चाहिए
  • Hierarchy (पदानुक्रम): प्रणाली यह सुनिश्चित करती है कि उच्च-प्राथमिकता वाले नियम का एक छोटा सा उल्लंघन हमेशा निम्न-प्राथमिकता वाले नियम के बड़े उल्लंघन से बदतर होता है।

3. परीक्षण: "MoralityGym" (प्रशिक्षण जिम)

यह देखने के लिए कि क्या रोबोट वास्तव में इन श्रृंखलाओं (chains) का पालन कर सकते हैं, लेखकों ने MoralityGym बनाया।

  • उपमा: इसे नैतिकता के परीक्षण के लिए डिज़ाइन किया गया एक वीडियो गेम स्तर समझें, जो दर्शनशास्त्र की कक्षा के प्रसिद्ध "ट्रॉली समस्या" (Trolley Problem) के समान है।
  • सेटअप: गेम में, एक रोबोट एक ग्रिड पर है। एक अनियंत्रित "ट्रॉली" (एक गाड़ी) लोगों के एक समूह की ओर बढ़ रही है। रोबोट:
    1. कुछ नहीं कर सकता (5 लोग घायल हो जाते हैं)।
    2. स्विच बदल सकता है (3 लोग घायल हो जाते हैं)।
    3. एक राहगीर को पटरी पर धकेल सकता है (1 व्यक्ति घायल होता है, लेकिन 3 बच जाते हैं)।

रोबोट को इस ग्रिड पर नेविगेट करना, लक्ष्य तक पहुँचना और निर्णय लेना होता है। "Morality Chain" रोबोट को बताती है कि कौन से नियम मायने रखते हैं। उदाहरण के लिए, एक चेन कह सकती है, "किसी व्यक्ति को सीधे धकेलना, उन्हें अप्रत्यक्ष रूप से ट्रॉली से टकराने देने की तुलना में अधिक बुरा है," भले ही गणित कहता हो कि धकेलने से अधिक जीवन बचते हैं।

4. प्रयोग: रोबोटों ने कैसा प्रदर्शन किया?

शोधकर्ताओं ने इस जिम में कई मानक AI प्रशिक्षण विधियों (जैसे PPO और CPO) का परीक्षण किया। वे देखना चाहते थे कि क्या रोबोट "Morality Chain" का पालन करना सीख सकते हैं या वे केवल अंक (points) अधिकतम करने की कोशिश करते हैं।

  • परिणाम:
    • Standard AI (मानक AI): अधिकांश मानक रोबोट विफल रहे। उन्होंने "गणित" करने की कोशिश की (कुल नुकसान को कम करना) लेकिन "नैतिक नियमों" (जैसे "लोगों को मत धकेलो") को अनदेखा कर दिया। वे ऐसे निर्णय लेने लगे जो मनुष्यों को निर्दयी और अनैतिक लगे।
    • "Shaped" AI: केवल एक रोबोट ही अच्छा प्रदर्शन कर सका जिसे एक विशेष "रिवॉर्ड शेपिंग" (reward shaping) गाइड दी गई थी। इस गाइड ने स्पष्ट रूप से रोबोट को बताया, "यदि आप शीर्ष नियम तोड़ते हैं, तो आपको भारी दंड मिलेगा।" इस रोबोट ने सरल कार्य पूरा करने के बजाय उच्च-स्तरीय नैतिक नियमों को प्राथमिकता देना सीख लिया।

5. यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI सुरक्षा विधियाँ पर्याप्त नहीं हैं। आप केवल रोबोट को "लोगों को चोट न पहुँचाएं" कहकर यह उम्मीद नहीं कर सकते कि वह इस सूक्ष्मता को समझेगा कि वह उन्हें कैसे चोट पहुँचा रहा है।

Morality Chains का उपयोग करके, हम एक ऐसी प्रणाली बना सकते हैं जो रोबोट का मूल्यांकन केवल इस आधार पर नहीं करती कि "क्या उन्होंने काम पूरा किया?" बल्कि इस आधार पर करती है कि "क्या उन्होंने हमारे जटिल, स्तरित नैतिक मूल्यों का सम्मान करते हुए काम पूरा किया?"

संक्षेप में: इस शोध पत्र ने रोबोटों के लिए एक "नैतिक ड्राइविंग टेस्ट" बनाया। इसने दिखाया कि बिना एक सख्त, रैंक वाली नियम पुस्तिका (Morality Chains) के, रोबोट अपने गंतव्य तक पहुँचने के लिए लापरवाही से गाड़ी चलाएंगे। नियम पुस्तिका के साथ, वे कठिन ट्रैफिक जाम में भी सुरक्षित और नैतिक रूप से गाड़ी चलाना सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →