← नवीनतम पेपर
💻 computer science

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

यह शोध पत्र MM-SCALE प्रस्तुत करता है, जो एक बड़े पैमाने का डेटासेट और ढांचा है जो विज़न-लैंग्वेज मॉडल्स की नैतिक तर्क क्षमता को बेहतर बनाने के लिए विविक्त बाइनरी सुपरविजन (discrete binary supervision) के स्थान पर निरंतर 5-पॉइंट स्केलर रेटिंग और ग्राउंडेड लिस्टवाइज़ अलाइनमेंट (grounded listwise alignment) का उपयोग करता है, ताकि मानवीय नैतिक निर्णयों की सूक्ष्म और बहुलवादी प्रकृति को बेहतर ढंग से समझा जा सके।

मूल लेखक: Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह सिखा रहे हैं कि तस्वीरें देखते और कहानियाँ पढ़ते समय एक "अच्छा इंसान" कैसे बना जाए।

समस्या: रोबोट बहुत ही 'ब्लैक-एंड-व्हाइट' (एकध्रुवीय) है
वर्तमान में, अधिकांश रोबोट (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) को दुनिया को सख्त "अच्छे बनाम बुरे" के बक्सों में देखने के लिए प्रशिक्षित किया जाता है। यदि आप उन्हें किसी अजनबी की मदद करते हुए व्यक्ति की तस्वीर दिखाते हैं, तो वे कहते हैं "अच्छा।" यदि वे किसी अजनबी को धक्का देते हुए देखते हैं, तो वे कहते हैं "बुरा।"

लेकिन वास्तविक जीवन कोई ब्लैक-एंड-व्हाइट फिल्म नहीं है; यह रंगों का एक पूरा स्पेक्ट्रम है। कभी-कभी, "अजनबी की मदद करना" बहुत अच्छा होता है (जैसे बारिश में किसी को सवारी देना)। लेकिन अन्य समय में, यह जोखिम भरा हो सकता है (जैसे देर रात किसी संदिग्ध इलाके में अजनबी को सवारी देना)। रोबोट सूक्ष्म बारीकियों को समझने में संघर्ष करता है। वे सभी "मदद करने" को समान रूप से अच्छा मान लेते हैं, और उस संदर्भ (context) को भूल जाते हैं जो किसी स्थिति को खतरनाक या स्वीकार्य बनाता है।

समाधान: MM–SCALE
शोधकर्ताओं ने एक नया टूल बनाया जिसे MM–SCALE (मल्टीमॉडल मोरल स्केल) कहा जाता है। इसे एक रोबोट के लिए एक विशाल, हाई-डेफिनिशन प्रशिक्षण नियमावली (training manual) के रूप में समझें, लेकिन इसमें दो विशेष विशेषताएं हैं:

  1. 1-से-5 स्टार रेटिंग (स्केलर जजमेंट): केवल यह पूछने के बजाय कि "क्या यह अच्छा है या बुरा?", उन्होंने मनुष्यों से 1 से 5 के पैमाने पर परिदृश्यों को रेट करने के लिए कहा।
    • उपमा: कल्पना कीजिए कि आप एक रेस्टोरेंट की समीक्षा कर रहे हैं। एक बाइनरी सिस्टम केवल आपको "इसे खाओ" या "इसे मत खाओ" कहने की अनुमति देता है। MM–SCALE आपको यह कहने की अनुमति देता है कि "यह ठीक है, लेकिन सूप ठंडा था," या "यह अद्भुत है, लेकिन थोड़ा तीखा है।" यह रोबट को सिखाता है कि कुछ कार्य काफी अच्छे होते हैं, कुछ काफी बुरे होते हैं, और कुछ बीच में होते हैं।
  2. "क्यों" टैग (ग्राउंडेड रीजनिंग): शोधकर्ताओं ने मनुष्यों से यह भी पूछा कि उन्होंने एक निश्चित रेटिंग क्यों दी। क्या उन्होंने निर्णय टेक्स्ट (कहानी) के आधार पर लिया, इमेज (जो वे देख रहे हैं) के आधार पर, या दोनों के आधार पर?
    • उपमा: कल्पना कीजिए कि आप एक जादू के खेल का न्याय कर रहे हैं। यदि आप कहते हैं "वह नकली था," तो क्या आप इसलिए कह रहे हैं क्योंकि कहानी ने कहा कि यह एक ट्रिक थी, या इसलिए क्योंकि आपने तस्वीर में छिपा हुआ तार देखा? MM–SCALE रोबोट को यह सिखाता है कि उसे यह पहचानना चाहिए कि कौन सा सुराग (तस्वीर या शब्द) वास्तव में निर्णय को संचालित कर रहा है।

उन्होंने इसे कैसे बनाया: "MORALE" इंटरफ़ेस
इस डेटासेट को बनाने के लिए, टीम ने MORALE नामक एक विशेष वेबसाइट बनाई।

  • उन्होंने सामाजिक स्थितियों (जैसे ट्रैफिक में दौड़ता हुआ बच्चा) की हजारों छवियां तैयार कीं।
  • उन्होंने प्रत्येक छवि के लिए अलग-अलग कहानी परिदृश्य लिखे (जैसे, "बच्चा लुका-छिपी खेल रहा है" बनाम "बच्चा कार की ओर दौड़ रहा है")।
  • मनुष्यों ने छवि और कहानी को देखा, 1-5 की रेटिंग दी, और टैग किया कि चित्र या शब्द अधिक महत्वपूर्ण थे।
  • "असहमति" लूप (The Disagreement Loop): सिस्टम ने रोबोट का अनुमान भी दिखाया। यदि रोबोट ने "सुरक्षित" का अनुमान लगाया लेकिन इंसान ने "असुरक्षित" कहा, तो सिस्टम ने इसे फ्लैग कर दिया। इसने मानव को दोबारा जांच करने के लिए मजबूर किया कि वे असहमत क्यों थे, जिससे शोधकर्ताओं को उन पेचीदा मामलों को खोजने में मदद मिली जहाँ रोबोट भ्रमित था।

परिणाम: एक स्मार्ट, अधिक सूक्ष्म रोबोट
जब उन्होंने इस नए MM–SCALE डेटा का उपयोग करके रोबोट को प्रशिक्षित किया, तो परिणाम प्रभावशाली थे:

  • बेहतर रैंकिंग: जब उन्हें "सबसे सुरक्षित" से "सबसे कम सुरक्षित" तक परिदृश्यों की एक सूची को क्रमबद्ध करने के लिए कहा गया, तो MM–SCALE से प्रशिक्षित रोबोट पुराने "अच्छे/बुरे" डेटा पर प्रशिक्षित रोबोट की तुलना में बहुत बेहतर काम कर रहे थे। वे "थोड़ा जोखिम भरा" और "बहुत खतरनाक" के बीच अंतर बता सकते थे।
  • स्थिरता (Stability): वे केवल अंदाज़ा नहीं लगा रहे थे; उनके आत्मविश्वास का स्तर वास्तविकता के साथ बेहतर ढंग से मेल खाता था।
  • "इमेज" का आश्चर्य: अध्ययन में पाया गया कि 68% बार, मनुष्यों ने तस्वीर देखने के बाद अपने नैतिक निर्णय को बदल दिया। उदाहरण के लिए, टेक्स्ट कह सकता है "मदद करना," जो अच्छा लगता है। लेकिन यदि तस्वीर दिखाती है कि व्यक्ति वास्तव में ट्रैफिक में धक्का दिया जा रहा है, तो इंसान अपना मन बदल लेता है। इस नए प्रशिक्षण पद्धति ने रोब सहित रोबोट को उस विजुअल सुराग पर ध्यान देने के लिए सिखाया।

संक्षेप में
यह पेपर तर्क देता है कि AI को नैतिक रूप से स्मार्ट बनाने के लिए, हम केवल उसे "सही बनाम गलत" नहीं सिखा सकते। हमें उसे सही और गलत का स्पेक्ट्रम सिखाना होगा, और यह दिखाना होगा कि विजुअल दुनिया कैसे किसी स्थिति के अर्थ को बदल देती है। MM–SCALE पहला बड़ा डेटासेट है जो ऐसा करता है, जो रोबोट को यह समझने में मदद करता है कि संदर्भ (context) ही सब कुछ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →