← नवीनतम पेपर
🤖 AI

Learning the Value Systems of Societies with Preference-based Multi-objective Reinforcement Learning

यह शोध पत्र एक प्राथमिकता-आधारित बहु-उद्देश्यीय सुदृढीकरण शिक्षण ढांचे का प्रस्ताव करता है जो सामाजिक रूप से व्युत्पन्न मूल्य संरेखण मॉडलों और विशिष्ट मूल्य प्रणालियों को संयुक्त रूप से सीखने के लिए एजेंटों को क्लस्टर करता है, जिससे एक समाज के भीतर विविध उपयोगकर्ता प्राथमिकताओं के अनुकूल पारेटो-इष्टतम नीतियों का सृजन सक्षम होता है।

मूल लेखक: Andrés Holgado-Sánchez, Peter Vamplew, Richard Dazeley, Sascha Ossowski, Holger Billhardt

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Andrés Holgado-Sánchez, Peter Vamplew, Richard Dazeley, Sascha Ossowski, Holger Billhardt

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें


"डिप्लोमैट एआई" (Diplomat AI): मशीनें समाज के विभिन्न मूल्यों को समझना कैसे सीखती हैं

कल्पना कीजिए कि आप एक पूरे शहर के लिए एक नया, अत्यधिक बुद्धिमान डिजिटल सहायक बना रहे हैं। समस्या यह है: इस शहर के लोग एक जैसे नहीं हैं।

एक समूह में "सेफ्टी फैन्स" (सुरक्षा प्रेमी) हैं: वे चाहते हैं कि एआई हर काम बहुत सावधानी से करे, भले ही इसमें अधिक समय लगे। दूसरे समूह में "एफिशिएंसी जंकीज़" (दक्षता के शौकीन) हैं: उन्हें इससे फर्क नहीं पड़ता कि थोड़ा जोखिम हो, जब तक कि लक्ष्य जल्दी प्राप्त हो जाए। और फिर "एनवायरनमेंटल प्रोटेक्टर्स" (पर्यावरण रक्षक) हैं, जिनके लिए स्थिरता (सस्टेनेबिलिटी) सबसे महत्वपूर्ण है।

यदि एआई अब केवल एक मानक मोड का उपयोग करता है, तो वह लगातार किसी न किसी को परेशान करेगा। वह या तो दक्षता के शौकीनों के लिए बहुत धीमा होगा या सुरक्षा प्रेमियों के लिए बहुत लापरवाह।

समस्या: "वन-साइज़-फिट्स-ऑल डिलेमा" (एक ही नियम सबके लिए उपयुक्त होने का संकट)

पिछले एआई अक्सर एक "औसत मूल्य" खोजने की कोशिश करते हैं। यह एक रेस्टोरेंट में सभी मेहमानों के लिए केवल एक ही प्रकार का सूप बनाने जैसा है जिसका स्वाद "औसत" हो: न बहुत नमकीन, न बहुत मीठा, लेकिन अंत में, वह किसी के लिए भी वास्तव में स्वादिष्ट नहीं होता। तकनीकी शब्दों में, इसे "मिस-स्पेसिफिकेशन" (mis-specification) कहा जाता है।

शोधकर्ताओं का समाधान: "क्लस्टर मॉडल"

शोधकर्ताओं (होल्गाडो-सांचेज़ और उनकी टीम) ने एक नया दृष्टिकोण विकसित किया है। सभी लोगों को एक ही बर्तन में डालने के बजाय, उनका एआई एक कुशल डिप्लोमैट (राजनयिक) या समाजशास्त्री की तरह काम करता है।

एआई तीन चरणों में आगे बढ़ता है:

  1. वैल्यू मैप (ग्राउंडिंग): सबसे पहले, एआई सीखता है कि शब्दों का वास्तविक अर्थ क्या है। वास्तविक स्थिति में "सुरक्षा" का क्या मतलब है? यह "मूल्यों की भाषा" सीखता है।
  2. समूह निर्माण (क्लस्टरिंग): एआई लोगों का अवलोकन करता है। वह देखता है: "आह, ये 30% लोग एक जैसा सोचते हैं, बाकी 20% भी ऐसा ही करते हैं।" वह अदृश्य समूह (क्लस्टर्स) बनाता है। वह यह नहीं कहता: "मैं हर व्यक्ति को जानता हूँ," बल्कि यह कहता है: "मैं इस समाज में विभिन्न जीवन डिजाइनों को पहचानता हूँ।"
  3. अनुकूलित व्यवहार (पॉलिसी): इन समूहों में से प्रत्येक के लिए, एआई अपनी खुद की "रणनीति" विकसित करता है। यदि एआई को पता है कि वह वर्तमान में "सेफ्टी ग्रुप" के लिए काम कर रहा है, तो वह स्वचालित रूप से सतर्क मोड में बदल जाता है।

एआई यह कैसे सीखता है? ("प्रश्न-और-उत्तर खेल")

एआई रटकर नहीं सीखता, बल्कि तुलनाओं के माध्यम से सीखता है। वह लोगों को दो अलग-अलग रास्ते दिखाता है (जैसे, एक स्वायत्त कार के लिए दो अलग-अलग मार्ग) और पूछता है: "आपको कौन सा रास्ता बेहतर लगता है?"

लोग केवल यह उत्तर नहीं देते कि "मार्ग A बेहतर है," बल्कि वे यह भी कहते हैं कि: "मार्ग A बेहतर है क्योंकि यह अधिक सुरक्षित है।" इस तरह, एआई न केवल क्या को समझता है, बल्कि क्यों को भी समझता है। यह उस बच्चे की तरह है जो न केवल यह सीखता है कि आग गर्म होती है, बल्कि यह भी समझता है कि क्यों उसे छूना नहीं चाहिए।

यह क्यों महत्वपूर्ण है?

भविष्य में, एआई हमारे शहरों, हमारी कारों और हमारे अस्पतालों में निर्णय लेंगे। हमें इन मशीनों पर भरोसा करने के लिए, उन्हें एक निश्चित एल्गोरिदम के अनुसार कठोरता से कार्य नहीं करना चाहिए। उन्हें हमारी समाज की विविधता का सम्मान करना चाहिए।

शोधकर्ताओं ने इस प्रणाली के साथ सिद्ध किया है कि एक एआई समाज के विभिन्न "वैल्यू क्लाउड्स" (मूल्यों के बादलों) को पहचानना सीख सकता है और प्रत्येक क्लाउड के लिए उपयुक्त, निष्पक्ष व्यवहार खोज सकता है।

संक्षेप में: एआई केवल कार्यों को हल करना नहीं सीखता; वह लोगों के "नैतिक मानचित्र" (moral map) को पढ़ना सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →