← नवीनतम पेपर
🤖 AI

Informing AI Policy Assessment using Large-Scale Simulation of Interventions

यह शोध पत्र एक ऐसी कार्यप्रणाली प्रस्तुत करता है जो सहभागी मूल्यांकन, विशेषज्ञ लागत मूल्यांकन और जेनेटिक एल्गोरिदम सिमुलेशन के भीतर एलएलएम-आधारित हानि शमन विश्लेषण को जोड़ती है ताकि नीति निर्माताओं को कार्यान्वयन लागत, हितधारक इनपुट और प्रभावशीलता के बीच विविध समझौतों (ट्रेड-ऑफ) का अन्वेषण करके व्यवहार्य एआई नीति विकल्पों की पहचान करने और उन्हें प्राथमिकता देने में मदद मिल सके।

मूल लेखक: Julia Barnett, Kimon Kieslich, Natali Helberger, Nicholas Diakopoulos

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Julia Barnett, Kimon Kieslich, Natali Helberger, Nicholas Diakopoulos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हलचल भरे शहर के मेयर हैं, और एक नया, शक्तिशाली उपकरण आया है: आर्टिफिशियल इंटेलिजेंस (AI)। हालांकि यह उपकरण अद्भुत चीजें कर सकता है, लेकिन यह मुश्किलें भी पैदा कर रहा है। यह फर्जी खबरें फैला रहा है, लोगों की नौकरियां छीन रहा है, और सुर्खियों को ज़रूरत से ज़्यादा नाटकीय बना रहा है। आपके पास सैकड़ों अलग-अलग रिंच, हथौड़े और पेचकशों से भरा एक विशाल टूलबॉक्स है (ये नीतिगत विकल्प/policy options हैं)। लेकिन आप उन सभी का उपयोग एक साथ नहीं कर सकते; कुछ बहुत महंगे हैं, कुछ को लागू करना कठिन है, और कुछ शायद समस्या को हल भी न कर पाएं।

सवाल यह है कि: आप बिना बजट बिगाड़े या नागरिकों की इच्छाओं को नज़रअंदाज़ किए, इस गड़बड़ी को ठीक करने के लिए विकल्पों का कौन सा संयोजन (combination) चुनेंगे?

बार्नेट और उनके सहयोगियों का यह शोध पत्र इस सवाल का जवाब देने का एक नया तरीका पेश करता है। उन्होंने एक "पॉलिसी सिम्युलेटर" (Policy Simulator) बनाया है जो एक हाई-टेक, डिजिटल 'ट्रायल-एंड-एरर' मशीन की तरह काम करता है। यह कैसे काम करता है, इसे सरल भागों में यहाँ दिया गया है:

1. रेसिपी के तीन घटक

सबसे अच्छा नीति मिश्रण खोजने के लिए, सिम्युलेटर तीन प्रतिस्पर्धी घटकों को संतुलित करता है, जैसे एक शेफ सूप चखते समय स्वाद को संतुलित करता है:

  • "हानि न्यूनीकरण" का स्वाद (प्रभावशीलता): क्या यह नीति वास्तव में AI के बुरे व्यवहार को रोकती है? शोधकर्ताओं ने इन नीतियों को लागू करने वाले भविष्य के काल्पनिक किस्से बनाने के लिए AI का उपयोग किया और पूछा: "क्या समस्या बेहतर हुई?"
  • "कीमत का टैग" का स्वाद (लागत): इसे लागू करने में कितने पैसे और प्रयास लगेंगे? विशेषज्ञों के एक पैनल (वकील, तकनीकी विशेषज्ञ, पत्रकार) ने प्रत्येक नीति को "सस्ता और आसान" से लेकर "महंगा और असंभव" तक रेट किया।
  • "नागरिक वोट" का स्वाद (भागीदारी): आम लोग क्या चाहते हैं? शोधकर्ताओं ने आम नागरिकों (lay stakeholders) से पूछा कि उन्हें कौन सी नीतियां सबसे महत्वपूर्ण लगीं और वे किससे सहमत थे।

2. "इवोल्यूशनरी" सर्च इंजन

समस्या यह है कि नीतियों के अरबों संभावित संयोजन हैं। यदि आप हर एक संयोजन का परीक्षण करने की कोशिश करते, तो इसमें ब्रह्मांड की आयु से भी अधिक समय लग जाता।

इसे हल करने के लिए, लेखकों ने एक जेनेटिक एल्गोरिदम (Genetic Algorithm) का उपयोग किया। इसे कुत्तों के प्रजनन या एक बगीचा उगाने जैसा समझें:

  • पीढ़ी 1 (Generation 1): कंप्यूटर नीतियों के एक यादृच्छिक मिश्रण (पिल्लों का एक समूह) के साथ शुरुआत करता है।
  • परीक्षण: यह देखता है कि कौन से पिल्ले "सबसे फिट" हैं (वे जो हानि न्यूनीकरण, कम लागत और उच्च नागरिक समर्थन को सबसे अच्छी तरह संतुलित करते हैं)।
  • प्रजनन (Breeding): यह पहले समूह की सबसे अच्छी नीतियों को लेता है और उन्हें आपस में "मिलाकर" एक नई पीढ़ी बनाता है, जो उम्मीद है कि बेहतर होगी।
  • उत्परिवर्तन (Mutation): कभी-कभी, यह देखने के लिए कि क्या कोई अचानक बदलाव स्थिति को बेहतर बनाता है, यह बेतरतीब ढंग से एक नीति को अंदर या बाहर बदल देता है।
  • दोहराना: यह तब तक बार-बार होता रहता है, पीढ़ी दर पीढ़ी, जब तक कि यह विजेता नीति संयोजनों को नहीं खोज लेता जिन्हें हराना मुश्किल हो।

3. AI का "जादू"

चूंकि वे हजारों वास्तविक लोगों से लाखों भविष्य की कहानियों को पढ़ने और रेट करने के लिए नहीं कह सकते थे, इसलिए उन्होंने एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग एक प्रतिनिधि के रूप में किया।

  • कल्पना करें कि LLM एक बहुत ही प्रशिक्षित अभिनेता है। शोधकर्ताओं ने पहले इस अभिनेता को यह सिखाया कि वास्तविक नागरिकों की तरह कैसे सोचना और महसूस करना है, इसके लिए उसे वास्तविक लोगों द्वारा कहानियों को दिए गए हजारों उदाहरण दिखाए।
  • एक बार जब यह अभिनेता जनता के साथ "संरेखित" (aligned) हो गया, तो उन्होंने इसका उपयोग लाखों सिम्युलेटेड भविष्य के परिदृश्यों को पढ़ने और रेट करने के लिए किया। इसने उन्हें शुरुआती स्क्रीनिंग के लिए सेना की तरह लोगों को काम पर रखने की आवश्यकता से बचा लिया।

4. उन्होंने क्या पाया (परिणाम)

जब उन्होंने अलग-अलग "रेसिपी" (तीन घटकों के वजन को बदलकर) के साथ सिम्युलेटर चलाया, तो उन्हें बहुत अलग परिणाम मिले:

  • यदि आप केवल नुकसान रोकने की परवाह करते हैं: सिम्युलेटर सुझाव देता है कि नीतियों की एक लंबी सूची होनी चाहिए। यह एक लीक होती छत को ठीक करने के लिए उस पर हजार बोर्ड ठोकने जैसा है। यह लीक रोकने में बहुत अच्छा काम करता है, लेकिन यह अविश्वसनीय रूप से महंगा है और शायद असंभव भी हो सकता है।
  • यदि आप केवल पैसा बचाने या जनता की बात सुनने की परवाह करते हैं: सिम्युलेटर 1 या 2 नीतियों की एक छोटी सूची का सुझाव देता है। ये सस्ती और लोकप्रिय हैं, लेकिन ये AI की समस्याओं को बहुत अच्छी तरह से नहीं रोक सकती हैं।
  • यदि आप तीनों को संतुलित करते हैं: सिम्युलेटर एक "स्वीट स्पॉट" (सही संतुलन) पाता है। यह आमतौर पर 1 या 2 नीतियों की एक छोटी, प्रबंधनीय सूची का सुझाव देता है जो जनता के बीच लोकप्रिय हैं, मध्यम लागत वाली हैं, और अभी भी नुकसान को कम करने में अच्छा काम करती हैं।

मुख्य निष्कर्ष: कोई एक "परफेक्ट" नीति नहीं है। सबसे अच्छा चुनाव पूरी तरह से इस बात पर निर्भर करता है कि निर्णय लेने वाला क्या महत्व देता है। यदि आप सुरक्षा को सबसे ऊपर रखते हैं, तो आपको एक अलग सूची मिलेगी, बजाय इसके कि आप पैसा बचाने को प्राथमिकता दें।

5. सुरक्षा जाल (Safety Net)

लेखक इस बात पर बहुत स्पष्ट हैं: यह उपकरण अंतिम निर्णय नहीं लेता है। यह वह रोबोट नहीं है जो कहता है, "यहाँ वह कानून है जिसे आपको पारित करना चाहिए।"

इसके बजाय, यह एक निर्णय-सहायता मानचित्र (decision-support map) है। यह नीति निर्माताओं को संभावनाओं के परिदृश्य को दिखाता है। यह कहता है, "यदि आप X चाहते हैं, तो आपके पास ये सबसे अच्छे विकल्प हैं। यदि आप Y चाहते हैं, तो आपके पास विकल्पों का एक अलग सेट है।" यह नेताओं को किसी ऐसी नीति पर वास्तविक पैसा या समय खर्च करने से पहले, जो विफल हो सकती है, स्पष्ट रूप से ट्रेड-ऑफ (समझौतों) को देखने में मदद करता है।

संक्षेप में, यह पेपर एक डिजिटल सैंडबॉक्स प्रदान करता है जहाँ नेता विभिन्न नीति संयोजनों के साथ खेल सकते हैं ताकि यह देखा जा सके कि उनके विशिष्ट लक्ष्यों के लिए क्या सबसे अच्छा काम करता है, जिससे यह सुनिश्चित होता है कि वे ऐसी नीति न चुनें जो बहुत महंगी, बहुत अलोकप्रिय, या बस अप्रभावी हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →