The Foreign Policy AI Evaluation Gap
यह शोध पत्र तर्क देता है कि विदेश नीति कूटनीति में निहित अद्वितीय संरचनात्मक जटिलताओं और विनाशकारी जोखिमों के लिए एक मांग-पक्ष मूल्यांकन ढांचे को विकसित करने हेतु एक तत्काल, साहित्य-आधारित अनुसंधान एजेंडा आवश्यक है जो उच्च-परिणाम वाले वर्कफ़्लो को मूल्यांकनीय उप-कार्यों में विभाजित कर सके, जिससे इस क्षेत्र के लिए तकनीकी एआई (AI) शासन में वर्तमान महत्वपूर्ण अंतराल को संबोधित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: कोहरे से भरे युद्ध क्षेत्र में टैंक चलाना
कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार को गाड़ी चलाना सिखा रहे हैं। एक सामान्य शहर में, आप इसे एक ट्रैक पर टेस्ट कर सकते हैं, यह माप सकते हैं कि यह कितनी जल्दी रुकती है, और देख सकते हैं कि क्या यह किसी शंकु (cone) से टकराती है। यदि यह विफल हो जाती है, तो आप बस कार को रीसेट करते हैं और फिर से प्रयास करते हैं।
अब, कल्पना कीजिए कि उसी सेल्फ-ड्राइविंग कार का उपयोग एक कोहरे से भरे युद्ध क्षेत्र में एक टैंक चलाने के लिए किया जा रहा है जहाँ नियम हर मिनट बदलते हैं, दुश्मन सक्रिय रूप से आपके सेंसरों को धोखा देने की कोशिश कर रहा है, और एक छोटी सी गलती भी परमाणु युद्ध या अकाल का कारण बन सकती है।
यह शोध पत्र तर्क देता है कि हम वर्तमान में इस "युद्ध क्षेत्र में टैंक" (जिसे लेखक विदेशी नीति या राजनीति कहते हैं) के लिए AI बनाने की कोशिश कर रहे हैं, लेकिन हम उन्हीं सरल "शहर में ड्राइविंग" वाले परीक्षणों का उपयोग कर रहे हैं जो हम सामान्य सेल्फ-ड्राइविंग कारों के लिए करते हैं। लेखक कहते हैं कि यह खतरनाक है क्योंकि ये परीक्षण वास्तविकता से मेल नहीं खाते, और कोई भी गलतियों को होने से पहले पकड़ने के लिए करीब से निगरानी नहीं कर रहा है।
यह इतना कठिन क्यों है? (तीन बड़ी समस्याएँ)
यह पेपर बताता है कि विदेशी नीति को तीन मुख्य कारणों से टेस्ट करना अनूठे रूप से कठिन है:
नक्शा गायब है (असीमित कार्य स्थान - Unbounded Action Space):
- उपमा: 'डिप्लोमेसी' जैसे वीडियो गेम में, निर्धारित नियम और एक बोर्ड होता है। वास्तविक दुनिया की विदेशी नीति में, कोई बोर्ड नहीं है। "नियम" खिलाड़ियों द्वारा स्वयं तोड़े या फिर से लिखे जा सकते हैं। AI को यह समझना होगा कि क्या करना है जब खेल ही बदल रहा हो।
- समस्या: आप AI के लिए एक साधारण चेकलिस्ट नहीं लिख सकते क्योंकि विकल्प अनंत हैं और नियम तरल (fluid) हैं।
सच्चाई छिपी हुई है (विवादित सत्य - Contested Ground Truth):
- उपमा: पोकर खेलने की कल्पना करें जहाँ अन्य खिलाड़ी अपने कार्डों के बारे में झूठ बोल रहे हैं, और आप उनके चेहरे नहीं देख सकते। विदेशी नीति में, देश अक्सर अपने वास्तविक इरादों को छिपाते हैं या वे क्या चाहते हैं, इस बारे में झूठ बोलते हैं।
- समस्या: AI को सीखने के लिए "सत्य" की आवश्यकता होती है। लेकिन कूटनीति में, "सत्य" अक्सर एक रहस्य या एक झूठ होता है। यदि AI झूठ से सीखता है, तो वह गलत निर्णय लेगा।
कोई एकल स्कोरबोर्ड नहीं है (बहुआयामी उद्देश्य - Multidimensional Objectives):
- उपमा: एक दौड़ में, लक्ष्य सरल है: फिनिश लाइन को सबसे पहले पार करना। विदेशी नीति में, एक देश एक व्यापार सौदा (trade deal) जीतना चाह सकता है, लेकिन साथ ही अपने सहयोगियों को खुश रखना, युद्ध से बचना और यह सुनिश्चित करना भी चाहता है कि उसके अपने मतदाता नाराज न हों। ये लक्ष्य अक्सर एक-दूसरे से टकराते हैं।
- समस्या: आप AI को ग्रेड कैसे देंगे? क्या इसने व्यापार सौदा जीता लेकिन युद्ध हार गया? क्या इसने शांति स्थापित की लेकिन मतदाताओं को नाराज कर दिया? सफलता के लिए कोई एक एकल "A+" स्कोर नहीं है।
शोध में "अंध बिंदु" (The Blind Spot)
लेखकों ने AI सुरक्षा और शासन के बारे में हजारों शोध पत्रों का अध्ययन किया। उन्होंने एक बड़ा अंतर पाया:
- हमारे पास क्या है: सामान्य AI को टेस्ट करने के बारे में बहुत अधिक शोध (जैसे यह देखना कि क्या यह कविता लिख सकता है या गणित की समस्या हल कर सकता है)।
- हमारे पास क्या नहीं है: विदेशी नीति के लिए विशेष रूप से AI को टेस्ट करने के बारे में लगभग कोई शोध नहीं है।
उन्होंने पाया कि 99.98% प्रासंगिक पेपर मूल्यांकन (Assessment) (केवल मॉडल के कौशल का परीक्षण करना) पर ध्यान केंद्रित करते हैं, लेकिन अन्य 50% को अनदेखा करते हैं जिनकी आवश्यकता है: पहुंच (Access) (टेस्ट करने के लिए डेटा प्राप्त करना), सत्यापन (Verification) (यह साबित करना कि यह काम करता है), सुरक्षा (Security) (इसे हैकर्स से सुरक्षित रखना), परिचालन (Operationalization) (मनुष्य वास्तव में इसका उपयोग कैसे करते हैं), और पारिस्थितिकी तंत्र की निगरानी (Ecosystem Monitoring) (पूरे सिस्टम की समय के साथ निगरानी करना)।
यह एक ऐसे मैकेनिक की तरह है जो इंजन ऑयल की जांच करने में तो बहुत अच्छा है (Assessment) लेकिन बोनट के नीचे देखने, ब्रेक की जांच करने या ड्राइवर से यह पूछने से इनकार करता है कि सड़क पर कार कैसी महसूस हो रही है।
प्रस्तावित समाधान: "टास्क कार्ड्स", "लीडरबोर्ड्स" के बजाय
लेख का सुझाव है कि हम एक विशाल "लीडरबोर्ड" बनाने की कोशिश करना बंद कर दें जो यह रैंक करे कि कौन सा AI सबसे अच्छा "राजनयिक" है। इसके बजाय, हमें विदेशी नीति को छोटे, प्रबंधनीय कार्यों में तोड़ देना चाहिए, जैसे एक शेफ एक जटिल भोजन को काटने, भूनने और सजाने (plating) में विभाजित करता है।
वे एक डिमांड-साइड इवैल्यूएशन (Demand-Side Evaluation) का प्रस्ताव देते हैं:
- यह न पूछें: "क्या यह AI कूटनीति में अच्छा है?"
- यह पूछें: "क्या यह AI एक मानव विश्लेषक को किसी विशिष्ट संधि खंड (treaty clause) के लिए सही सबूत खोजने में मदद कर सकता है?" या "क्या यह AI उस संकेत को पहचान सकता है कि संघर्ष बढ़ने वाला है?"
यह कैसे काम करता है:
- इसे विभाजित करें: एक बड़े विदेशी नीति वर्कफ़्लो को छोटे, सीमित कार्यों में काट लें।
- ह्यूमन इन द लूप (Human in the loop): AI छोटा कार्य करता है (जैसे एक वाक्य का मसौदा तैयार करना या तथ्य ढूंढना), लेकिन एक मानव विशेषज्ञ हमेशा अंतिम निर्णय लेने और जिम्मेदारी लेने वाला व्यक्ति होता है।
- विशिष्ट कार्य का परीक्षण करें: हम यह परीक्षण करते हैं कि क्या AI ने वह विशिष्ट छोटा कार्य अच्छी तरह से किया है, बजाय इसके कि उसके पूरे व्यक्तित्व का निर्णय करने की कोशिश की जाए।
"इम्पैक्ट स्टेटमेंट" (यह क्यों महत्वपूर्ण है)
लेखक बहुत स्पष्ट हैं: वे ये AI सिस्टम बना नहीं रहे हैं। वे इनके लिए सुरक्षा मैनुअल (safety manuals) बना रहे हैं।
वे चेतावनी देते हैं कि यदि हम इन प्रणालियों का परीक्षण करने का तरीका नहीं सुधारते हैं, तो हम अनजाने में सरकारों को एक ऐसा उपकरण दे सकते हैं जो झूठ बोलने, हेरफेर करने या संघर्ष शुरू करने में बहुत कुशल है, क्योंकि हमने इसे केवल सरल, नकली परिदृश्यों पर टेस्ट किया था।
निष्कर्ष:
हम शक्तिशाली, खतरनाक उपकरणों (AI) को उन लोगों को सौंप रहे हैं जो दुनिया की सबसे खतरनाक समस्याओं (युद्ध और शांति) का प्रबंधन करते हैं, लेकिन हमने अभी तक सुरक्षा हार्नेस (safety harnesses) नहीं बनाए हैं। यह पेपर कहता है: "एक बार में पूरे हार्नेस को टेस्ट करने की कोशिश करना बंद करें। आइए प्रत्येक कार्य के लिए छोटे, सुरक्षित क्लिप बनाएं, और सुनिश्चित करें कि एक इंसान हमेशा रस्सी को थामे हुए है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।