The Undecidability of Artificial General Intelligence (AGI) Alignment
यह शोध पत्र यह स्थापित करता है कि एजीआई (AGI) संरेखण (alignment) असंभव नहीं बल्कि संरचनात्मक रूप से unverifiable (असिद्ध करने योग्य नहीं) है, जो ट्रैखटनब्रॉट की दीवार (Trakhtenbrot's Wall) और एक व्युत्पन्न साउंडनेस-कम्प्लीटनेस-ट्रैक्टेबिलिटी ट्रिलेमा (Soundness-Completeness-Tractability Trilemma) के माध्यम से यह सिद्ध करता है कि वर्तमान रोकथाम रणनीतियाँ अस्थायी सुधार नहीं बल्कि निर्णायक सुरक्षा प्राप्त करने के लिए तार्किक अभिव्यंजना (logical expressivity) का आवश्यक त्याग हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "The Undecidability of Artificial General Intelligence (AGI) Alignment" शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।
मुख्य विचार: आप यह सिद्ध नहीं कर सकते कि एक रोबोट सुरक्षित है
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट (AGI) बना रहे हैं जो कुछ भी सीख सकता है और किसी भी समस्या को हल कर सकता है। आपका लक्ष्य एक ऐसा "सुरक्षा मैनुअल" लिखना है जो 100% गारंटी दे सके कि यह रोबोट कभी किसी को नुकसान नहीं पहुँचाएगा या नियंत्रण से बाहर नहीं जाएगा।
यह शोध पत्र तर्क देता है कि ऐसा कोई भी पूर्ण सुरक्षा मैनुअल लिखना गणितीय रूप से असंभव है।
लेखक यह नहीं कह रहा है कि रोबोट नियंत्रण से बाहर हो ही जाएगा। तर्क यह है कि आप कभी सिद्ध नहीं कर सकते कि वह ऐसा नहीं करेगा। यह खराब इंजीनियरिंग या धीमे कंप्यूटरों की समस्या नहीं है; यह तर्क का एक मौलिक नियम है, जैसे गुरुत्वाकर्षण। आपका रोबोट कितना भी स्मार्ट क्यों न हो, या आप परीक्षण पर कितना भी पैसा क्यों न खर्च कर दें, आप एक सार्वभौमिक "सुरक्षा प्रमाण पत्र" (safety certificate) नहीं बना सकते जो हर संभव स्थिति में काम करे।
तीन दीवारें जिन्हें आप पार नहीं कर सकते
शोध पत्र कहता है कि लोग रोबोट को सुरक्षित साबित करने के तीन तरीके अपनाते हैं, और लेखक दिखाता है कि तीनों ही उस "दीवार" से टकरा जाते हैं जहाँ तर्क विफल हो जाता है।
1. अनंत दीवार (The "Everything" Problem)
विचार: आप रोबोट को हर संभव स्थिति में, अनंत काल तक परखने की कोशिश करते हैं।
उदाहरण: कल्पना कीजिए कि आप यह सुनिश्चित करने के लिए किसी व्यक्ति द्वारा कहे जा सकने वाले हर एक वाक्य की जाँच कर रहे हैं कि वह कभी झूठ न बोले।
समस्या: क्योंकि रोबोट अपने बारे में सोचने के लिए पर्याप्त स्मार्ट है (इंसान की तरह), वह जटिल लूप और पहेलियाँ बना सकता है। शोध पत्र Rice's Theorem और Gödel's Incompleteness का उपयोग करके यह दिखाता है कि यदि कोई सिस्टम सामान्य गणित करने के लिए पर्याप्त स्मार्ट है, तो हमेशा एक ऐसा "सुरक्षित" व्यवहार होगा जो खतरनाक दिखेगा, या एक ऐसा "खतरनाक" व्यवहार होगा जो सुरक्षित दिखेगा, और आप अंतर बताने के लिए कोई नियम नहीं लिख पाएंगे। यह एक जाल से परछाई को पकड़ने की कोशिश करने जैसा है; आप उसे जितना परिभाषित करने की कोशिश करेंगे, वह उतना ही फिसलता जाएगा।
2. परिमित दीवार (The "Hardware" Problem)
विचार: "ठीक है, अब अनंत के बारे में सोचना छोड़ते हैं। वास्तविक दुनिया सीमित (finite) है। रोबोट के पास एक बैटरी है, एक प्रोसेसर है, और मेमोरी की एक सीमा है। यदि हम केवल इस विशिष्ट हार्डवेयर पर इसके द्वारा किए जाने वाले हर कार्य की जाँच करें, तो हम सिद्ध कर सकते हैं कि यह सुरक्षित है, है ना?"
उदाहरण: एक शतरंज के बोर्ड की कल्पना करें। यह सीमित है (64 वर्ग)। सैद्धांतिक रूप से, आप हर संभावित चाल की गणना कर सकते हैं।
समस्या: शोध पत्र Trakhtenbrot's Wall पेश करता है। यह कहता है कि हालांकि आप एक विशिष्ट शतरंज के बोर्ड की जाँच कर सकते हैं, लेकिन आप हर संभव कंप्यूटर कॉन्फ़िगरेशन के लिए सुरक्षा की गारंटी देने वाला एक एकल नियम नहीं लिख सकते।
यदि आप एक ऐसा "यूनिवर्सल सेफ्टी रूल" बनाने की कोशिश करते हैं जो किसी भी परिमित कंप्यूटर (किसी भी आकार, किसी भी चिप) के लिए काम करे, तो गणित कहता है कि वह नियम स्वयं गणना करने के लिए असंभव हो जाएगा। यह हर संभव निर्मित कार के लिए एक ही निर्देश पुस्तिका लिखने की कोशिश करने जैसा है; वह पुस्तिका अनंत रूप से लंबी और जटिल होगी, जिससे उसे पढ़ना या सत्यापित करना असंभव हो जाएगा।
3. जटिलता की दीवार (The "Chess" Problem)
विचार: "क्या होगा अगर हम केवल एक विशिष्ट कंप्यूटर, एक विशिष्ट समय और नियमों के एक विशिष्ट सेट की जाँच करें? क्या हम इसे ब्रूट-फोर्स (brute-force) से नहीं कर सकते?"
उदाहरण: शतरंज के खेल के बारे में सोचें। हम जानते हैं कि खेल सीमित है। हम जानते हैं कि हर स्थिति के लिए एक "परफेक्ट" चाल होती है। लेकिन संभावित खेलों की संख्या इतनी विशाल है (ब्रह्मांड में मौजूद परमाणुओं की संख्या से भी अधिक) कि यदि आपके पास ब्रह्मांड के आकार का कंप्यूटर भी होता, तो भी परफेक्ट चाल की गणना करने में ब्रह्मांड के जीवनकाल से भी अधिक समय लगता।
समस्या: शोध पत्र का तर्क है कि एक स्मार्ट रोबोट की जाँच करना इसी जैसा है। भले ही रोबोट एक छोटे, सीमित बॉक्स में कैद हो, उसके व्यवहार करने के तरीके इतने जटिल हैं कि उन सभी की जाँच करना असाध्य (intractable) है। यह सिद्धांत में "असंभव" नहीं है, लेकिन व्यवहार में असंभव है। इसके लिए उतनी कंप्यूटिंग शक्ति की आवश्यकता है जितनी ब्रह्मांड में मौजूद भी नहीं है।
"ट्रिलेमा" (Trilemma): आप तीन में से केवल दो ही चुन सकते हैं
शोध पत्र एक "ट्रिलेमा" के साथ समाप्त होता है। कल्पना कीजिए कि आप अपने सुरक्षा तंत्र से तीन चीजें चाहते हैं:
- Soundness (सत्यता): यह कभी भी गलत "सुरक्षित" संकेत नहीं देता (जब यह "जाओ" कहता है, तो यह कभी गलत नहीं होता)।
- Completeness (पूर्णता): यह कभी भी खतरे को नहीं चूकता (यह हर एक बुरी चीज़ को पकड़ लेता है)।
- Tractability (सुगमता): यह आपको उत्तर जल्दी देता है (एक उचित समय के भीतर)।
शोध पत्र का निर्णय: आप दो पा सकते हैं, लेकिन कभी भी तीनों नहीं।
- यदि आप चाहते हैं कि यह तेज़ हो और कभी गलत न हो, तो आपको यह स्वीकार करना होगा कि यह कुछ खतरों को छोड़ देगा (यह अपूर्ण है)।
- यदि आप चाहते हैं कि यह कभी गलत न हो और सब कुछ पकड़ ले, तो यह आपको उत्तर देने में अनंत समय लेगा (यह असाध्य है)।
- यदि आप चाहते हैं कि यह तेज़ हो और सब कुछ पकड़ ले, तो यह कभी-कभी झूठ बोलेगा और एक खतरनाक रोबोट को सुरक्षित बताएगा (यह असुरक्षित/unsound है)।
इंजीनियरों के लिए इसका क्या अर्थ है
शोध पत्र कहता है कि वर्तमान इंजीनियर पहले से ही वही कर रहे हैं जो वे कर सकते हैं: पूर्णता (Completeness) का त्याग करना।
रोबोट को सुरक्षित रखने के लिए, हम जानबूझकर उन्हें "कम बुद्धिमान" या "सीमित दृष्टि वाला" बनाते हैं। हम ऐसा करते हैं:
- Shielding (सुरक्षा कवच): रोबोट को एक ऐसे पिंजरे में रखना जहाँ वह केवल एक सरल भाषा बोल सके (ताकि वह जटिल, खतरनाक प्रश्न न पूछ सके)।
- Proof-Carrying Code: रोबोट को कार्य करने से पहले गणितीय प्रमाण दिखाने के लिए मजबूर करना (जिसका अर्थ है कि वह कुछ भी ऐसा जटिल नहीं कर सकता जिसे वह तुरंत सिद्ध न कर सके)।
- Short Horizons (सीमित क्षितिज): रोबोट को यह बताना, "केवल 5 सेकंड भविष्य के बारे में सोचो," ताकि वह लंबी अवधि की चालें या चालबाजियाँ न बना सके।
अंतिम निष्कर्ष
शोध पत्र का मुख्य संदेश थोड़ा गंभीर है: AI सुरक्षा के लिए मुख्य बाधा यह नहीं है कि हम एक सुरक्षित रोबोट नहीं बना सकते; बल्कि यह है कि हम गणितीय रूप से यह सिद्ध नहीं कर सकते कि वह सुरक्षित है।
आज हमारे पास जो "सुरक्षा" है वह रोबोट की स्वतंत्रता को प्रतिबंधित करके बनाई गई एक अस्थायी भ्रांति है। हम रोबोट को एक छोटे, सरल बॉक्स में काम करने के लिए मजबूर करते हैं ताकि हम उसकी जाँच कर सकें। लेकिन जिस क्षण हम रोबोट को वास्तव में "जनरल" (सब कुछ करने के लिए पर्याप्त स्मार्ट) होने देते हैं, गणित कहता है कि हम उसे सत्यापित करने की क्षमता खो देते हैं। हम अपनी शांति के लिए रोबोट की पूरी क्षमता का सौदा कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।