← नवीनतम पेपर
⚛️ quantum physics

Agent policies from higher-order causal functions

यह शोध पत्र श्रेणी सिद्धांत (category theory) का उपयोग करते हुए POMDPs में एजेंट नीतियों और उच्च-क्रम की प्रक्रिया फलनों (higher-order process functions) के बीच एक गणितीय पत्राचार स्थापित करता है, जिससे यह प्रदर्शित होता है कि अनिश्चित कारण संरचनाओं (indefinite causal structures) का उपयोग करने वाले एजेंट विकेंद्रीकृत वातावरण में निश्चित कारण क्रमों (fixed causal orders) तक सीमित एजेंटों की तुलना में बेहतर प्रदर्शन कर सकते हैं।

मूल लेखक: Matt Wilson

प्रकाशित 2026-02-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matt Wilson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं। अधिकांश खेलों में, एक स्पष्ट "कार्य के क्रम" (order of operations) का पालन होता है: आप एक बटन दबाते हैं (Action), गेम गणना करता है कि क्या होगा (Environment), और फिर आप स्क्रीन पर देखते हैं कि क्या हुआ (Observation)। यह वह मानक "कारण और प्रभाव" (cause and effect) है जिसके द्वारा हम जीते हैं।

यह शोध पत्र, जिसे मैट विल्सनन ने लिखा है, एक दिमाग चकरा देने वाले विचार की खोज करता है: क्या होगा यदि "कारण और प्रभाव का क्रम" निश्चित न हो? क्या होगा यदि गेम आपके कदम उठाने से पहले ही आपकी चाल पर प्रतिक्रिया दे दे, या यदि आपकी चाल और गेम की प्रतिक्रिया एक उलझे हुए लूप में हो जाए जहाँ वास्तव में कोई भी पहले नहीं आता?

इसे समझाने के लिए, यह शोध पत्र दो बहुत अलग दुनियाओं के बीच एक सेतु बनाता है: आर्टिफिशियल इंटेलिजेंस (AI) और क्वांटम भौतिकी (Quantum Physics)।

1. दो दुनियाएँ

  • AI की दुनिया (The "Agent"): एक AI एजेंट को एक खेल के खिलाड़ी के रूप में सोचें। खिलाड़ी के पास एक "स्मृति" (पिछला दौर क्या हुआ था) होती है और वह इसका उपयोग अपने अगले कदम को तय करने के लिए करता है। लक्ष्य उच्चतम स्कोर प्राप्त करना है।
  • भौतिकी की दुनिया (The "Process"): भौतिकी के आधारों में, वैज्ञानिक "प्रक्रियाओं" (processes) का अध्ययन करते हैं—यानी सूचना अंतरिक्ष और समय के माध्यम से कैसे प्रवाहित होती है, इसके नियम। आमतौर पर, ये नियम एक सख्त समयरेखा का पालन करते हैं (A के कारण B होता है)। लेकिन क्वांटम दुनिया में, चीजें "अनिश्चित" (indefinite) हो सकती हैं, जिसका अर्थ है कि कारण का क्रम धुंधला या ओवरलैपिंग हो सकता है।

2. "सेतु" (मुख्य खोज)

लेखक की बड़ी सफलता यह सिद्ध करना है कि ये दोनों दुनियाएँ वास्तव में एक ही गणितीय भाषा बोल रही हैं।

वह दिखाते हैं कि एक AI की रणनीति (कैसे वह स्मृति का उपयोग करके क्रियाएं चुनता है) एक भौतिक प्रक्रिया (कैसे सूचना एक प्रणाली के माध्यम से प्रवाहित होती है) के गणितीय रूप से समान है।

उपमा: रेसिपी बनाम शेफ
कल्पना कीजिए कि एक रेसिपी (Environment/POMDP) है और एक शेफ (Agent) है।

  • मानक AI में, शेफ रेसिपी पढ़ता है, खाना पकाता है, स्वाद लेता है, और फिर तय करता है कि आगे क्या करना है।
  • शोध पत्र दिखाता है कि "शेफ के निर्णय लेने की शैली" को एक गणितीय वस्तु के रूप में माना जा सकता है जिसे रेसिपी में "प्लग इन" किया जा सकता है। शेफ को एक "हायर-ऑर्डर फंक्शन" के रूप में मानकर, हम यह अध्ययन कर सकते हैं कि शेफ और रेसिपी एक एकल, जटिल प्रणाली के रूप में कैसे परस्पर क्रिया करते हैं।

3. "सुपरपावर": अनिश्चित कारण क्रम (Indefinite Causal Order)

यहीं से मामला रोमांचक हो जाता है। क्योंकि AI का गणित और भौतिकी का गणित समान है, लेखक पूछते हैं: "क्या एक AI सामान्य AI की तुलना में बेहतर तरीके से गेम जीतने के लिए 'क्वांटम-शैली' के तर्क का उपयोग कर सकता है?"

एक सामान्य गेम (निश्चित कारण क्रम/Definite Causal Order) में, एजेंट A कार्य करता है, फिर एजेंट B कार्य करता है। यह एक सीधी रेखा है।
एक "क्वांटम-शैली" के गेम (अनिश्चित कारण क्रम/Indefinite Causal Order) में, एजेंट इस तरह से कार्य करते हैं कि उनकी क्रियाएं आपस में "गुंथी" (tangled) होती हैं। यह एक घेरे या गांठ की तरह अधिक है।

उपमा: सिंक्रोनाइज्ड डांस
कल्पना कीजिए कि दो नर्तक, एलिस और बॉब, एक साथ एक जटिल चाल करने की कोशिश कर रहे हैं।

  • मानक AI (निश्चित क्रम): एलिस चलती है, फिर बॉब उसकी प्रतिक्रिया देता है। यदि वे पूरी तरह से तालमेल में नहीं हैं, तो वे लय चूक सकते हैं।
  • "क्वांटम" AI (अनिश्चित क्रम): एलिस और बॉब इस तरह से चलते हैं कि उनकी क्रियाएं इतनी गहराई से जुड़ी हुई हैं कि आप यह नहीं कह सकते कि किसने नेतृत्व किया और कौन पीछे चला। वे अनिवार्य रूप से अपनी सूचनाओं को "लूप" कर रहे हैं।

परिणाम: लेखक ने इसे एक विशिष्ट "गेम" (जिसे GYNI गेम कहा जाता है) का उपयोग करके सिद्ध किया। उन्होंने दिखाया कि एक "सामान्य" AI एक अधिकतम स्कोर (जैसे गति सीमा) के साथ बंधा हुआ है, लेकिन एक AI जो इस "अनिश्चित कारण" तर्क का उपयोग करता है, वह वास्तव में उस सीमा को तोड़ सकता है और एक पूर्ण स्कोर प्राप्त कर सकता है।

यह क्यों मायने रखता है?

  1. बेहतर AI: यह सुझाव देता है कि यदि हम वास्तव में उन्नत, मल्टी-एजेंट AI सिस्टम (जैसे रोबोटों का एक समूह जो मिलकर काम कर रहा हो) बनाना चाहते हैं, तो हमें उन्हें केवल एक-दूसरे की प्रतिक्रिया करना ही नहीं सिखाना चाहिए; हमें उन्हें इन "गुंथे हुए" कारण रणनीतियों का उपयोग करना सिखाना चाहिए।
  2. क्वांटम कंप्यूटिंग: यह "क्वांटम AI" के लिए एक रोडमैप प्रदान करता है। यह हमें ऐसा AI डिजाइन करने का एक गणितीय तरीका देता है जो विशेष रूप से क्वांटम कंप्यूटरों पर चलने के लिए बनाया गया हो, जिससे उन्हें जटिल समस्याओं को हल करने में भारी बढ़त मिल सकती है।
  3. वास्तविकता को समझना: यह सुझाव देता है कि जिस तरह से "एजेंट्स" (बुद्धिमान प्राणी) अपनी दुनिया के साथ परस्पर क्रिया करते हैं, वह ब्रह्मांड में समय और कारण के काम करने के तरीके से गहराई से जुड़ा हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →