Landscape-Dependent Performance of Photonic Quantum Solvers in QUBO Feature Selection for Financial Risk Detection
यह शोध पत्र वित्तीय जोखिम पहचान में फीचर सिलेक्शन के लिए क्लासिकल, फोटोनिक और सिम्युलेटेड फोटोनिक सॉल्वर्स का बेंचमार्किंग करता है, जो यह प्रकट करता है कि जबकि QCI Dirac-3 जैसे फोटोनिक सिस्टम विशिष्ट कार्यों पर क्लासिकल प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन कर सकते हैं, फीचर सिलेक्शन पद्धति का चुनाव और डेटासेट में प्रेडिक्टिव सिग्नल की एकाग्रता, कंप्यूटिंग प्रतिमान (कंप्यूटिंग पैराडाइम) की तुलना में सफलता के अधिक महत्वपूर्ण निर्धारक हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
वित्त की उच्च-दांव वाली दुनिया में, बैंक और क्रेडिट कार्ड कंपनियाँ धोखाधड़ी और ऋण चूक (लोन डिफॉल्ट) के खिलाफ एक निरंतर छिपे हुए युद्ध में लगी रहती हैं। जीतने के लिए, वे भारी मात्रा में डेटा पर भरोसा करती हैं, जिसमें इस बात पर नज़र रखी जाती है कि ग्राहक कितना खर्च करता है और वह अपने बिलों का भुगतान कितनी बार करता है। हालाँकि, बहुत अधिक डेटा होना भी एक समस्या हो सकती है। जब किसी कंप्यूटर मॉडल को हजारों संभावित सुराग दिए जाते हैं, तो वह अक्सर भ्रमित हो जाता है, और वास्तविक संकेत (सिग्नल) के बजाय शोर (नॉइज़) को पकड़ लेता है, ठीक वैसे ही जैसे कोई व्यक्ति भीड़ भरे स्टेडियम में एक अकेली बातचीत को सुनने की कोशिश कर रहा हो। इसका समाधान विशिष्ट, सबसे महत्वपूर्ण सुरागों को खोजना और बाकी को अनदेखा करना है। इस प्रक्रिया को 'फीचर सिलेक्शन' (विशेषता चयन) कहा जाता है। दशकों से, विशेषज्ञों ने इस डेटा को छाँटने के लिए मानक गणितीय उपकरणों का उपयोग किया है, लेकिन तकनीक की एक नई लहर इस काम को तेजी से और अलग तरह से करने का वादा करती है। इस तकनीक में फोटोनिक कंप्यूटर शामिल हैं, जो जटिल पहेलियों को हल करने के लिए बिजली के बजाय प्रकाश के कणों का उपयोग करते हैं, और क्वांटम-प्रेरित मशीनें जो एक साथ कई संभावनाओं की खोज करती हैं। शोधकर्ता यह सवाल पूछ रहे हैं कि क्या ये नई, विलक्षण मशीनें वास्तव में पुराने, विश्वसनीय तरीकों की तुलना में बेहतर सुराग खोज सकती हैं, खासकर जब डेटा एक मामले से दूसरे मामले में बहुत भिन्न दिखता हो।
सिंगापुर मैनेजमेंट यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने तीन अलग-अलग कंप्यूटिंग दृष्टिकोणों को एक वास्तविक परीक्षण में आमने-सामने रखकर इसका उत्तर देने का प्रयास किया। उन्होंने यह देखने के लिए दो बहुत अलग वित्तीय डेटासेट चुने कि क्या परिणाम हर जगह समान रहते हैं। पहले डेटासेट में यूरोप के लगभग 2,85,000 क्रेडिट कार्ड लेनदेन शामिल थे, जहाँ धोखाधड़ी दुर्लभ थी, जो हर हज़ार मामलों में से दो से भी कम होती थी। दूसरा डेटासेट बहुत बड़ा था, जिसमें उन उपभोक्ताओं के बारे में 150 से अधिक विभिन्न वित्तीय संकेतकों की जानकारी थी जो अपने ऋणों पर चूक (डिफॉल्ट) कर सकते हैं। शोधकर्ताओं ने दस अलग-अलग तरीकों से सर्वश्रेष्ठ सुरागों को चुनने का परीक्षण किया, जिन्हें एक पारंपरिक, अत्यधिक सटीक क्लासिकल कंप्यूटर, एक फोटोनिक एंट्रॉपी कंप्यूटर जो समाधान खोजने के लिए प्रकाश का उपयोग करता है, और एक फोटोनिक बोसन सैंपलर जो जटिल गणितीय नियमों के आधार पर संयोजनों को यादृच्छिक रूप से चुनने के लिए प्रकाश का उपयोग करता है, के माध्यम से चलाया गया। उनका लक्ष्य यह देखना था कि विधि और मशीन का कौन सा संयोजन सबसे सटीक भविष्यवाणी करते हुए न्यूनतम सुरागों का उपयोग करता है।
परिणामों ने दो बहुत अलग दुनियाओं की कहानी उजागर की। क्रेडिट कार्ड धोखाधड़ी के डेटासेट पर, शोधकर्ताओं ने पाया कि आक्रामक संपीड़न (कंप्रेशन) बहुत प्रभावी रहा। उन्होंने पाया कि वे बिना किसी प्रेडिक्टिव पावर खोए, सुरागों की संख्या को तीस से घटाकर केवल तेरह कर सकते हैं। वास्तव में, एक फोटोनिक पद्धति, जिसने 'बोसन सैंपलिंग' नामक तकनीक का उपयोग किया था, ने असाधारण प्रदर्शन किया जब उसे केवल पांच सुराग चुनने के लिए मजबूर किया गया। इसने बहुत उच्च सटीकता के साथ धोखाधड़ी की पहचान की, यहाँ तक कि जब अनुमत सुरागों की संख्या बहुत कम थी, तो इसने पारंपरिक कंप्यूटर को भी पीछे छोड़ दिया। ऐसा इसलिए हुआ क्योंकि इस डेटासेट में धोखाधड़ी के संकेत कुछ विशिष्ट, असंबद्ध क्षेत्रों में केंद्रित थे। फोटोनिक सैंपलर इन दुर्लभ, उच्च-मूल्य वाले संयोजनों को तेजी से खोजने में सक्षम था, जो एक कुशल जासूस की तरह कार्य करता है जिसे पता होता है कि किसी विशिष्ट मामले में किन कुछ उंगलियों के निशान सबसे महत्वपूर्ण हैं।
हालाँकि, जब शोधकर्ताओं ने उसी तर्क को उपभोक्ता डिफॉल्ट डेटासेट पर लागू किया, तो कहानी पूरी तरह बदल गई। यह डेटासेट बड़ा और अधिक जटिल था, जहाँ डिफॉल्ट के चेतावनी संकेत दर्जनों विभिन्न संकेतकों में फैले हुए थे। यहाँ, केवल कुछ सुराग चुनने की रणनीति विफल रही। चाहे उन्होंने किसी भी कंप्यूटर या विधि का उपयोग किया हो, मॉडल केवल तभी अपने शिखर प्रदर्शन तक पहुँच पाए जब उन्हें सभी 159 उपलब्ध संकेतकों का उपयोग करने की अनुमति दी गई। फोटोनिक मशीनों ने इस वातावरण में कोई विशेष लाभ नहीं दिखाया। शोधकर्ताओं ने देखा कि नई तकनीक का "जादू" पूरी तरह से डेटा की संरचना पर निर्भर था। जब महत्वपूर्ण जानकारी बिखरी हुई और पुनरावृत्ति (रेडंडेंट) वाली थी, जैसा कि उपभोक्ता डिफॉल्ट के मामले में था, तो नई मशीनें समस्या को प्रभावी ढंग से संकुचित नहीं कर सकीं। उन्होंने पाया कि 'सॉल्वर' (समाधानकर्ता) का चुनाव डेटा की प्रकृति की तुलना में बहुत कम मायने रखता था।
शायद सबसे आश्चर्यजनक खोज यह थी कि गणितीय रूप से पूर्ण समाधान खोजना हमेशा सबसे अच्छी वास्तविक दुनिया की भविष्यवाणी की ओर नहीं ले जाता है। पारंपरिक कंप्यूटर को दिए गए गणितीय पहेली के लिए एकल, प्रमाणित सर्वोत्तम उत्तर खोजने के लिए डिज़ाइन किया गया था। फिर भी, कई अवसरों पर इस "पूर्ण" उत्तर के परिणामस्वरूप धोखाधड़ी या डिफॉल्ट के लिए खराब भविष्यवाणियाँ हुईं। एक उदाहरण में, पारंपरिक कंप्यूटर ने एक विशिष्ट विधि के लिए इष्टतम समाधान खोजा लेकिन एक ऐसा प्रेडिक्शन स्कोर दिया जो फोटोनिक एंट्रॉपी कंप्यूटर द्वारा खोजे गए समाधान की तुलना में आधा भी अच्छा नहीं था। ऐसा इसलिए हुआ क्योंकि कंप्यूटर को निर्देशित करने के लिए उपयोग किया जाने वाला गणितीय सूत्र केवल उस चीज़ का एक अनुमान था जिसकी बैंक को वास्तव में आवश्यकता थी। फोटोनिक मशीन, एक एकल गणितीय इष्टतम पर लॉक होने के बजाय, संभावनाओं की एक विस्तृत श्रृंखला की खोज करके, कभी-कभी ऐसे सुरागों का समूह खोज लेती थी जो व्यवहार में बेहतर काम करते थे, भले ही वह समीकरण का "पूर्ण" उत्तर न हो।
अध्ययन यह निष्कर्ष निकालता है कि कोई सार्वभौमिक विजेता नहीं है। इन उन्नत कंप्यूटिंग उपकरणों की प्रभावशीलता पूरी तरह से उस डेटा के परिदृश्य पर निर्भर करती है जिसका वे विश्लेषण कर रहे हैं। सघन, स्वच्छ डेटासेट में जहाँ महत्वपूर्ण संकेत केंद्रित होते हैं, विशेष फोटोनिक सॉल्वर महत्वपूर्ण लाभ प्रदान कर सकते हैं, जो बहुत कम सुरागों के साथ उच्च-गुणवत्ता वाले समाधान खोजते हैं। लेकिन बड़े, अधिक जटिल डेटासेट में जहाँ संकेत बिखरे हुए और रेडंडेंट होते हैं, संपीड़न के लाभ समाप्त हो जाते हैं, और मशीन का चुनाव विधि के चुनाव से कम महत्वपूर्ण हो जाता है। शोधकर्ता सुझाव देते हैं कि इन नई तकनीकों में निवेश करने से पहले, विश्लेषकों को पहले अपने डेटा की संरचना को समझना चाहिए। यदि संकेत केंद्रित हैं, तो नई मशीनें एक शक्तिशाली उपकरण हो सकती हैं। यदि संकेत बिखरे हुए हैं, तो उपलब्ध सभी डेटा का उपयोग करने का पारंपरिक दृष्टिकोण सबसे विश्वसनीय मार्ग बना रहता है। यह शोध पत्र यह दावा नहीं करता है कि क्वांटम या फोटोनिक कंप्यूटिंग ने वित्तीय जोखिम की समस्या को हल कर दिया है, बल्कि यह एक स्पष्ट मानचित्र प्रदान करता है कि ये उपकरण कहाँ चमकते हैं और कहाँ नहीं, जो वित्तीय मॉडलिंग के भविष्य के लिए एक व्यावहारिक मार्गदर्शिका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।