Shot saturation and evidence limits in quantum-AI hardware benchmarks
यह शोधपत्र आर्काइव किए गए क्वांटम-एआई हार्डवेयर बेंचमार्क का पुनर्र्विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि कैसे शॉट सैचुरेशन (shot saturation) और अपूर्ण डेटा हैंडलिंग त्रुटि पुनर्निर्माण (error reconstruction) और अवलोकनीय व्याख्या (observable interpretation) को महत्वपूर्ण रूप से प्रभावित करते हैं, जबकि मापे गए मानों और आरोपित मानों के बीच अंतर करने में वर्तमान रिपोर्टिंग मानकों की सीमाओं को भी रेखांकित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मशीनों को सोचने के योग्य बनाने की दौड़ में, एक नया क्षितिज उभरा है जहाँ भौतिक दुनिया के नियम कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) के तर्क से मिलते हैं। वैज्ञानिक क्वांटम मैकेनिक्स के सिद्धांतों पर काम करने वाले सूक्ष्म, नाजुक प्रोसेसरों का परीक्षण कर रहे हैं, इस उम्मीद में कि वे उन समस्याओं को हल कर सकते हैं जिन्हें सुलझाने में आज के सुपरकंप्यूटरों को सदियों लग जाएंगे। यह जानने के लिए कि ये मशीनें काम कर रही हैं या नहीं, शोधकर्ताओं को विशिष्ट मात्राओं को मापना होता है, जैसे कि दो डेटा पैटर्न एक-दूसरे से कितनी बारीकी से मेल खाते हैं या एक सर्किट किसी पहेली का सर्वोत्तम समाधान खोजने में कितना सक्षम है। हालाँकि, ये माप एक बार नहीं लिए जाते; एक विश्वसनीय तस्वीर बनाने के लिए इन्हें हजारों बार दोहराया जाता है, ठीक वैसे ही जैसे यह देखने के लिए कि क्या एक सिक्का निष्पक्ष है, उसे कई बार उछाला जाता है। चुनौती इस तथ्य में निहित है कि ये क्वांटम मशीनें शोरयुक्त (नॉइजी) और अपूर्ण हैं, और शोधकर्ताओं द्वारा उनके प्रयासों या "शॉट्स" (shots) को गिनने का तरीका, यह नाटकीय रूप से बदल सकता है कि संख्याएँ क्या कहती हुई प्रतीत होती हैं। यदि गिनती करने का तरीका त्रुटिपूर्ण है या यदि डेटा अधूरा है, तो परिणाम आशाजनक दिख सकते हैं जबकि वे वास्तव में भ्रामक होते हैं, जिससे यह बताना कठिन हो जाता है कि मशीन वास्तव में सीख रही है या केवल शोर के बीच लड़खड़ा रही है।
विक्रम लैक्स (KarLex AI के) द्वारा किए गए एक हालिया अध्ययन ने इन क्वांटम प्रोसेसरों से जुड़े पिछले प्रयोगों के एक संग्रह पर एक कठोर, आलोचनात्मक दृष्टि डाली है। शोधकर्ता ने स्वयं हार्डवेयर पर नए परीक्षण नहीं किए। इसके बजाय, वह एक पिछले अभियान के डिजिटल अभिलेखागार (डिजिटल आर्काइव्स) में वापस गए जिसमें Rigetti और IonQ जैसे प्रदाताओं के क्लाउड-आधारित क्वांटम कंप्यूटरों का उपयोग किया गया था। उनका लक्ष्य उन प्रयोगों के कच्चे सारांश (raw summaries) का पुन: परीक्षण करना था ताकि यह देखा जा सके कि उनसे निकाले गए निष्कर्ष एक सख्त, अधिक पारदर्शी सूक्ष्मदर्शी के नीचे टिकते हैं या नहीं। उन्होंने तीन प्रकार के कार्यों पर ध्यान केंद्रित किया: वेक्टर्स के बीच समानता को मापना, मशीन लर्निंग में उपयोग किए जाने वाले एक विशिष्ट प्रकार के गणितीय मैट्रिक्स का परीक्षण करना, और ग्राफ समस्याओं को हल करने के लिए डिज़ाइन किए गए एक एल्गोरिदम को चलाना। डेटा को रिकॉर्ड करने के विवरण की गहराई में जाकर, उन्होंने पाया कि प्रयोगों को जिस तरह से व्यवस्थित और रिपोर्ट किया गया था, उसने अक्सर मशीनों के वास्तविक प्रदर्शन को अस्पष्ट कर दिया।
जांच के पहले भाग में इस बात पर गौर किया गया कि माप के प्रयासों की संख्या बढ़ाने से परिणामों की सटीकता पर क्या प्रभाव पड़ा। इन प्रयोगों में, शोधकर्ताओं ने एक सर्किट चलाया और परिणाम को हजारों बार रिकॉर्ड किया, फिर एक एकल संख्या प्राप्त करने के लिए परिणामों का औसत निकाला। अध्ययन ने उस डेटा का पुन: विश्लेषण किया जहाँ प्रति बैच प्रयासों की संख्या 256 से बढ़ाकर 2,048 कर दी गई थी। अपेक्षा यह थी कि अधिक शॉट्स चलाने से त्रुटियाँ कम हो जाएंगी और परिणाम वास्तविक मान के करीब आ जाएगा। हालाँकि, पुन: विश्लेषण ने एक अलग कहानी बताई। हालाँकि अधिक शॉट्स जोड़ने से डेटा में यादृच्छिक उतार-चढ़ाव (रैंडम फ्लक्चुएशन) में थोड़ी कमी आई, लेकिन समग्र त्रुटि लगातार उच्च बनी रही। गलती का प्राथमिक स्रोत डेटा की कमी नहीं थी, बल्कि औसत मान में एक निरंतर विस्थापन (ऑफसेट) था। 2,048 शॉट्स के साथ भी, औसत परिणाम उस आदर्श, पूर्ण मशीन से काफी भिन्न था जो इसे उत्पन्न करनी चाहिए थी। यह सुझाव देता है कि केवल मशीन से अधिक प्रयास करने या अधिक बार प्रयास करने के लिए कहना समस्या को ठीक नहीं करेगा; समस्या माप की मौलिक व्यवस्था या हार्डवेयर के व्यवहार में थी, जो परीक्षण को कितनी भी बार दोहराने के बावजूद अपरिवर्तित रहा।
ध्यान का दूसरा क्षेत्र एक गणितीय संरचना थी जिसे 'कर्नेल' (kernel) कहा जाता है, जो अनिवार्य रूप से संख्याओं की एक तालिका है जो दर्शाती है कि विभिन्न डेटा बिंदु एक-दूसरे से कैसे संबंधित हैं। एक पूर्ण और उपयोगी तालिका में, प्रत्येक संभावित जोड़ी का एक मापा गया मान होना चाहिए। एक प्रदाता, Rigetti के अभिलेखागार से प्राप्त डेटा में, सभी 45 जोड़ियों को मापा गया था। हालाँकि, दूसरे प्रदाता, IonQ के डेटा में, प्रयोग के कंप्यूटिंग क्रेडिट समाप्त होने से पहले केवल 18 जोड़ियों को सफलतापूर्वक मापा गया था। शेष 27 जोड़ियों को खाली छोड़ दिया गया था। अध्ययन ने इस बात पर प्रकाश डाला कि इस अधूरे डेटा को कैसे संभाला गया, जो एक गंभीर दोष था। जब गायब प्रविष्टियों को शून्य माना गया, तो पूरी तालिका का औसत मान नाटकीय रूप से गिर गया, जो लगभग 0.22 से बदलकर 0.09 हो गया। इस बड़े बदलाव ने दिखाया कि अंतिम निष्कर्ष पूरी तरह से इस बात पर निर्भर था कि गायब नंबरों को कैसे भरा गया। इसके अलावा, अध्ययन ने पाया कि दोनों प्रदाता बिल्कुल समान डेटा इनपुट का परीक्षण नहीं कर रहे थे, जिससे उनके हार्डवेयर प्रदर्शन की निष्पक्ष तुलना करना असंभव हो गया। यह जाने बिना कि कौन से डेटा बिंदु उपयोग किए गए थे और यह सुनिश्चित किए बिना कि प्रत्येक प्रविष्टि मापी गई है, दोनों मशीनों के बीच कोई भी तुलना वैज्ञानिक रूप से अमान्य थी।
अंतिम खंड में QAOA नामक एक एल्गोरिदम के परिणामों की जांच की गई, जिसे नेटवर्क के कनेक्शनों को दो समूहों में विभाजित करने के सर्वोत्तम तरीके को खोजने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने अपनी सफलता को एक अनुपात के रूप में रिपोर्ट किया था, जो नेटवर्क के कुल कनेक्शनों के साथ प्राप्त विभाजन की गुणवत्ता की तुलना करता है। पुन: विश्लेषण से पता चला कि विभिन्न प्रदाता इस अनुपात के लिए 'हर' (denominator) की अलग-अलग परिभाषाओं का उपयोग कर रहे थे। एक प्रदाता ने परिणाम को ग्राफ में किनारों (edges) की कुल संख्या से विभाजित किया, जबकि दूसरे ने सैद्धांतिक सर्वोत्तम संभव स्कोर से विभाजित किया। इसका अर्थ यह था कि एक मशीन का 0.5 और दूसरी का 0.6 का स्कोर यह आवश्यक नहीं कि दूसरी मशीन बेहतर थी; वे केवल एक ही चीज़ को मापने के लिए अलग-अलग पैमाने (रूलर) का उपयोग कर रहे थे। इसके अतिरिक्त, डेटा में उन विस्तृत रिकॉर्डों का अभाव था जो यह सत्यापित करने के लिए आवश्यक थे कि क्या मशीनें वास्तव में इच्छित रूप से समस्या को हल कर रही थीं या परिणाम केवल डेटा प्रोसेसिंग के उपोत्पाद (बायप्रोडक्ट) थे। अध्ययन ने निष्कर्ष निकाला कि इन नंबरों को रिपोर्ट करने के लिए एक मानकीकृत तरीके और कच्चे डेटा तक पूर्ण पहुंच के बिना, यह निर्धारित करना असंभव है कि कौन सा हार्डवेयर वास्तव में श्रेष्ठ है।
अंततः, यह पुन: विश्लेषण क्वांटम आर्टिफिशियल इंटेलिजेंस के क्षेत्र के लिए एक चेतावनी के रूप में कार्य करता है। यह प्रदर्शित करता है कि डेटा की बड़ी मात्रा होने या माप के प्रयासों की उच्च संख्या होने से सही उत्तर की गारंटी नहीं मिलती है, यदि बुनियादी परिभाषाएं स्पष्ट नहीं हैं या यदि डेटा अधूरा है। अध्ययन ने पाया कि इन प्रयोगों में प्रमुख त्रुटियां यादृच्छिक शोर (रैंडम नॉइज़) नहीं थीं जिसे अधिक परीक्षण चलाकर ठीक किया जा सके, बल्कि वे व्यवस्थित मुद्दे थे जो प्रयोगों के डिज़ाइन और रिपोर्टिंग से संबंधित थे। शोधकर्ताओं ने इस बात पर जोर दिया कि आगे बढ़ने के लिए, समुदाय को इस बात के सख्त मानक स्थापित करने की आवश्यकता है कि कौन सा डेटा रिकॉर्ड किया जाना चाहिए, गायब जानकारी को कैसे संभाला जाना चाहिए, और परिणामों की तुलना कैसे की जानी चाहिए। जब तक इन मूलभूत मुद्दों को हल नहीं किया जाता, तब तक हार्डवेयर के प्रदर्शन के बारे में किए गए दावे सत्यापित करना कठिन रहेगा, और इन मशीनों की वास्तविक क्षमता अधूरे साक्ष्यों के पर्दे के पीछे छिपी रहेगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।