← नवीनतम पेपर
💻 computer science

RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis

RubriQ एक स्केलेबल, HPC-संचालित फ्रेमवर्क है जो एल्गोरिद्मिक शुद्धता, सरफेस-कोड लागत न्यूनीकरण और निकट-अवधि हार्डवेयर बाधाओं को एक साथ संतुष्ट करने वाले क्वांटम सर्किट के संश्लेषण को स्वचालित करने के लिए रूब्रिक-गाइडेड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का लाभ उठाता है।

मूल लेखक: Ziqing Guo, Ziwen Pan

प्रकाशित 2026-08-03
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziqing Guo, Ziwen Pan

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी मशीन बनाने की कोशिश कर रहे हैं जो उन समस्याओं को हल कर सके जो आज के किसी भी कंप्यूटर के लिए असंभव हैं। यह मशीन एक क्वांटम कंप्यूटर है, एक ऐसा उपकरण जो सूक्ष्म कणों के अजीब नियमों का उपयोग करके बिजली की गति से गणित करता है। लेकिन यहाँ एक पेंच है: ये मशीनें अविश्वसनीय रूप से नाजुक होती हैं। इन्हें काम करने के लिए, हमें अपने बड़े, जटिल विचारों को "गेट्स" (स्विचों की तरह) की एक बहुत ही विशिष्ट, निम्न-स्तरीय भाषा में अनुवाद करने की आवश्यकता होती है।

समस्या यह है कि यह अनुवाद एक दुस्वप्न है। यदि आप बस एक मानक कंप्यूटर को यह करने के लिए कहते हैं, तो गणित इतना विशाल हो जाता है कि वह क्रैश हो जाता है। यदि आप आज की तकनीक के साथ इस मशीन को बनाने की कोशिश करते हैं, तो यह बहुत शोर वाला और त्रुटिपूर्ण होता है। इसलिए, वैज्ञानिक एक बीच के रास्ते में फंसे हुए हैं: उन्हें ऐसे सर्किट डिजाइन करने की आवश्यकता है जो भविष्य की सुपर-मशीनों के लिए पर्याप्त सटीक हों, लेकिन आज के अस्थिर प्रोटोटाइप पर चलने के लिए पर्याप्त सरल भी हों। यह एक पांच सितारा दावत के लिए रेसिपी लिखने जैसा है जिसे एक बच्चा बिना रसोई जलाए वास्तव में पका सके।

यहाँ आता है RubriQ, एक नया टूल जो इन क्वांटम रेसिपीज़ के लिए एक सुपर-स्मार्ट, अथक संपादक की तरह काम करता है। केवल अनुमान लगाने और जांचने के बजाय, RubriQ एक विशाल AI का उपयोग करता है जो एक साथ हजारों विविधताओं को आजमाकर सीखता है, जिसका मार्गदर्शन एक सख्त "रूब्रिक" (एक ग्रेडिंग शीट) द्वारा किया जाता है जो इसे बताता है कि कैसे सुधार करना है। यह केवल "काफी अच्छा" नहीं ढूंढता; यह गणितीय रूप से त्रुटिहीन होने और वर्तमान वास्तविक हार्डवेयर पर चलने के लिए व्यावहारिक होने के बीच के आदर्श संतुलन की तलाश करता है।


द रूब्रिक स्टोरी: एक AI को क्वांटम आर्किटेक्ट बनाना सिखाना

क्वांटम सर्किट डिजाइन करने को एक छात्र से कहानी लिखने के लिए कहने जैसा समझें। अतीत में, यदि आपने कंप्यूटर को क्वांटम प्रोग्राम लिखने के लिए कहा, तो यह एक छात्र को "कुछ कूल लिखो" जैसा अस्पष्ट प्रॉम्प्ट देने और यह उम्मीद करने जैसा था कि वे बकवास न करें। यदि वे गलत होते, तो आप बस कहते, "नहीं, फिर से कोशिश करो," बिना यह जाने कि वे क्यों गलत थे। पुराने तरीके यही करते थे: वे एक "स्पार्स रिवॉर्ड" (sparse reward) देते थे, जिसका अर्थ था कि AI को केवल तभी एक अंक मिलता था जब उत्तर 100% सही होता था, और बाकी सब के लिए शून्य अंक। इसने सीखना अविश्वसनीय रूप से धीमा और निराशाजनक बना दिया, जैसे अंधेरे में साइकिल चलाना सीखने की कोशिश करना।

RubriQ एक विस्तृत रूब्रिक वाली एक सख्त लेकिन सहायक शिक्षिका बनकर खेल बदल देता है। केवल "पास" या "फेल" कहने के बजाय, यह ग्रेड को पांच विशिष्ट श्रेणियों में विभाजित करता है:

  1. क्या यह काम कर गया? (कहानी समझ में आती है)।
  2. क्या यह कुशल है? (क्या इसने बहुत अधिक शब्दों का उपयोग किया? क्वांटम के संदर्भ में, यह "T-गेट्स" को कम करने के बारे में है, जो कोड के महंगे, संसाधन-भूखे हिस्से हैं)।
  3. क्या यह क्लिफोर्ड-हैवी (Clifford-heavy) है? (क्या इसमें बहुत अधिक फैंसी, कठिन-से-बनाने वाले मूव्स हैं, या ज्यादातर सरल मूव्स हैं?)।
  4. क्या यह आज की मशीनों पर चलेगा? (क्या यह हार्डवेयर के विशिष्ट आकार में फिट बैठता है, जैसे गोल छेद में चौकोर खूँटा फिट करना?)।
  5. क्या यह तेज़ है? (इसमें कितने चरण लगते हैं?)।

यह पेपर एक विधि पेश करता है जिसे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) कहा जाता है। कल्पना कीजिए कि AI एक शेफ है जो एक नया व्यंजन आविष्कार करने की कोशिश कर रहा है। एक बार खाना बनाने और समीक्षा का इंतजार करने के बजाय, RubriQ शेफ से एक ही समय में उस व्यंजन के आठ अलग-अलग संस्करण बनाने के लिए कहता है। फिर, यह उनकी आपस में तुलना करता है। यदि एक संस्करण दूसरों की तुलना में थोड़ा बेहतर है, तो AI उसी तरह के और बनाने के लिए सीखता है। यदि एक संस्करण आपदा है, तो वह उस रास्ते से बचने के लिए सीखता है। यह "ग्रुप" तुलना एक एकल पूर्ण उत्तर की प्रतीक्षा करने की तुलना में बहुत तेज़ और अधिक स्थिर है।

उन्होंने मशीन कैसे बनाई

इसे काम करने के योग्य बनाने के लिए, शोधकर्ताओं को एक विशाल इंजन बनाना पड़ा। वे इसे केवल एक लैपटॉप पर नहीं चला सकते थे; इसके लिए लॉरेंस बर्कले नेशनल लेबोरेटरी के NERSC Perlmutter, एक सुपरकंप्यूटर क्लस्टर की शक्ति की आवश्यकता थी। उन्होंने सिमुलेशन चलाने के लिए 8 NVIDIA A100 GPUs (AI के लिए उपयोग किए जाने वाले भारी-भरकम ग्राफिक्स कार्ड) का उपयोग किया।

चतुर हिस्सा यह है: AI केवल अनुमान नहीं लगाता है। यह एक प्रोग्रामेटिक रूब्रिक का उपयोग करता है। इसका मतलब है कि "शिक्षक" एक ब्लैक-बॉक्स न्यूरल नेटवर्क नहीं है जो भ्रमित हो सकता है; यह नियमों का एक सेट है जो गणित, लागत और हार्डवेयर सीमाओं की तुरंत जांच करता है। यदि AI एक ऐसा सर्किट बनाता है जो अच्छा दिखता है लेकिन गणित में विफल रहता है, तो रूब्रिक उसे तुरंत शून्य दे देता है। यदि वह एक ऐसा सर्किट बनाता है जो काम तो करता है लेकिन बहुत अधिक महंगे "T-गेट्स" का उपयोग करता है, तो रूब्रिक उसे कम स्कोर देता है, जिससे वह अधिक कुशल बनने के लिए प्रेरित होता है।

उन्होंने एक प्रमुख बाधा को भी हल किया: सिमुलेशन की गति। यह जांचना कि एक क्वांटम सर्किट काम करता है या नहीं, आमतौर पर पूरी चीज़ का सिमुलेशन करने की आवश्यकता होती है, जो अधिक क्यूबिट्स (क्वांटम बिट्स) जोड़ने पर तेजी से कठिन होता जाता है। RubriQ CUDA-Q को एकीकृत करता है, एक ऐसा टूल जो उन्हें इन सिमुलेशन को सीधे GPUs पर चलाने की अनुमति देता है, जिससे यह प्रक्रिया मानक CPU पर चलाने की तुलना में हजारों गुना तेज हो जाती है।

उन्हें क्या मिला

परिणाम उत्साहजनक हैं, हालांकि लेखक इन्हें एक जादुई समाधान के बजाय एक महत्वपूर्ण कदम के रूप में प्रस्तुत करने में सावधानी बरतते हैं।

  • यह पुराने तरीकों से बेहतर काम करता है: 1,500 विभिन्न क्वांटम कार्यों पर परीक्षण किए जाने पर, RubriQ ने शुद्धता के लिए 96% पास रेट हासिल किया। इसका मतलब है कि लगभग हर बार, इसने एक ऐसा सर्किट बनाया जिसने गणित को सही ढंग से किया।
  • यह बहुत अधिक कुशल है: क्वांटम कंप्यूटरों के लिए सबसे महत्वपूर्ण मीट्रिक "T-काउंट" (महंगे गेट्स की संख्या) है। RubriQ ने केवल "सही" लेकिन अनुकूलित नहीं किए गए सर्किट की तुलना में इन गेट्स की संख्या को औसतन 3.31 गुना कम कर दिया। यह एक बड़ी बात है क्योंकि कम T-गेट्स का मतलब है कि कंप्यूटर को कम संसाधनों और कम समय की आवश्यकता होती है।
  • यह तेजी से सीखता है: क्योंकि यह स्पार्स रिवॉर्ड पर निर्भर करने वाले अन्य सुदृढीकरण शिक्षण (reinforcement learning) विधियों के बजाय इन विस्तृत रूब्रिक्स का उपयोग करता है, इसलिए RubriQ 2 से 3 गुना तेजी से कन्वर्ज (कार्य सीखता) हुआ।
  • यह वास्तविक हार्डवेयर के लिए तैयार है: टीम केवल सिमुलेशन तक ही सीमित नहीं रही। उन्होंने RubriQ द्वारा उत्पन्न सर्वश्रेष्ठ सर्किटों को IBM और IonQ के वास्तविक क्वांटम कंप्यूटरों पर चलाया। उन्होंने पाया कि सर्किट इन मशीनों के साथ संगत थे, जिसमें हार्डवेयर बाधाओं का उल्लंघन 1% से भी कम था।

इसका क्या अर्थ है

पेपर सुझाव देता है कि क्वांटम सर्किट संश्लेषण को एक सख्त, बहु-आयामी रूब्रिक द्वारा निर्देशित कोड-जेनरेशन कार्य के रूप में मानकर, हम उच्च-गुणवत्ता वाले क्वांटम प्रोग्रामों का निर्माण स्वचालित कर सकते हैं। यह इस विचार के विरुद्ध तर्क देता है कि हमें AI के काम को आंकने के लिए जटिल, सीखे गए "क्रिटिक" नेटवर्क की आवश्यकता है; इसके बजाय, एक स्पष्ट, नियम-आधारित स्कोरिंग सिस्टम बेहतर काम करता है और इसे चलाना सस्ता है।

हालांकि यह पेपर यह दावा नहीं करता है कि इसने क्वांटम कंप्यूटिंग की सभी समस्याओं को हल कर लिया है, लेकिन यह एक व्यवहार्य मार्ग प्रदर्शित करता है। बड़े भाषा मॉडल (LLMs) की रचनात्मक शक्ति को एक सख्त, प्रोग्रामेटिक रूब्रिक के अनुशासन के साथ जोड़कर, RubriQ ऐसे सर्किट डिजाइन करने का एक तरीका प्रदान करता है जो न केवल गणितीय रूप से सुदृढ़ हैं, बल्कि आज की शोर भरी, अपूर्ण मशीनों पर चलने के लिए पर्याप्त व्यावहारिक भी हैं, जबकि भविष्य के फॉल्ट-टोलरेंट दिग्गजों के लिए भी तैयार हैं। यह वर्तमान हार्डवेयर की अव्यवस्थपूर्ण वास्तविकता और भविष्य के क्वांटम कंप्यूटिंग की निर्मल दुनिया के बीच एक सेतु है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →