← नवीनतम पेपर
⚛️ quantum physics

RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis

रुब्रिक्यू (RubriQ) एक स्केलेबल, HPC-संचालित फ्रेमवर्क है जो हार्डवेयर बाधाओं का सख्ती से पालन करते हुए और उच्च निष्ठा (fidelity) बनाए रखते हुए महत्वपूर्ण T-गेट संपीड़न (compression) प्राप्त करने के लिए GPU-त्वरित सिमुलेशन के साथ रूब्रिक-निर्देशित ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का लाभ उठाता है, ताकि दोष-सहनशील क्वांटम सर्किट को स्वचालित रूप से संश्लेषित किया जा सके।

मूल लेखक: Ziqing Guo, Ziwen Pan

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziqing Guo, Ziwen Pan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप बहुत ही विशिष्ट, महंगी और नाजुक लेगो ब्रिक्स (Lego bricks) का उपयोग करके एक जटिल मशीन बनाने की कोशिश कर रहे हैं। आपके पास एक मास्टर ब्लूप्रिंट (वह एल्गोरिदम जिसे आप चलाना चाहते हैं) है, लेकिन आपके पास जो निर्देश हैं वे एक अस्पष्ट, उच्च-स्तरीय भाषा में लिखे गए हैं जैसे कि "एक उड़ने वाली कार बनाओ।"

समस्या यह है कि फैक्ट्री फ्लोर (क्वांटम कंप्यूटर) के सख्त नियम हैं:

  1. ब्रिक्स दुर्लभ हैं: एक विशिष्ट प्रकार की ब्रिक (एक "T-gate") बनाना अविश्वसनीय रूप से महंगा है। आप उनका कम से कम उपयोग करना चाहते हैं।
  2. लेआउट अजीब है: कुछ मशीनें (जैसे IBM की) केवल आपको उन ब्रिक्स को जोड़ने की अनुमति देती हैं जो एक-दूसरे के ठीक बगल में हैं। अन्य (जैसे IonQ की) आपको किसी भी ब्रिक को किसी भी अन्य ब्रिक से जोड़ने की अनुमति देती हैं।
  3. लक्ष्य: आपको उस अस्पष्ट "उड़ने वाली कार" के विचार को एक सटीक, चरण-दर-चरण निर्देश पुस्तिका में बदलना है जो कम से कम महंगी ब्रिक्स का उपयोग करे और फैक्ट्री के लेआउट नियमों का पालन करे।

RubriQ एक नया सिस्टम है जिसे इस पहेली को स्वचालित रूप से हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "स्मार्ट राइटर" (The LLM)

एक कठोर कंप्यूटर प्रोग्राम के बजाय जो निश्चित नियमों की एक सूची का पालन करता है, RubriQ एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करता है। इसे एक बहुत ही स्मार्ट, रचनात्मक लेखक के रूप में सोचें जिसने लाखों निर्देश मैनुअल पढ़े हैं।

  • आप लेखक को एक प्रॉम्प्ट देते हैं: "4-qubit फूरियर ट्रांसफॉर्म के लिए एक क्वांटम सर्किट लिखें।"
  • लेखक कोड उत्पन्न करने का प्रयास करता है। कभी-कभी वह सटीक कोड लिखता है; कभी-कभी वह बकवास लिखता है या कुछ चरणों को छोड़ देता है।

2. "सख्त शिक्षक" (The Rubric)

अतीत में, इस तरह के AI को प्रशिक्षित करने के लिए, कंप्यूटर केवल अंत में "अच्छा काम किया" या "बुरा काम किया" कहता था। यह एक ऐसे शिक्षक की तरह है जो छात्र को यह बताए बिना कि उसने क्यों गलत किया, अंतिम परीक्षा के अंत में तक यह बताने के लिए इंतजार करता है कि वह फेल हो गया है। इससे सीखना धीमा और निराशाजनक हो जाता है।

RubriQ एक रुब्रिक (Rubric) पेश करता है, जो एक विस्तृत ग्रेडिंग रुब्रिक की तरह है जिसका उपयोग एक शिक्षक करता है। केवल "पास/फेल" के बजाय, सिस्टम द्वारा उत्पन्न कोड को पांच विशिष्ट आयामों पर जांचा जाता है:

  • Clifford Score: क्या आपने सस्ती, सामान्य ब्रिक्स का उपयोग किया?
  • T-Count Score: क्या आपने महंगी, दुर्लभ ब्रिक्स का उपयोग कम किया?
  • Hardware Score: क्या यह कोड वास्तव में उस विशिष्ट मशीन (IBM या IonQ) पर फिट बैठता है जिसे आप लक्षित कर रहे हैं?
  • Fidelity Score: क्या मशीन वास्तव में वही करती है जो आपने उससे करने को कहा था?
  • Efficiency Score: क्या निर्देश पुस्तिका छोटी और व्यवस्थित है?

सिस्टम उसे इन पांचों क्षेत्रों में से प्रत्येक के लिए एक स्कोर देता है। यह एक "डेंस सिग्नल" (dense signal)—यानी बहुत सारा फीडबैक—प्रदान करता है ताकि AI को पता चल सके कि उसे अपने कोड के किन हिस्सों को ठीक करने की आवश्यकता है, बजाय इसके कि वह केवल अनुमान लगाए।

3. "ग्रुप कॉन्टेस्ट" (GRPO)

AI को सिखाने के लिए, RubriQ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) नामक एक विधि का उपयोग करता है।

  • कल्पना करें कि आप AI को लगातार 8 बार एक ही समस्या हल करने के लिए कहते हैं।
  • आपको यह बताने के लिए एक अलग "जज" AI की आवश्यकता नहीं है कि कौन सा सबसे अच्छा है। इसके बजाय, आप 8 उत्तरों की एक-दूसरे के विरुद्ध तुलना करते हैं।
  • जिस उत्तर का रुब्रिक स्कोर सबसे अधिक होता है, उसे "थम्स अप" मिलता है, और कम स्कोर वाले उत्तरों को "थम्स डाउन" मिलता है।
  • AI अपने ही समूह के भीतर विजेताओं और हारने वालों को देखकर सीखता है और अगली बार अधिक "विजेता" बनाने के लिए अपनी लेखन शैली को समायोजित करता है।

4. "सुपर-फैक्ट्री" (HPC)

इस AI को प्रशिक्षित करना अविश्वसनीय रूप से भारी काम है। क्वांटम सर्किट को सिम्युलेट करना ऐसा ही है जैसे हर संभावित भविष्य के लिए मौसम की गणना करने का प्रयास करना; इसके लिए भारी कंप्यूटिंग शक्ति की आवश्यकता होती है।

  • शोधकर्ताओं ने इसे NERSC Perelmutter पर चलाया, जो सैकड़ों शक्तिशाली ग्राफिक्स कार्ड (GPUs) वाला एक सुपरकंप्यूटर है।
  • उन्होंने एक पाइपलाइन बनाई जहाँ AI कोड उत्पन्न करता है, एक पार्सर (parser) यह जांचता है कि क्या वह पठनीय है, और एक सिम्युलेटर "आभासी फैक्ट्री फ्लोर" पर इसके स्कोर की जांच करने के लिए इसे चलाता है।
  • क्योंकि उन्होंने "रुब्रिक" पद्धति का उपयोग किया, इसलिए AI पिछले तरीकों की तुलना में जो अस्पष्ट "पास/फेल" संकेतों पर निर्भर थे, 2 से 3 गुना तेज़ी से सीख गया।

परिणाम

जब उन्होंने RubriQ का परीक्षण किया:

  • इसने संसाधनों की बचत की: इसने मानक उपकरणों की तुलना में औसत 3.3 गुना कम महंगी "T-gates" का उपयोग करके संसाधनों का प्रबंधन किया।
  • यह सटीक था: इसके द्वारा लिखे गए सर्किट वास्तव में IBM और IonQ के वास्तविक क्वांटम कंप्यूटरों पर काम करते थे।
  • यह कुशल था: इसने अपने लक्ष्यों को कम प्रशिक्षण चरणों में प्राप्त किया, जिससे बिजली और कंप्यूटर समय की भारी बचत हुई।

संक्षेप में: RubriQ एक ऐसा सिस्टम है जो एक रचनात्मक AI लेखक को एक विस्तृत चेकलिस्ट (रुब्रिक) देकर क्वांटम सर्किट बनाना सिखाता है और फिर उसे अपने ही प्रयासों की आपस में तुलना करके सीखने देता है, और यह सब एक विशाल सुपरकंप्यूटर पर चलता है ताकि यह सुनिश्चित हो सके कि इसके परिणाम वास्तविक दुनिया की क्वांटम मशीनों के लिए तैयार हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →