← नवीनतम पेपर
⚛️ quantum physics

A PennyLane-Centric Dataset to Enhance LLM-based Quantum Code Generation using RAG

यह शोध पत्र PennyLang को प्रस्तुत करता है, जो 3,347 PennyLane-विशिष्ट क्वांटम कोड नमूनों का एक उच्च-गुणवत्ता वाला डेटासेट है, साथ ही एक स्वचालित निर्माण ढांचा और एक RAG-आधारित मूल्यांकन भी है जो यह प्रदर्शित करता है कि रिट्रीवल ऑग्मेंटेशन (retrieval augmentation) सफलता दर बढ़ाकर और मतिभ्रम (hallucinations) को कम करके क्वांटम कोड जनरेशन में LLM के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Abdul Basit, Nouhaila Innan, Muhammad Haider Asif, Minghao Shao, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abdul Basit, Nouhaila Innan, Muhammad Haider Asif, Minghao Shao, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन बिल्कुल नए प्रशिक्षु (apprentice) को PennyLane नामक बहुत ही विशिष्ट, दुर्लभ उपकरणों के सेट का उपयोग करके एक जटिल मशीन बनाना सिखाने की कोशिश कर रहे हैं।

समस्या क्या है? प्रशिक्षु (एक आर्टिफिशियल इंटेलिजेंस, या "लार्ज लैंग्वेज मॉडल") अविश्वसनीय रूप से बुद्धिमान है और उसने सामान्य उपकरणों के बारे में लाखों किताबें पढ़ी हैं। लेकिन जब बात इन विशिष्ट PennyLane उपकरणों की आती है, तो वह थोड़ा खोया हुआ महसूस करता है। उसके पास कोई अच्छा मैनुअल नहीं है, और इंटरनेट पर उसे जो कुछ उदाहरण मिले हैं, वे बिखरे हुए, अस्त-व्यस्त हैं, या ऐसी भाषा में लिखे हैं जिसे वह पूरी तरह समझ नहीं पाता।

यह शोध पत्र इस बारे में है कि कैसे एक आदर्श मैनुअल बनाया जाए और सीखने के लिए प्रशिक्षु को सही उपकरण दिए जाएं।

यहाँ विवरण दिया गया है कि शोधकर्ताओं ने क्या किया, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "अनुवाद में खो जाने" का क्षण (The "Lost in Translation" Moment)

सोचिए कि क्वांटम कंप्यूटिंग एक नई, हाई-टेक भाषा है। इसके दो मुख्य "बोली" (frameworks) हैं जिनका लोग उपयोग करते हैं: Qiskit और PennyLane

  • Qiskit एक लोकप्रिय, स्थापित शहर की तरह है। इसके पास एक विशाल पुस्तकालय, एक समर्पित ट्यूटर (AI सहायक), और हजारों छात्र हैं।
  • PennyLane एक शानदार, विशिष्ट गाँव की तरह है। यह क्वांटम भौतिकी को मशीन लर्निंग के साथ मिलाने के लिए अद्भुत है, लेकिन यह थोड़ा अलग-थलग है। इसके पास कोई समर्पित "ट्यूटर" AI नहीं है, और इसकी किताबें (datasets) अटारी, बेसमेंट और विभिन्न भाषाओं में बिखरी हुई हैं।

शोधकर्ताओं ने महसूस किया कि यदि वे चाहते हैं कि AI इस "गाँव" के लिए कोड लिखने में मदद करे, तो उन्हें पहले सभी बिखरे हुए नोट्स, किताबों और कोड स्निपेट्स को एक व्यवस्थित पुस्तकालय में इकट्ठा करने की आवश्यकता है।

2. समाधान: "PennyLang" (द मास्टर लाइब्रेरी) बनाना

टीम ने PennyLang नामक एक विशाल, उच्च-गुणवत्ता वाला डेटासेट बनाया।

  • संग्रह प्रक्रिया: कल्पना कीजिए कि टीम के पुस्तकालयाध्यक्ष (librarians) तीन अलग-अलग जगहों पर जा रहे हैं:
    1. GitHub: "सार्वजनिक गैरेज" जहाँ डेवलपर्स अपना कोड साझा करते हैं। उन्होंने वास्तव में PennyLane का उपयोग करने वाली फाइलों को खोजने के लिए हजारों फाइलों को छाना।
    2. पाठ्यपुस्तकें (Textbooks): उन्होंने दो प्रमुख क्वांटम कंप्यूटिंग पुस्तकों को स्कैन किया, उनके कोड उदाहरणों को निकाला और उनके बगल में स्पष्ट नोट्स लिखे।
    3. आधिकारिक दस्तावेज़ (Official Documentation): वे आधिकारिक PennyLane वेबसाइट पर गए और हर ट्यूटोरियल को लिया, और उन निर्देशों को स्पष्ट, चरण-दर-चरण गाइड में बदल दिया।
  • सफाई (The Cleanup): उन्होंने सब कुछ बस एक ढेर में नहीं डाला। वे संपादकों की तरह काम करते हैं:
    • उन्होंने डुप्लिकेट हटा दिए (जैसे एक ही रेसिपी की दो प्रतियां होना)।
    • उन्होंने फॉर्मेटिंग ठीक की (यह सुनिश्चित करना कि सारा कोड व्यवस्थित दिखे और नियमों का पालन करे)।
    • उन्होंने "संदर्भ" (context) जोड़ा। केवल एक कोड स्निपेट देने के बजाय, उन्होंने एक नोट जोड़ा: "यहाँ कोड है, और यहाँ बताया गया है कि यह सरल अंग्रेजी में क्या करता है।"

परिणाम? 3,347 पूरी तरह से व्यवस्थित, एनोटेटेड उदाहरणों का एक पुस्तकालय।

3. विधि: "RAG" रणनीति (द स्मार्ट सर्च इंजन)

अब, आप इस पुस्तकालय का उपयोग करके AI को कैसे सिखाते हैं? आप AI को पूरा पुस्तकालय याद करने के लिए मजबूर नहीं करते (जो बहुत बड़ा और भ्रमित करने वाला है)। इसके बजाय, आप RAG (Retrieval-Augmented Generation) नामक एक रणनीति का उपयोग करते हैं।

उपमा:
कल्पना कीजिए कि AI एक शेफ है जो एक विशिष्ट व्यंजन (क्वांटम कोड लिखना) पकाने की कोशिश कर रहा है।

  • RAG के बिना: शेफ अपनी याददाश्त से खाना पकाने की कोशिश करता है। यदि उसने यह विशिष्ट रेसिपी पहले नहीं देखी है, तो वह सामग्री का अनुमान लगा सकता है और अंत में सब कुछ जला सकता है (इसे "hallucination" कहा जाता है)।
  • RAG के साथ: खाना पकाने से पहले, शेफ को पुस्तकालय में जाने, उस विशिष्ट रेसिपी को खोजने और उसे रसोई में वापस लाने की अनुमति दी जाती है जिसकी उसे आवश्यकता है। वह खाना बनाते समय उस रेसिपी को पढ़ता है।

इस शोध पत्र में, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जहाँ AI तुरंत PennyLang लाइब्रेरी को खोज सकता है, सबसे प्रासंगिक उदाहरण ढूंढ सकता है, और कोड लिखने में मदद करने के लिए उनका उपयोग कर सकता है।

4. परिणाम: "अहा!" क्षण (The "Aha!" Moment)

शोधकर्ताओं ने विभिन्न AI मॉडलों पर इस प्रणाली का परीक्षण किया, ओपन-सोर्स मॉडलों (जैसे Qwen और LLaMa) से लेकर बड़े कमर्शियल मॉडलों (जैसे GPT-4 और Claude) तक।

  • ओपन-सोर्स मॉडल (उत्साही छात्र): ये मॉडल उन छात्रों की तरह थे जिन्होंने अभी तक क्वांटम भौतिकी का अधिक अध्ययन नहीं किया था। जब उन्हें "PennyLang लाइब्रेरी" (RAG) का उपयोग करने की अनुमति दी गई, तो उनके प्रदर्शन में जबरदस्त उछाल आया।
    • उदाहरण: एक मॉडल का प्रदर्शन अंधे होकर अनुमान लगाने के कारण 8% से बढ़कर केवल लाइब्रेरी के संदर्भ के कारण 41% सही हो गया। यह एक बहुत बड़ी छलांग है!
  • कमर्शियल मॉडल (विशेषज्ञ): बड़े, महंगे मॉडल पहले से ही बहुत अच्छे थे क्योंकि उन्होंने अपने प्रशिक्षण के दौरान इंटरनेट का बहुत सारा हिस्सा "पढ़ा" था। उन्हें लाइब्रेरी की उतनी आवश्यकता नहीं थी। वास्तव में, यदि आप उन्हें बहुत अधिक जानकारी (पूरा पुस्तकालय एक साथ) देते हैं, तो यह कभी-कभी उन्हें भ्रमित कर देता है। वे सही मात्रा में मदद (75% संदर्भ) मिलने पर सबसे अच्छा काम करते हैं।

5. यह क्यों महत्वपूर्ण है

यह शोध पत्र दो कारणों से गेम-चेंजर है:

  1. यह समान अवसर प्रदान करता है: यह ओपन-सोर्स AI मॉडलों को एक बड़ा बढ़ावा देता है, जिससे वे इस विशिष्ट कार्य के लिए महंगे मॉडलों के लगभग बराबर हो जाते हैं।
  2. यह सभी के लिए दरवाजे खोलता है: एक साफ, व्यवस्थित डेटासेट बनाकर, वे डेवलपर्स के लिए AI का उपयोग करके क्वांटम कोड लिखना बहुत आसान बना रहे हैं। यह नोट्स के बिखरे हुए ढेर के बजाय सभी को एक स्पष्ट मानचित्र देने जैसा है।

संक्षेप में: शोधकर्ताओं ने क्वांटम कोड के एक बिखरे हुए संग्रह को लिया, उसे एक आदर्श पुस्तकालय में व्यवस्थित किया, और दिखाया कि जब AI को काम करते समय इस लाइब्रेरी में उत्तर "खोजने" की अनुमति दी जाती है, तो वह बहुत स्मार्ट हो जाता है, गलतियाँ कम करता है, और बेहतर कोड लिखता है। वे अनिवार्य रूप से PennyLane के लिए "Google" बना रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →