← नवीनतम पेपर
💬 NLP

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet एक पूर्णतः ओपन-सोर्स डेटासेट है जिसमें 1,31,000 से अधिक विविध Verilog मॉड्यूल एआई-जनरेटेड प्राकृतिक भाषा विवरणों के साथ युग्मित हैं, जिसे हार्डवेयर डिज़ाइन में लार्ज लैंग्वेज मॉडल की क्षमताओं को आगे बढ़ाने और यह प्रदर्शित करने के लिए डिज़ाइन किया गया है कि ओपन-सोर्स दृष्टिकोण Verilog कोड जनरेशन में बेहतर प्रदर्शन प्राप्त कर सकते हैं।

मूल लेखक: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

प्रकाशित 2026-06-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (apprentice) को जटिल डिजिटल सर्किट बनाना सिखाने की कोशिश कर रहे हैं। इलेक्ट्रॉनिक्स की दुनिया में, इन सर्किटों को Verilog नामक एक विशेष भाषा का उपयोग करके वर्णित किया जाता है। लंबे समय तक, इस कार्य के लिए सबसे अच्छे "शिक्षक" (लार्ज लैंग्वेज मॉडल्स या LLMs) संघर्ष कर रहे थे क्योंकि उनके पास अध्ययन करने के लिए पर्याप्त अच्छी पाठ्यपुस्तकें नहीं थीं। मौजूदा अधिकांश पुस्तकें निजी पुस्तकालयों (मालिकाना औद्योगिक डेटा) में बंद थीं, या वे बहुत छोटी और त्रुटियों से भरी थीं।

यह शोध पत्र OPENRTLSET को प्रस्तुत करता है, जो अनिवार्य रूप से Verilog पाठ्यपुस्तकों का दुनिया का सबसे बड़ा, पूरी तरह से मुफ्त पुस्तकालय है, जिसे विशेष रूप से इन AI प्रशिक्षुओं को प्रशिक्षित करने के लिए डिज़ाइन किया गया है।

यहाँ बताया गया है कि उन्होंने इस पुस्तकालय को कैसे बनाया और उन्हें क्या पता चला, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. कच्चे माल को इकट्ठा करना (डेटासेट)

शोधकर्ताओं ने केवल कोड को कॉपी-पेस्ट नहीं किया; उन्होंने तीन अलग-अलग स्रोतों से एक विशाल संग्रह बनाया, जैसे तीन अलग-अलग बगीचों से सामग्री एकत्र करना:

  • Verilog का बगीचा: उन्हें GitHub (कोड के लिए "ओपन-सोर्स" इंटरनेट) पर 1,00,000 से अधिक मौजूदा Verilog डिज़ाइन मिले।
  • VHDL का बगीचा: उन्हें VHDL नामक एक अलग भाषा में लिखे गए लगभग 5,000 डिज़ाइन मिले और उन्होंने उन्हें Verilog में अनुवादित किया, जैसे किसी फ्रांसीसी रेसिपी को अंग्रेजी में अनुवादित करना ताकि हर कोई इसे पढ़ सके।
  • C++ का बगीचा: उन्हें C/C++ (एक उच्च-स्तरीय प्रोग्रामिंग भाषा) में लिखे गए लगभग 24,000 डिज़ाइन मिले और उन्होंने उन्हें Verilog में बदलने के लिए एक विशेष टूल का उपयोग किया। इसे एक उच्च-स्तरीय वास्तुशिल्प ब्लूप्रिंट से विस्तृत ईंट-दर-ईंट निर्देशों को स्वचालित रूप से उत्पन्न करने के रूप में सोचें।

स्वर्ण नियम: इस पुस्तकालय का प्रत्येक हिस्सा "ओपन सोर्स" है। इसका मतलब है कि कोई भी—छात्र, शोधकर्ता, या कंपनियाँ—कानूनी प्रतिबंधों या छिपी हुई फीस की चिंता किए बिना इसे मुफ्त में उपयोग कर सकता है।

2. शिक्षक के नोट्स लिखना (लेबलिंग)

कच्चा कोड ईंटों के ढेर जैसा है; बिना विवरण के यह समझना कठिन है कि वह इमारत वास्तव में क्या है। इसे ठीक करने के लिए, टीम ने प्रत्येक मॉड्यूल के लिए प्राकृतिक भाषा विवरण लिखने के लिए एक सुपर-स्मार्ट AI (DeepSeek-R1) का उपयोग किया।

  • "कॉन्टेक्स्ट" का तरीका: कभी-कभी, AI को कोड को बेहतर ढंग से समझने में मदद करने के लिए, उन्होंने Verilog के साथ एक "C++ संस्करण" भी उत्पन्न किया। यह सर्किट के ब्लूप्रिंट और उसके साथ एक 3D मॉडल देने जैसा है ताकि छात्र संरचना को बेहतर ढंग से समझ सके।
  • परिणाम: उन्होंने "कोड + विवरण" के जोड़े बनाए, जिससे ईंटों के ढेर को "यह क्या करता है, और इसे कैसे बनाया जाए" के पाठों में बदल दिया गया।

3. प्रशिक्षण शिविर (फाइन-ट्यूनिंग)

शोधकर्ताओं ने इस नए पुस्तकालय को लिया और इसका उपयोग कई अलग-अलग AI मॉडलों (जैसे Qwen और Granite) को प्रशिक्षित करने के लिए किया। उन्होंने इन मॉडलों का परीक्षण यह देखने के लिए किया कि वे शून्य से नया, सही Verilog कोड कितनी अच्छी तरह बना सकते हैं।

उन्होंने क्या खोजा:

  • अधिक डेटा बेहतर है: जब उन्होंने AI को पूरे 1,31,000-मॉड्यूल वाले पुस्तकालय पर प्रशिक्षित किया, तो AI 11,000-मॉड्यूल के छोटे हिस्से की तुलना में काफी बेहतर प्रदर्शन कर रहा था। यह एक किताब के एक अध्याय को पढ़ने बनाम पूरी विश्वकोश को पढ़ने के बीच के अंतर जैसा है।
  • गुणवत्ता मायने रखती है: OPENRTLSET पर प्रशिक्षित AI, पुराने, छोटे डेटासेट पर प्रशिक्षित AI की तुलना में बहुत बेहतर प्रदर्शन करता है। वास्तव में, नए AI मॉडल पिछले प्रयासों की तुलना में लगभग 14% अधिक बार सही सर्किट उत्पन्न कर सकते हैं।
  • छोटे मॉडल भी जीत सकते हैं: उन्होंने पाया कि एक छोटा AI मॉडल (8 बिलियन पैरामीटर्स वाला), जब इस उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित किया जाता है, तो वह बहुत बड़े, प्रसिद्ध मॉडलों को भी पछाड़ सकता है जिन्हें इस विशिष्ट हार्डवेयर डेटा पर प्रशिक्षित नहीं किया गया था।

4. मुख्य निष्कर्ष

शोध पत्र का दावा है कि OPENRTLSET हार्डवेयर डिजाइन करने के लिए AI को सिखाने की सबसे बड़ी बाधा को दूर करता है: उच्च-गुणवत्ता वाले मुफ्त डेटा की कमी। एक विशाल, स्वच्छ और कानूनी रूप से सुरक्षित डेटासेट प्रदान करके, उन्होंने दिखाया है कि ओपन-सोर्स दृष्टिकोण वास्तव में इस विशिष्ट क्षेत्र में मालिकाना (proprietary) दृष्टिकोणों को हरा सकते हैं।

संक्षेप में, उन्होंने AI के लिए हार्डवेयर डिजाइन सीखने के लिए अंतिम "प्रशिक्षण मैनुअल" बनाया है, यह सिद्ध करते हुए कि जब आप AI को सही ओपन-सोर्स उपकरण देते हैं, तो वह एक मास्टर बिल्डर बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →