← नवीनतम पेपर
🤖 AI

RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

यह शोध पत्र RTL-BenchLS प्रस्तुत करता है, जो 10,000 से अधिक औपचारिक रूप से सत्यापित (formally verified) Verilog डिज़ाइनों और तीन नवीन स्व-पर्यवेक्षित तर्क कार्यों (self-supervised reasoning tasks) वाला एक बड़े पैमाने का बेंचमार्क है, जो हार्डवेयर डिज़ाइन ऑटोमेशन के लिए LLMs के विकास को कठोरता से मूल्यांकन करने और निर्देशित करने हेतु मौजूदा बेंचमार्क की स्केलेबिलिटी सीमाओं को दूर करता है।

मूल लेखक: Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन प्रशिक्षु (apprentice) को केवल प्राकृतिक भाषा के निर्देशों का उपयोग करके जटिल इलेक्ट्रॉनिक सर्किट (जिन्हें RTL डिज़ाइन कहा जाता है) बनाना सिखाने की कोशिश कर रहे हैं। यह देखने के लिए कि क्या प्रशिक्षु वास्तव में सीख रहा है, आपको एक परीक्षण की आवश्यकता है।

लंबे समय तक, इन AI "प्रशिक्षुओं" (Large Language Models या LLMs) का मूल्यांकन करने के लिए उपयोग किए जाने वाले परीक्षण किंडरगार्टन की कलरिंग बुक्स जैसे थे। वे छोटे और सरल थे, और AI पैटर्न को याद करके आसानी से पूर्ण स्कोर प्राप्त कर सकता था। यह शोध पत्र तर्क देता है कि हमें यह देखने के लिए कि क्या ये AI वास्तव में काम कर सकते हैं, एक वास्तविक निर्माण स्थल (construction site) की आवश्यकता है।

यहाँ RTL-BenchLS की कहानी है, जो पेश किया गया एक नया, बहुत कठिन परीक्षण है।

1. समस्या: "किंडरगार्टन" परीक्षण

मौजूदा परीक्षण बहुत आसान थे। उनमें था:

  • बहुत कम डिज़ाइन: जैसे हजारों के बजाय केवल 50 छोटे पहेली वाले ब्लॉक होना।
  • बहुत सरल: जैसे AI से एक पूरा किला बनाने के बजाय केवल एक सिंगल लेगो ब्रिक बनाने के लिए कहना।
  • एक ही चाल: वे ज्यादातर केवल AI को एक वाक्य को कोड में अनुवाद करने के लिए कहते थे। एक बार जब AI इसमें कुशल हो गया, तो परीक्षण उपयोगी नहीं रहा क्योंकि AI "सैचुरेट" (सब कुछ 100% प्राप्त करना) हो गया था।

इसके अलावा, एक कठिन परीक्षण बनाना असंभव माना जाता था। क्यों? क्योंकि एक कठिन परीक्षण बनाने के लिए, आपको हर एक पहेली के लिए एक मानव विशेषज्ञ द्वारा "उत्तर कुंजी" (testbench) लिखने की आवश्यकता होती है। 10,000 जटिल सर्किटों के लिए ऐसा करने के लिए पर्याप्त मानव विशेषज्ञ नहीं हैं।

2. समाधान: एक स्वयं-जांच करने वाला "जादुई दर्पण"

शोधकर्ताओं ने 10,000 से अधिक सत्यापित सर्किट डिज़ाइनों का एक विशाल पुस्तकालय बनाया। ये छोटे ईंटें नहीं हैं; ये जटिल संरचनाएं हैं, जिनमें से कुछ में लगभग 500 पंक्तियों का कोड है।

"उत्तर कुंजी" की समस्या को हल करने के लिए, बिना हजारों मनुष्यों को काम पर रखे, उन्होंने तीन नए प्रकार के पहेली बनाए जो एक जादुई दर्पण की तरह कार्य करते हैं। AI को यह साबित करना होगा कि वह सर्किट को समझता है, इसके लिए उसे ऐसी चीजें करनी होंगी जो तभी काम करेंगी यदि वह वास्तव में तर्क (logic) को समझता है, न कि केवल सही उत्तर का अनुमान लगाता है।

तीन नई पहेलियाँ:

पहेली 1: "सारांश और पुनर्निर्माण" चुनौती (Round-Trip Reasoning)

  • सेटअप: आप AI को एक जटिल सर्किट आरेख देते हैं।
  • कार्य: AI को पहले यह लिखना होगा कि यह कैसे काम करता है (जैसे कि एक रेसिपी), और फिर, केवल उस सारांश का उपयोग करके, उसी सटीक सर्किट को शून्य से फिर से बनाना होगा।
  • कैच: यदि सारांश एक भी सूक्ष्म विवरण छोड़ देता है, तो पुनर्निर्मित सर्किट अलग होगा। सिस्टम यह जांचता है कि क्या नया सर्किट मूल सर्किट के समान है।
  • उपमा: यह एक शेफ को एक जटिल व्यंजन का स्वाद चखने, उसकी रेसिपी लिखने और फिर उस नोट से दोबारा वही व्यंजन पकाने के लिए कहने जैसा है। यदि स्वाद अलग है, तो वह विफल रहा।

पहेली 2: "लुप्त हिस्सा" चुनौती (Masked-Content Reasoning)

  • सेटअप: आप AI को एक सर्किट दिखाते हैं, लेकिन आप कोड के एक विशिष्ट ब्लॉक को एक "खाली" स्टिकर से ढक देते हैं।
  • कार्य: AI को आसपास के कोड और खाली स्थान के विवरण को देखकर यह पता लगाना होगा कि स्टिकर के नीचे वास्तव में क्या था और उसे सही ढंग से भरना होगा।
  • उपमा: एक जिग्सॉ पहेली की कल्पना करें जहाँ एक टुकड़ा छिपा हुआ है। आपको छेद के आसपास की तस्वीर को देखना होगा और अनुमान लगाना होगा कि गायब टुकड़ा कैसा दिखता है ताकि चित्र पूरा हो सके।

पहेली 3: "बग डिटेक्टिव" चुनौती (Repository-Issue Reasoning)

  • सेटअप: आप AI को कोड का एक पूरा फोल्डर (एक प्रोजेक्ट) और एक उपयोगकर्ता की शिकायत देते हैं कि "यह हिस्सा टूटा हुआ है!"
  • कार्य: AI को उस विशाल कोड फोल्डर में टूटे हुए हिस्से को खोजना होगा और उसे ठीक करना होगा ताकि यह बिल्कुल वैसा ही काम करे जैसा कि एक मानव विशेषज्ञ द्वारा किया गया "गोल्डन" फिक्स होगा।
  • उपमा: आप एक मैकेनिक को एक कार सौंपते हैं जिसमें अजीब सी आवाज़ आ रही है और एक नोट देते हैं कि "यह एक चरचराहट जैसी लग रही है।" मैकेनिक को इंजन में उस ढीले पेंच को खोजना होगा और उसे ठीक करना होगा, बिना किसी और चीज़ को खराब किए।

3. परिणाम: AI अभी भी एक "नौसिखिया" है

शोधकर्ताओं ने 8 सबसे स्मार्ट AI मॉडलों का इस नए, कठिन बेंचमार्क पर परीक्षण किया। परिणाम आंखें खोलने वाले थे:

  • पुराने, आसान परीक्षणों पर: सर्वश्रेष्ठ AI लगभग 88% सही थे।
  • नए, कठिन परीक्षणों पर:
    • राउंड-ट्रिप (सारांश और पुनर्निर्माण): सर्वश्रेष्ठ AI केवल ~23% सही थे।
    • लुप्त हिस्सा: सर्वश्रेष्ठ AI केवल ~28% सही थे।
    • बग डिटेक्टिव: सर्वश्रेष्ठ AI केवल ~12% सही थे।

इसका क्या अर्थ है: यहाँ तक कि सबसे स्मार्ट AI भी वर्तमान में जटिल हार्डवेयर लॉजिक को वास्तव में समझने में बहुत खराब हैं। वे सरल कार्यों पर पैटर्न की नकल करने में अच्छे हैं, लेकिन जब आप उन्हें जटिल समस्या के माध्यम से तर्क करने के लिए कहते हैं, तो वे काफी संघर्ष करते हैं।

4. यह क्यों महत्वपूर्ण है

यह पेपर यह नहीं कहता कि AI कभी चिप्स नहीं बना पाएगा। यह कहता है कि हम उनकी क्षमता का बहुत अधिक आकलन कर रहे थे क्योंकि हमारे परीक्षण बहुत आसान थे।

RTL-BenchLS एक किंडरगार्टन क्लासरूम से एक पेशेवर इंजीनियरिंग फर्म में परीक्षण ले जाने जैसा है। यह हमें दिखाता है कि AI वास्तव में कहाँ विफल हो रहा है (जैसे जटिल तर्क में भ्रमित होना या बग रिपोर्ट में छोटी बारीकियों को छोड़ देना) और इंजीनियरों को प्रगति मापने के लिए एक वास्तविक उपकरण देता है। यह सुधार की बहुत गुंजाइश छोड़ता है, जो यह सिद्ध करता है कि पूरी तरह से स्वचालित हार्डवेयर डिजाइन की यात्रा अभी शुरू हुई है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →