← नवीनतम पेपर
🤖 AI

RuC: HDL-Agnostic Rule Completion Benchmark Generation

यह शोध पत्र RuC को प्रस्तुत करता है, जो एक व्याकरण-संचालित, भाषा-अज्ञेय (language-agnostic) ढांचा है, जो हार्डवेयर डिज़ाइन कार्यों में लार्ज लैंग्वेज मॉडल्स (LLMs) के प्रदर्शन का व्यवस्थित रूप से मूल्यांकन करने के लिए सिंथेटिक क्षेत्रों को मास्क करके स्केलेबल और ग्रैनुलर RTL कोड-पूर्णता बेंचमार्क उत्पन्न करता है।

मूल लेखक: Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक (literal) रोबोट को हार्डवेयर (जैसे आपके फोन के अंदर की चिप या सुपरकंप्यूटर) के लिए कंप्यूटर कोड लिखना सिखाने की कोशिश कर रहे हैं। वह रोबोट एक "लार्ज लैंग्वेज मॉडल" (LLM) है, जो कहानियाँ लिखने या सवालों के जवाब देने में माहिर है, लेकिन हमें यह जानने की जरूरत है कि क्या वह वास्तव में कार्यात्मक सर्किट (functional circuits) बना सकता है।

यह शोध पत्र (paper) इन रोबोट्स को टेस्ट करने का एक नया तरीका पेश करता है, जिसे RuC (रूल-बेस्ड कंप्लीशन) कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है:

समस्या: "सब-या-कुछ-नहीं" वाला टेस्ट (The "All-or-Nothing" Test)

RuC से पहले, इन रोबोट्स का परीक्षण करना "गायब हिस्से का अनुमान लगाने" के खेल जैसा था, जिसमें दो बहुत ही चरम विकल्प थे:

  1. "पूरा घर" वाला टेस्ट: आप घर का एक पूरा कमरा छिपा देते हैं और रोबोट से केवल बाहर के गलियारे के आधार पर पूरे कमरे को फिर से बनाने के लिए कहते हैं। यह बहुत कठिन है; रोबोट को बहुत अधिक अनुमान लगाना पड़ता है।
  2. "ईंट" वाला टेस्ट: आप दीवार में सिर्फ एक ईंट छिपा देते हैं और रोबोट से पूछते है कि उसका रंग क्या है। यह बहुत आसान और रैंडम है; ईंट का संरचना से कोई खास लेना-देना भी नहीं हो सकता।

दोनों तरीके हमें यह सटीक रूप से नहीं बता सके कि रोबोट हार्डवेयर बनाने के विशिष्ट नियमों को कितनी अच्छी तरह समझता है।

समाधान: "व्याकरण पहेली" (The "Grammar Puzzle")

लेखकों ने RuC बनाया है, जो एक स्मार्ट पहेली निर्माता की तरह है। रैंडम शब्द या पूरे कमरे का अनुमान लगाने के बजाय, RuC हार्डवेयर भाषा (SystemVerilog) के "व्याकरण" (आधिकारिक नियम पुस्तिका) का उपयोग करके पहेलियाँ बनाता है।

सोचिए कि हार्डवेयर कोड एक भाषा में लिखे गए वाक्य की तरह है। RuC इनमें से कुछ भी छिपा सकता है:

  • केवल कर्ता (Subject) (जैसे, एक तार/wire का नाम)।
  • क्रिया (Verb) (जैसे, तार द्वारा की जाने वाली क्रिया)।
  • पूरा उपवाक्य (Clause) (जैसे, एक पूरा लॉजिक नियम)।

यह शोधकर्ताओं को पहेलियाँ बनाने की क्षमता देता है जो किसी भी कठिनाई की हो सकती हैं। वे रोबोट को एक छोटा, सरल हिस्सा भरने या एक जटिल, बहु-चरणीय लॉजिक ब्लॉक भरने के लिए कह सकते हैं, जो इस बात पर निर्भर करता है कि वे क्या टेस्ट करना चाहते हैं।

यह टेस्ट कैसे काम करता है

  1. सेटअप: RuC वास्तविक, मौजूदा हार्डवेयर डिजाइनों (जैसे "टिनी टेपआउट" शटल और एक "CVE2" प्रोसेसर कोर) को लेता है और उन्हें उनके व्याकरणिक भागों में तोड़ देता है।
  2. मास्क (The Mask): यह एक विशिष्ट नियम चुनता है (जैसे, एक "कंटीन्यूअस असाइनमेंट" या "केस स्टेटमेंट") और उसे छिपा देता है, उसे एक खाली स्थान (<MASK>) से बदल देता है।
  3. प्रॉम्प्ट (The Prompt): यह रोबट को खाली स्थान से पहले और बाद का कोड दिखाता है, और उसे गायब हिस्से को भरने के लिए कहता है।
    • उपमा: कल्पना कीजिए कि आप एक वाक्य पढ़ रहे हैं जैसे "बिल्ली ___ पर बैठी है।" रोबोट को "मैट" का अनुमान लगाना होगा। RuC यही करता है, लेकिन जटिल हार्डवेयर लॉजिक के साथ।
  4. चेक (The Check): एक बार जब रोबोट अपना उत्तर लिख देता है, तो RuC केवल शब्दों को नहीं देखता। यह दो सख्त जांचों का उपयोग करता है:
    • सिंटैक्स चेक (Syntax Check): क्या वाक्य व्याकरण की दृष्टि से सही है? (क्या कोड वैध है?)
    • फंक्शन चेक (Function Check): क्या वाक्य का अर्थ मूल के समान है? (क्या सर्किट वास्तव में उसी तरह काम करता है?) वे एक "मिरर" टेस्ट का उपयोग करते हैं: वे रोबोट के कोड और मूल कोड को अगल-बगल चलाते हैं और देखते हैं कि क्या वे अलग परिणाम देते हैं। यदि वे पूरी तरह से मेल खाते हैं, तो रोबोट पास हो जाता है।

उन्होंने क्या पाया

शोधकर्ताओं ने इन पहेलियों पर दुनिया के कुछ बेहतरीन ओपन-सोर्स AI मॉडल्स का परीक्षण किया। यहाँ उनकी खोजें दी गई हैं:

  • "फिल-इन-द-मिडल" (Fill-in-the-Middle) ट्रिक: रोबोट्स का प्रदर्शन तब सबसे अच्छा रहा जब टेस्ट को "फिल-इन-द-मिडल" पहेली की तरह सेट किया गया था। यह एक "फिल-इन-द-मिडल" पहेली की तरह है जहाँ आप रोबोट को वाक्य की शुरुआत और अंत देते हैं और उसे बीच का हिस्सा भरने के लिए कहते हैं, बजाय इसके कि उसे एक पूरा नया पैराग्राफ लिखने के लिए कहें। ऐसा इसलिए है क्योंकि उन्हें इसी तरह से प्रशिक्षित किया गया है, इसलिए वे इसमें बेहतर हैं।
  • आकार मायने रखता है (लेकिन हमेशा नहीं): आम तौर पर, बड़े रोबोट (बड़े मॉडल्स) बेहतर स्कोर प्राप्त करते हैं। हालांकि, एक छोटा रोबोट कभी-कभी बड़े रोबोट को हरा सकता है यदि विशिष्ट पहेली उसकी ताकत से मेल खाती हो।
  • कठिनाई भिन्न होती है: कुछ नियम रोबोट के लिए आसान थे (जैसे सरल इनपुट को परिभाषित करना), जबकि अन्य बहुत कठिन थे (जैसे जटिल "इफ-देन" लॉजिक ब्लॉक्स)। यह साबित करता है कि आप केवल यह नहीं कह सकते कि "रोबोट को कोडिंग आती है।" आपको कहना होगा कि "रोबोट X में अच्छा है, लेकिन Y में बुरा है।"

यह क्यों महत्वपूर्ण है

शोध पत्र यह निष्कर्ष निकालता है कि यह समझने के लिए कि क्या AI वास्तव को इंजीनियरों को चिप डिजाइन करने में मदद कर सकता है, हमें ऐसे टेस्ट की आवश्यकता है जो लचीले और सटीक हों। हम केवल AI से "एक चिप लिखने" या "एक लाइन का अनुमान लगाने" के लिए नहीं कह सकते। हमें भाषा के विशिष्ट नियमों का परीक्षण करने की आवश्यकता है, ठीक वैसे ही जैसे ड्राइविंग टेस्ट यह जांचता है कि क्या आप अलग-अलग समानांतर पार्किंग (parallel park) कर सकते हैं, हाईवे पर मर्ज हो सकते हैं, और रेड लाइट पर रुक सकते हैं, बजाय इसके कि केवल यह देखें कि क्या आप कार चला सकते हैं।

RuC यह लचीला, नियम-दर-नियम परीक्षण आधार प्रदान करता है, जिससे यह सुनिश्चित होता है कि जब हम अंततः हार्डवेयर बनाने में AI का उपयोग करेंगे, तो हमें पता होगा कि वह वास्तव में क्या कर सकता है और क्या नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →