StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis
StepPRM-RTL एक नवीन ढांचा है जो पूर्ववर्ती विधियों की तुलना में बेहतर कार्यात्मक शुद्धता और लॉन्ग-होरिज़न रीजनिंग प्राप्त करने के लिए स्टेपवाइज़ ट्राजेक्टरी मॉडलिंग, प्रोसेस-रिवॉर्ड मॉडलिंग और रिट्रीवल-ऑगमेंटेड फाइन-ट्यूनिंग को एकीकृत करके LLM-आधारित RTL कोड जनरेशन को बढ़ाता है।