← नवीनतम पेपर
🔬 materials science

A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation

यह शोध पत्र एक स्कीमा-प्रथम संरेखण ढांचे (schema-first alignment framework) को प्रस्तुत करता है जो बड़े पैमाने के डोमेन ज्ञान को संश्लेषित करता है और सेमीकंडक्टर TCAD और FEM सिमुलेशन जैसे डेटा-दुर्लभ वैज्ञानिक क्षेत्रों में सामान्य मॉडलों से बेहतर प्रदर्शन करने वाले संक्षिप्त, निष्पादन योग्य डोमेन-विशिष्ट LLMs बनाने के लिए एक IR-संचालित डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन वर्कफ़्लो का लाभ उठाता है।

मूल लेखक: Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

प्रकाशित 2026-09-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक इलेक्ट्रॉनिक्स की अदृश्य दुनिया में, हमारे फोन और कंप्यूटर को शक्ति देने वाली चिप्स अब केवल डिज़ाइन नहीं की जाती हैं; उन्हें सिम्युलेट (अनुकरण) किया जाता है। एक भी सिलिकॉन वेफर काटने से पहले, इंजीनियर इन सूक्ष्म उपकरणों के डिजिटल ट्विन्स (डिजिटल प्रतिरूप) बनाने के लिए शक्तिशाली सॉफ़्टवेयर का उपयोग करते हैं। ये सिमुलेशन, जिन्हें टेक्नोलॉजी कंप्यूटर-एडेड डिज़ाइन (TCAD) के रूप में जाना जाता है, एक आभासी प्रयोगशाला के रूप में कार्य करते हैं। वे वैज्ञानिकों को यह अनुमान लगाने की अनुमति देते हैं कि बिजली कुछ परमाणुओं जितनी पतली परतों के माध्यम से कैसे प्रवाहित होगी, जिससे वे भौतिक विनिर्माण की लागत या समय के बिना लाखों विविधताओं का परीक्षण कर सकते हैं। हालाँकि, इन सिमुलेशन को चलाना अत्यंत कठिन है। इसके लिए जटिल, कंप्यूटर-पठनीय स्क्रिप्ट लिखने की आवश्यकता होती है जो सॉफ़्टवेयर को ठीक से बताती है कि एक आभासी उपकरण कैसे बनाया जाए, सामग्री कहाँ रखी जाए, और परिणामों को कैसे मापा जाए। ये स्क्रिप्ट सटीक होनी चाहिए; एक गलत शब्द या गलत संख्या भी पूरी सिमुलेशन को विफल कर सकती है, जिससे इंजीनियर को फिर से शुरुआत करनी पड़ती है। वर्षों से, उद्योग इन स्क्रिप्टों को लिखने के लिए मानव विशेषज्ञों पर निर्भर रहा है, जो एक धीमी, त्रुटिपूर्ण और स्वचालन (ऑटोमेशन) के लिए कठिन प्रक्रिया है।

शोधकर्ताओं की एक टीम ने अब आर्टिफिशियल इंटेलिजेंस को इन स्क्रिप्टों को सही ढंग से लिखना सिखाने का एक नया तरीका विकसित किया है, भले ही सीखने के लिए बहुत कम डेटा उपलब्ध हो। उन्होंने TcadGPT नामक एक प्रणाली बनाई है, जो एक विशेष कंप्यूटर मॉडल है जिसे सेमीकंडक्टर इंजीनियरिंग की भाषा समझने के लिए डिज़ाइन किया गया है। सामान्य-उद्देश्य वाले AI मॉडल के विपरीत जो कविता लिख सकते हैं या समाचारों का सारांश दे सकते हैं लेकिन अक्सर सटीक तकनीकी कार्यों में विफल रहते हैं, इस नए मॉडल को ऐसा कोड उत्पन्न करने के लिए प्रशिक्षित किया गया था जिसे सिमुलेशन सॉफ़्टवेयर वास्तव में चला सके। शोधकर्ताओं ने पाया कि सिंथेटिक प्रश्नों और उत्तरों की एक विशाल मात्रा को एक अद्वितीय सुधार पद्धति के साथ जोड़कर, वे AI को उच्च विश्वसनीयता के साथ वैध स्क्रिप्ट तैयार करना सिखा सकते हैं। उनका कार्य बताता है कि अत्यधिक विशिष्ट क्षेत्रों में जहाँ डेटा की कमी होती है और त्रुटियां महंगी होती हैं, वहां एक सावधानीपूर्वक ट्यून किया गया छोटा, विशेष AI मॉडल, यहाँ तक कि सबसे उन्नत सामान्य-उद्देश्य वाले सिस्टम से बेहतर प्रदर्शन कर सकता है, बशर्ते उसे सही तरीके से सिखाया गया हो।

शोधकर्ताओं के सामने चुनौती अनूठी थी। कई क्षेत्रों में, AI मौजूदा टेक्स्ट और कोड के विशाल पुस्तकालयों को पढ़कर सीखता है। लेकिन सेमीकंडक्टर डिज़ाइन में, कारखानों में उपयोग की जाने वाली वास्तविक स्क्रिप्ट अक्सर गुप्त होती है, और सीखने के लिए उपलब्ध सार्वजनिक मैनुअल कंप्यूटर द्वारा पढ़े जाने के लिए नहीं लिखे गए होते हैं। इसने डेटा की कमी पैदा कर दी। इस समस्या को हल करने के लिए, टीम ने अधिक डेटा आने का इंतज़ार नहीं किया; उन्होंने अपना स्वयं का डेटा बनाया। उन्होंने मौजूदा उपयोगकर्ता गाइड और पाठ्यपुस्तकों को लिया और एक शक्तिशाली AI का उपयोग करके 1.5 मिलियन से अधिक नए प्रश्न-उत्तर जोड़े बनाए। उन्होंने इस पीढ़ी के लिए दो अलग-अलग विधियाँ डिज़ाइन कीं। एक विधि ने सामान्य अवधारणाओं को पकड़ने के लिए दस्तावेजों को व्यापक रूप से पढ़ा, जबकि दूसरी ने गहराई से सटीकता सुनिश्चित करने के लिए सामग्री के नाम या भौतिक नियमों जैसे विशिष्ट कीवर्ड पर ध्यान केंद्रित किया। इस प्रक्रिया ने मॉडल को ज्ञान का एक मजबूत आधार दिया, जिससे वह 85.6 प्रतिशत की सटीकता के साथ यह उत्तर देने में सक्षम हुआ कि सिमुलेशन कैसे काम करते हैं, जो उन्हीं परीक्षणों पर 50 प्रतिशत से कम स्कोर करने वाले सामान्य AI मॉडल को काफी पीछे छोड़ देता है।

हालाँकि, तथ्यों को जानना कोड लिखने के समान नहीं है। शोधकर्ताओं ने पाया कि केवल मॉडल को प्रश्न पूछना सिखाना उस कोड को लिखने के लिए पर्याप्त नहीं था जिसे सॉफ़्टवेयर निष्पादित कर सके। मॉडल अक्सर भौतिकी (फिजिक्स) को सही रखता था लेकिन सिंटैक्स (वाक्य विन्यास) में विफल रहता था, कमांड को गलत क्रम में रखता था या कोई महत्वपूर्ण चरण छोड़ देता था। इसे ठीक करने के लिए, उन्होंने दूसरे, अधिक कठोर प्रशिक्षण चरण को पेश किया। उन्होंने सत्यापित, चालू स्क्रिप्ट ली और उन्हें एक संरचित, तार्किक प्रारूप में तोड़ दिया जिसने विशिष्ट शब्दावली को हटा दिया लेकिन मूल अर्थ को बनाए रखा। फिर उन्होंने इन स्क्रिप्टों के हजारों संस्करण बनाए, जिनमें से कुछ पूर्ण थे और कुछ जानबूझकर की गई छोटी त्रुटियों वाले थे। मॉडल को फिर इन जोड़ों को दिखाया गया और सही वाला चुनने के लिए कहा गया, जिससे उसने गलतियों को पहचानने और उनसे बचने का अभ्यास किया। इस प्रक्रिया को, जिसे शोधकर्ता IR-to-DPO कहते हैं, ने मॉडल को निर्देशों का पालन करने के प्रति सख्त होना सिखाया।

इस दो-चरणीय प्रशिक्षण के परिणाम आश्चर्यजनक थे। बीस नए निर्देशों के एक सेट पर परीक्षण करने पर, अंतिम संस्करण में TcadGPT ने सफलतापूर्वक उन स्क्रिप्टों को उत्पन्न किया जिन्हें सिमुलेशन सॉफ़्टवेयर ने बिना किसी त्रुटि के स्वीकार किया। इसके विपरीत, एक शीर्ष श्रेणी के सामान्य-उद्देश्य वाले AI मॉडल ने इन बीस प्रयासों में से प्रत्येक में विफल होकर दिखाया, जिससे ऐसा कोड बना जो मानव को तो सही लग रहा था लेकिन मशीन द्वारा अस्वीकार कर दिया गया। अध्ययन ने यह भी खुलासा किया कि विशेषज्ञता वाले क्षेत्रों में AI कैसे सीखता है, इसके बारे में एक आश्चर्यजनक अंतर्दृष्टि मिली। शोधकर्ताओं ने परीक्षण किया कि क्या परीक्षण के दौरान मॉडल को दस्तावेजों के पुस्तकालय तक पहुंच देना मदद करेगा, जिसे 'रिट्रीवल' (पुनर्प्राप्ति) नामक तकनीक कहा जाता है। जबकि इसने सामान्य AI मॉडल की मदद की, इसने उनके विशेष मॉडल के प्रदर्शन को वास्तव में नुकसान पहुँचाया। शोधकर्ताओं ने पाया कि एक मॉडल जो पहले से ही एक विशिष्ट विषय पर गहराई से प्रशिक्षित है, उसे परीक्षण के दौरान बाहरी जानकारी देने से वह भ्रमित हो जाता है, जिससे वह अपने द्वारा सीखे गए सटीक नियमों से ध्यान भटक जाता है।

यह सिद्ध करने के लिए कि उनका दृष्टिकोण केवल एक प्रकार के सॉफ़्टवेयर के लिए एक भाग्यशाली दुर्घटना नहीं था, टीम ने उसी प्रशिक्षण रेसिपी को 'Elmer' नामक एक अलग प्रकार के सिमुलेशन टूल पर लागू किया, जिसका उपयोग इंजीनियरिंग में जटिल भौतिक समस्याओं को हल करने के लिए किया जाता है। भले ही यह टूल पूरी तरह से अलग था, उनके तरीके से प्रशिक्षित मॉडल ने प्रश्नों के उत्तर देने और काम करने वाला कोड लिखने, दोनों में सामान्य AI मॉडल से बेहतर प्रदर्शन किया। यह सुझाव देता है कि उनके द्वारा बनाया गया ढांचा एक मजबूत पद्धति है जिसे अन्य कठिन, डेटा-विहीन वैज्ञानिक क्षेत्रों में अपनाया जा सकता है। यह कार्य प्रदर्शित करता है कि इंजीनियरिंग की उच्च-दांव वाली दुनिया में, जहाँ एक एकल त्रुटि करोड़ों डॉलर की लागत ला सकती है, आगे का रास्ता अनिवार्य रूप से बड़े, अधिक सामान्य मॉडल नहीं है, बल्कि छोटे, अत्यधिक विशिष्ट मॉडल हैं जिन्हें अत्यधिक सटीकता और अनुशासन के साथ सिखाया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →