← नवीनतम पेपर
💻 computer science

Verified Self-Improving Learning of Large Language Models for Multi-Objective Point-Spec Circuit Design

यह शोध पत्र \methodfull को प्रस्तुत करता है, जो एक सिमुलेशन-संचालित स्व-सुधार फ्रेमवर्क है जो विविध एनालॉग परिवारों में उच्च-परिशुद्धता, बहु-उद्देश्यीय पॉइंट-स्पेक सर्किट डिज़ाइन प्राप्त करने के लिए पारेटो-वेरिफाइड प्रेफरेंस ऑप्टिमाइज़ेशन और सेफ प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन का उपयोग करके सर्किट नेटलिस्ट को पुनरावृत्ति (iteratively) रूप से उत्पन्न, सत्यापित और मरम्मत करता है।

मूल लेखक: Juzheng Zhang, Kehao Zhang, Jinwen Liu, Yangfan Tang, Lijuan Li, Hongliang Liu, You Chen

प्रकाशित 2026-06-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juzheng Zhang, Kehao Zhang, Jinwen Liu, Yangfan Tang, Lijuan Li, Hongliang Liu, You Chen

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (apprentice) को जटिल इलेक्ट्रॉनिक सर्किट डिजाइन करना सिखाने की कोशिश कर रहे हैं (जैसे आपके फोन चार्जर के पावर कन्वर्टर या स्पीकर के एम्पलीफायर)। लक्ष्य केवल यह नहीं है कि कोई भी सर्किट काम कर जाए; लक्ष्य एक बहुत ही विशिष्ट लक्ष्य को प्राप्त करना है (जैसे, "ठीक 5 वोल्ट आउटपुट") जबकि सख्त इंजीनियरिंग नियमों (जैसे "अधिक गर्म नहीं होना चाहिए" और "यह कुशल होना चाहिए") का पालन करना भी है।

यह शोध पत्र एक नई प्रशिक्षण विधि पेश करता है जिसे MO-SIMI (मल्टी-ऑब्जेक्टिव सेल्फ-इंप्रूविंग मॉडल इटरेशन) कहा जाता है, जो एक लार्ज लैंग्वेज मॉडल (LLM) को उस प्रशिक्षु के रूप में उपयोग करता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "अनुमान और जाँच" का जाल (The "Guess and Check" Trap)

पारंपरिक रूप से, इन सर्किटों को डिजाइन करना दीवार पर यादृच्छिक सुइयों को फेंककर घास के ढेर में सुई खोजने जैसा है।

  • पुरानी AI विधियाँ उस छात्र की तरह थीं जो एक पाठ्यपुस्तक (ट्रेनिंग डेटा) पढ़ता है और फिर उत्तर का अनुमान लगाता है। वे सामान्य विचार तो समझ लेते हैं लेकिन आवश्यक सटीक नंबरों तक पहुँचने में विफल रहते हैं।
  • अन्य AI विधियाँ अनुमान लगाने के बाद उत्तर को बदलने की कोशिश करती हैं, लेकिन वे अक्सर प्रक्रिया के दौरान सर्किट को खराब कर देती हैं या छोटे, अनुपयोगी बदलावों के चक्र में फंस जाती हैं।

2. समाधान: एक "कोच, सिम्युलेटर और सेफ्टी नेट" सिस्टम

लेखकों ने एक प्रशिक्षण लूप बनाया है जो तीन अलग-अलग चरणों के साथ एक कठोर कोचिंग सत्र के रूप में कार्य करता है:

चरण A: सिमुलेशन लैब (द "टेस्ट ड्राइव")

AI एक सर्किट डिजाइन (एक "नेटलिस्ट", जो इलेक्ट्रॉनिक पुर्जों को जोड़ने की एक रेसिपी है) बनाता है। केवल यह उम्मीद करने के बजाय कि यह काम करेगा, सिस्टम तुरंत इसे एक सर्किट सिम्युलेटर (एक डिजिटल टेस्ट ड्राइव) के माध्यम से चलाता है।

  • परिणाम: सिम्युलेटर कहता है, "पास," "फेल," या "लगभग।"
  • ट्विस्ट: यदि डिजाइन लगभग सही है (उदाहरण के लिए, यह 5.0V के बजाय 4.9V आउटपुट देता है), तो सिस्टम इसे फेंक नहीं देता है। यह एक "प्रतिबंधित मरम्मत" (Restricted Repair) लागू करता है। इसे एक मैकेनिक के रूप में सोचें जिसे केवल कुछ विशिष्ट नॉब (जैसे एक रेसिस्टर वैल्यू को एडजस्ट करना) घुमाने की अनुमति है, लेकिन उसे इंजन का प्रकार या वायरिंग लेआउट बदलने से मना किया गया है। यदि नॉब घुमाने से समस्या ठीक हो जाती है, तो "लगभग" एक "पास" बन जाता है।

चरण B: प्रेफरेंस कोच (विजेताओं से सीखना)

एक बार जब सिस्टम के पास डिजाइनों का एक बैच आ जाता है, तो यह उनकी तुलना करता है।

  • यह केवल "सर्वश्रेष्ठ" वाले को नहीं देखता। यह पारेटो रैंकिंग (Pareto Ranking) नामक एक विधि का उपयोग करता है। कल्पना करें कि एक दौड़ है जहाँ आपको गति और ईंधन दक्षता दोनों की परवाह है। एक कार जो थोड़ी धीमी है लेकिन बहुत अधिक कुशल है, वह एक तेज़, पेट्रोल बर्बाद करने वाली कार से बेहतर हो सकती है।
  • सिस्टम "प्रेफरेंस पेयर्स" बनाता है: "यह डिजाइन उस दूसरे से बेहतर है क्योंकि इसने लक्ष्य को पूरा किया और यह अधिक कुशल था।"
  • AI को फिर इन तुलनाओं पर फिर से प्रशिक्षित किया जाता है, जिससे वह "हारने वाले" स्टाइल के बजाय "जीतने वाले" स्टाइल के डिजाइन को पसंद करना सीखता है। यह PVPO चरण है।

चरण C: सेफ्टी नेट (द "रोलबैक" बटन)

यह सबसे महत्वपूर्ण नवाचार है। AI इन प्राथमिकताओं से सीखने और खुद को अपडेट करने की कोशिश करता है। लेकिन, क्या होगा यदि अपडेट इसे खराब बना दे?

  • कई AI सिस्टमों में, एक बुरा अपडेट टिक जाता है, और मॉडल वह सब भूल जाता है जो वह जानता था।
  • MO-SIMI एक "गार्ड" (Guard) का उपयोग करता है। AI द्वारा अपडेट करने के बाद, सिस्टम इसे फिर से टेस्ट करता है। यदि नया संस्करण मानकों को पूरा करने में विफल रहता है (या यदि "हिट रेट" गिर जाता है), तो सिस्टम रोलबैक (Rollback) बटन दबा देता है। यह नए अपडेट को फेंक देता है और पिछले, सुरक्षित संस्करण पर वापस चला जाता है।
  • यह सुनिश्चित करता है कि AI कभी भी खराब न हो। यह केवल आगे बढ़ता है, हर कदम पर सत्यापित किए गए सुधार के साथ।

3. परिणाम: "शायद" से "मास्टर" तक

इस शोध पत्र ने तीन प्रकार के सर्किटों पर परीक्षण किया:

  1. DC-DC कन्वर्टर्स (पावर कन्वर्टर, जैसे चार्जर में)।
  2. एम्पलीफायर्स (सिग्नल बढ़ाने के लिए)।
  3. ऑसिलेटर्स (तरंगें उत्पन्न करने के लिए)।

उपलब्धियां:

  • उच्च सटीकता: पावर कन्वर्टर कार्यों पर, इसने सटीक लक्ष्य विशिष्टताओं को 97.8% बार हासिल किया।
  • जटिलता: इसने 20+ घटकों वाले सर्किट सफलतापूर्वक डिजाइन किए (जिसे AI के लिए बहुत जटिल माना जाता है)।
  • बहुमुखी प्रतिभा: एक बार जब उन्होंने सिस्टम को पावर कन्वर्टर डिजाइन करना सिखा दिया, तो उन्होंने बस "नियम पुस्तिका" (वेरिफायर) को बदला और वही सिस्टम समान सफलता के साथ एम्पलीफायर और ऑसिलेटर डिजाइन करने में सक्षम रहा।

बड़ी तस्वीर का उदाहरण (The Big Picture Analogy)

कल्पना कीजिए कि एक शेफ एक केक बनाने की कोशिश कर रहा है जिसे बिल्कुल एक विशिष्ट रेसिपी जैसा स्वाद देना चाहिए, जिसमें केवल विशिष्ट सामग्रियों का उपयोग किया गया हो।

  • पुराना AI: शेफ रेसिपी पढ़ता है, सामग्री की मात्रा का अनुमान लगाता है, केक बनाता है, और यदि यह थोड़ा सा भी गलत होता है, तो वह बस शुरू से फिर से प्रयास करता है।
  • MO-SIMI:
    1. शेफ एक केक बनाता है।
    2. एक टेस्ट-टेस्टर (सिम्युलेटर) कहता है, "यह 90% सही है, लेकिन बहुत मीठा है।"
    3. एक "प्रतिबंधित मरम्मत" नियम कहता है, "आप केवल एक चुटकी नमक डाल सकते हैं, आप आटा नहीं बदल सकते।" शेफ नमक डालता है, और यह एकदम सही हो जाता है।
    4. वह एक खराब केक के साथ इसकी तुलना करता है और सीखता है कि पहला वाला क्यों बेहतर था।
    5. इससे पहले कि शेफ एक नई तकनीक आज़माए, एक "सेफ्टी मैनेजर" जांच करता है: "क्या इस नई तकनीक ने आपके परफेक्ट केक बनाने की क्षमता को बिगाड़ दिया?" यदि हाँ, तो शेफ पुरानी तकनीक पर वापस चला जाता है। यदि नहीं, तो वह नई तकनीक को अपना लेता है।

निष्कर्ष:
शोध पत्र का दावा है कि सिमुलेशन वेरिफिकेशन, स्मार्ट रिपेयर्स, प्रेफरेंस लर्निंग और सेफ्टी रोलबैक को जोड़कर, उन्होंने एक ऐसा AI बनाया है जो बिना मानवीय हस्तक्षेप के जटिल, उच्च-सटीक इलेक्ट्रॉनिक सर्किट को विश्वसनीय रूप से डिजाइन कर सकता है, और हर बार प्रयास करने के साथ यह और बेहतर होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →