← नवीनतम पेपर
⚡ electrical engineering

Event-Driven Reinforcement Learning Enables Long-Horizon Control in Semiconductor Fabrication

यह शोध पत्र एक स्केलेबल, इवेंट-ड्रिवन डीप रीइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो जटिल सेमीकंडक्टर फैब्रिकेशन सिस्टम में लॉन्ग-होरिज़न, मल्टी-ऑब्जेक्टिव कंट्रोल को प्रभावी ढंग से अनुकूलित करता है, और विविध उद्योग-वास्तविक परिदृश्यों में थ्रूपुट और यूटिलाइजेशन में महत्वपूर्ण सुधार प्रदर्शित करता है।

मूल लेखक: Yavar Yeganeh, Mahsa Shekari, Nicla Frigerio, Daniele Pagano, Andrea Matta

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yavar Yeganeh, Mahsa Shekari, Nicla Frigerio, Daniele Pagano, Andrea Matta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक सेमीकंडक्टर फैक्ट्री (एक "फैब") की कल्पना एक विशाल, अराजक रसोई के रूप में करें जहाँ एक साथ हजारों अलग-अलग व्यंजनों को पकाया जा रहा है। यहाँ सामग्रियाँ सिलिकॉन वेफर्स हैं और रसोइये सैकड़ों अलग-अलग मशीनें हैं। समस्या यह है कि रसोई अविश्वसनीय रूप से जटिल है: कुछ व्यंजनों में घंटों लगते हैं, कुछ मशीनें खराब हो जाती हैं, कुछ सामग्रियों को एक विशिष्ट क्रम में रखने की आवश्यकता होती है, और "रसोइयों" (मशीनों) को अक्सर एक-दूसरे का इंतज़ार करना पड़ता है।

पारंपरिक रूप से, फैक्ट्री मैनेजर इस बात का निर्णय लेने के लिए सरल नियमों का उपयोग करते हैं कि अगली वेफर किस मशीन को भेजी जाए (जैसे कि "फर्स्ट इन, फर्स्ट आउट" या "शॉर्टेस्ट जॉब फर्स्ट")। लेकिन इस अराजक रसोई में, सरल नियम अक्सर ट्रैफिक जाम, बर्बाद समय और धीमी कुकिंग का कारण बनते हैं।

यह शोध पत्र इस रसोई को चलाने का एक नया तरीका प्रस्तावित करता है जो आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करता है जो प्रयास और त्रुटि (trial and error) से सीखता है, जिसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है। उनके दृष्टिकोण और उनके निष्कर्षों का विवरण यहाँ दिया गया है:

मुख्य समस्या: "लंबा इंतज़ार"

एक सामान्य वीडियो गेम में, आप एक बटन दबाते हैं, और आपको तुरंत अंक मिलते हैं। एक सेमीकंडक्टर फैक्ट्री में, यदि आप आज एक निर्णय लेते हैं (जैसे कि एक वेफर को मशीन A में भेजना), तो आप उसका परिणाम (जैसे कि एक तैयार उत्पाद) देखने के लिए कई दिनों तक प्रतीक्षा कर सकते हैं। पुरस्कार विलंबित (delayed) होता है।

  • उपमा: कल्पना कीजिए कि आप शतरंज का एक खेल खेल रहे हैं, लेकिन आपको अंक केवल मैच के अंत में मिलते हैं। यदि आप पहले मिनट में एक गलत चाल चलते हैं, तो आपको तब तक पता नहीं चलेगा जब तक खेल समाप्त नहीं हो जाता। मानक AI इस मामले में संघर्ष करता है क्योंकि उसे यह नहीं पता होता कि किस विशिष्ट चाल के कारण जीत या हार हुई।

समाधान: एक "इवेंट-ड्रिवन" कंडक्टर

शोधकर्ताओं ने एक ऐसा ढांचा बनाया है जहाँ AI मशीनों के पूरे ऑर्केस्ट्रा के लिए एक एकल सोलोइस्ट (एकल वादक) के बजाय एक केंद्रीकृत कंडक्टर (centralized conductor) के रूपत कार्य करता है।

  1. सेकंड के बजाय "इवेंट्स" में सोचना: फैक्ट्री की हर सेकंड जांच करने के बजाय, AI केवल तभी जागता है जब कुछ होता है (एक "इवेंट"), जैसे कि किसी मशीन का काम पूरा होना या खाली होना। यह ठीक उसी तरह है जैसे फैक्ट्री वास्तव में काम करती है।
  2. अराजकता को समूह में बांटना: क्योंकि परिणाम विलंबित होते हैं, AI एक एकल निर्णय को अलग से नहीं आंकता है। इसके बजाय, यह समय के एक हिस्से (जैसे कि 6 घंटे की शिफ्ट) के दौरान होने वाले इवेंट्स के एक समूह को देखता है। यह पूछता है: "क्या इन निर्णयों के पूरे समूह ने कुल मिलाकर रसोई को बेहतर बनाया?"
  3. पुरस्कार प्रणाली: AI को दो प्रकार का फीडबैक मिलता है:
    • तत्काल फीडबैक: "आपने मशीन A को 5 मिनट इंतज़ार कराया; यह एक छोटा दंड है।"
    • बड़ी तस्वीर वाला फीडबैक: "पिछले 6 घंटों में, हमने 20% अधिक वेफर्स का उत्पादन किया; यह एक बहुत बड़ा पुरस्कार है।"
      इन दोनों को जोड़कर, AI छोटे निर्णय लेना सीखता है जो बाद में बड़ी जीत की ओर ले जाते हैं।

उन्होंने इसका परीक्षण कैसे किया

उन्होंने केवल अनुमान नहीं लगाया; उन्होंने एक वास्तविक दुनिया की सेमीकंडक्टर फैक्ट्री का डिजिटल ट्विन (एक अत्यंत सटीक वीडियो गेम सिमुलेशन) बनाया। उन्होंने अपने AI का दो तरीकों से परीक्षण किया:

  • ऑफलाइन लर्निंग: AI ने पिछले फैक्ट्री लॉग्स (जैसे इतिहास की किताब पढ़ने जैसा) का अध्ययन किया बिना वास्तविक मशीनों को छुए। यह सुरक्षित है क्योंकि AI सीखने के दौरान गलती से कुछ भी खराब नहीं कर सकता।
  • ऑनलाइन लर्निंग: इसके बाद AI ने सिमुलेशन में अभ्यास किया, वास्तविक समय में निर्णय लिए और परिणामों से सीखा, जो बिल्कुल वैसा ही है जैसे एक पायलट फ्लाइट सिम्युलेटर में प्रशिक्षण लेता है।

परिणाम: एक सुचारू रसोई

जब उन्होंने अपने AI की तुलना आज की फैक्ट्रियों में उपयोग किए जाने वाले मानक नियमों से की:

  • थ्रूपुट (कुकिंग स्पीड): AI ने रैंडम अप्रोच की तुलना में तैयार वेफर्स की संख्या में 39% तक की वृद्धि की और मानक नियमों को काफी पीछे छोड़ दिया।
  • यूटिलाइजेशन (शेफ की दक्षता): मशीनें बहुत अधिक समय तक व्यस्त और उत्पादक रहीं, जिससे खाली समय कम हुआ।
  • निरंतरता: AI ने 31 अलग-अलग फैक्ट्री परिदृश्यों में अच्छा प्रदर्शन किया, जिससे यह सिद्ध हुआ कि यह केवल एक विशेष स्थिति में भाग्यशाली नहीं था।

यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि यह बदलकर कि AI कैसे सीखता है (इवेंट्स के समूहों और विलंबित पुरस्कारों पर ध्यान केंद्रित करके), न कि केवल AI के मस्तिष्क को बदलकर, वे विशाल प्रणालियों में जटिल, दीर्घकालिक समस्याओं को हल कर सकते हैं।

संक्षेप में: उन्होंने एक AI को एक अराजक फैक्ट्री ऑर्केस्ट्रा के लिए मास्टर कंडक्टर बनने के लिए सिखाया। केवल एक नोट के बजाय पूरी सिम्फनी को सुनकर, AI ने संगीत को सुचारू रूप से चलाने के लिए सीखा, जिसके परिणामस्वरूप कम बर्बादी के साथ और अधिक तेजी से अधिक उत्पाद बनाए गए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →