← नवीनतम पेपर
🔬 physics

Heuristic Learning for Active Flow Control Using Coding Agents

यह शोधपत्र कोडिंग एजेंटों का उपयोग करके एक ह्यूरिस्टिक लर्निंग फ्रेमवर्क पेश करता है जो सक्रिय प्रवाह नियंत्रण (active flow control) के लिए प्रत्यक्ष, व्याख्यात्मक फीडबैक नियमों की खोज सीधे तौर पर करता है, और यह प्रदर्शित करता है कि यह दृष्टिकोण 13 बेंचमार्क में अत्याधुनिक डीप रिइन्फोर्समेंट लर्निंग के बराबर या उससे बेहतर प्रदर्शन करता है और साथ ही अधिक पारदर्शिता और भौतिक अंतर्दृष्टि प्रदान करता है।

मूल लेखक: Paul Garnier, Jonathan Viquerat, Elie Hachem

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Paul Garnier, Jonathan Viquerat, Elie Hachem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बहुत ही कठिन, अदृश्य नाव को एक तूफानी नदी में चलाने के लिए सिखाने की कोशिश कर रहे हैं। नदी छिपे हुए भंवरों और अचानक उठने वाली लहरों से भरी है, और आप अपने सामने पानी का केवल एक छोटा सा हिस्सा ही देख सकते हैं। आपका लक्ष्य नाव को बिना टकराए या ईंधन बर्बाद किए सुचारू रूप से चलाना है।

लंबे समय से, वैज्ञानिकों ने इसे हल करने के लिए डीप रिइन्फोर्समेंट लर्निंग (DRL) का उपयोग करने की कोशिश की है। DRL को एक सुपर-स्मार्ट लेकिन रहस्यमय प्रशिक्षु (apprentice) के रूप में समझें। आप इस प्रशिक्षु को कंप्यूटर सिमुलेशन में हजारों बार नाव को टकराने देते हैं, जिससे वह हर गलती से सीखता है। अंततः, वह प्रशिक्षु नाव चलाने में बहुत कुशल हो जाता है। लेकिन यहाँ एक पेंच है: उस प्रशिक्षु का मस्तिष्क संख्याओं का एक विशाल, उलझा हुआ जाल (न्यूरल नेटवर्क) है। यहाँ तक कि वैज्ञानिक भी इसके अंदर देखकर आसानी से यह नहीं कह सकते, "आह, मैं समझ गया! तुम पतवार को बाईं ओर इसलिए मोड़ते हो क्योंकि यहाँ पानी तेजी से चल रहा है।" यह एक "ब्लैक बॉक्स" है जो काम तो करता है, लेकिन कोई नहीं जानता कि यह वास्तव में कैसे सोचता है। साथ ही, इसे प्रशिक्षित करने के लिए भारी मात्रा में कंप्यूटर पावर और समय की आवश्यकता होती है।

इस शोध पत्र में, लेखक पॉल गार्नियर और उनकी टीम ने एक बिल्कुल अलग दृष्टिकोण अपनाया है। एक रहस्यमय प्रशिक्षु को प्रशिक्षित करने के बजाय, उन्होंने एक कोडिंग एजेंट (Coding Agent) को काम पर लगाया—इसे एक प्रतिभाशाली, अथक रोबोट प्रोग्रामर के रूप में समझें।

नई रणनीति: नियम लिखना, भावनाओं को सीखना नहीं
AI को लाखों अदृश्य नंबरों को बदलने देने के बजाय, शोधकर्ताओं ने कोडिंग एजेंट को वास्तविक, पठनीय कंप्यूटर कोड लिखने के लिए कहा जो स्टीयरिंग के नियम के रूप में कार्य करे। यह एक सरल रेसिपी (विधि) लिखने के समान है: "यदि पानी बाईं ओर लहरदार दिखता है, तो 11 सेकंड प्रतीक्षा करें, फिर पतवार को थोड़ा दाईं ओर धकेलें।"

एजेंट एक रेसिपी आज़माता है, यह देखने के लिए एक सिमुलेशन चलाता है कि क्या नाव टकराती है, और यदि ऐसा होता है, तो एजेंट रेसिपी को फिर से लिखता है। वह अपने "डायरी" के रिकॉर्ड को पढ़ता है कि क्या काम किया और क्या विफल रहा, जब तक कि उसे निर्देशों का एक ऐसा सेट न मिल जाए जो पूरी तरह से काम करे।

उन्होंने क्या पाया (अच्छी खबर)
टीम ने इस नए "रोबोट प्रोग्रामर" तरीके का परीक्षण 13 अलग-अलग फ्लूइड डायनेमिक्स चुनौतियों पर किया, जिसमें सरल 2D प्रवाह से लेकर जटिल 3D टर्बुलेंट चैनल तक शामिल थे। उन्होंने कोडिंग एजेंट को सबसे अच्छे DRL प्रशिक्षुओं के समान ही कंप्यूटर समय और समान नियम दिए।

परिणाम आश्चर्यजनक थे:

  • 13 में से 10 चुनौतियों में, रोबोट प्रोग्रामर ने एक ऐसा स्टीयरिंग नियम खोजा जो सबसे अच्छे DRL प्रशिक्षु के समान या उससे भी बेहतर था।
  • एक विशिष्ट 3D टर्बुलेंट चैनल परीक्षण में, इस नई विधि ने ड्रैग (हवा/पानी का प्रतिरोध) को लगभग 40% कम कर दिया, जो DRL पद्धति से बेहतर था जिसने केवल लगभग 30% की कमी दिखाई थी।
  • सबसे अच्छे रोबोट प्रोग्रामर (जिसे "कोडेक्स" कहा गया) ने ऐसे समाधान खोजे जो संक्षिप्त, पठनीय और मनुष्यों के समझने में आसान थे। आप वास्तव में कोड को देख सकते हैं और तर्क को समझ सकते हैं: "ओह, यह लहर के गुजरने का इंतजार करने के लिए एक देरी (delay) का उपयोग कर रहा है!"

उन्होंने क्या खारिज किया (क्या नहीं है)
यह शोध पत्र इस बात को लेकर बहुत सख्त है कि यह विधि क्या नहीं है।

  • यह कोई जादुई ट्रिक नहीं है जो सीमाओं के बिना काम करती है। शोधकर्ताओं ने स्पष्ट रूप से यह सुनिश्चित किया कि AI सिमुलेशन के "छिपे हुए" हिस्सों को देखकर या खेल के नियमों को बदलकर धोखाधड़ी न कर सके। रोबोट प्रोग्रामर को ठीक उन्हीं सख्त नियमों का पालन करना था जिनका पालन DRL प्रशिक्षु करता है।
  • यह हमेशा बेहतर नहीं है। 13 में से 3 मामलों में, रोबोट प्रोग्रामर DRL प्रशिक्षु से पीछे रह गया। शोध पत्र सुझाव देता है कि हालांकि यह नई विधि एक मजबूत प्रतिस्पर्धी है, लेकिन इसने अभी तक हर समस्या को पूरी तरह से हल नहीं किया है।
  • यह अधिक जानकारी होने के बारे में भी नहीं है। टीम ने रोबोट प्रोग्रामर को पूरी नदी का एक सुपर-पावरफुल दृश्य (फुल मेश फील्ड्स) देने की कोशिश की। आश्चर्यजनक रूप से, इससे कोई मदद नहीं मिली; वास्तव में, इसने खोज को और कठिन बना दिया। शोध पत्र सुझाव देता है कि बहुत अधिक डेटा होने से सरल, स्पष्ट नियम खोजने में भ्रम पैदा हो सकता है।

वे कितने आश्वस्त हैं?
लेखक अपने आंकड़ों को लेकर आश्वस्त हैं क्योंकि उन्होंने ये प्रयोग एक नियंत्रित, सिम्युलेटेड वातावरण में किए। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने मापन किया।

  • उन्होंने सिद्ध किया कि रोबोट प्रोग्रामर ऐसे नियम खोज सकता है जो अधिकांश मामलों में सर्वश्रेष्ठ DRL विधियों के समान या उनसे बेहतर प्रदर्शन करते हैं।
  • उन्होंने दिखाया कि ये नियम अच्छी तरह से स्थानांतरित (transfer) होते हैं। उदाहरण के लिए, एक नियम जो उन्होंने 5 "जेट्स" (एक्टुएटर्स) वाले नदी के लिए लिखा था, उसे थोड़ा बदलकर 10 जेट्स वाली नदी के लिए भी पूरी तरह से काम करने योग्य बनाया जा सकता था, बिना शून्य से शुरुआत किए।
  • उन्होंने पाया कि ये नियम मजबूत (robust) हैं। यहाँ तक कि जब उन्होंने सेंसरों की संख्या कम कर दी (दृश्य को बहुत धुंधला बना दिया), तब भी रोबोट प्रोग्रामर ने अच्छे समाधान खोज लिए, जबकि DRL प्रशिक्षु काफी संघर्ष करता दिखा।

बड़ी तस्वीर
यह शोध पत्र सुझाव देता है कि हमें तरल प्रवाह (fluid flows) को नियंत्रित करने के लिए केवल उन विशाल, रहस्यमय न्यूरल नेटवर्क पर निर्भर रहने की आवश्यकता नहीं है। आधुनिक कोडिंग एजेंटों का उपयोग करके सरल, मानव-पठनीय नियम खोजने से, हम वही (या बेहतर) प्रदर्शन प्राप्त कर सकते हैं और साथ ही अंततः यह समझ सकते हैं कि नियंत्रक अपने निर्णय क्यों ले रहा है। यह एक ऐसी जादुई छड़ी के बजाय एक स्पष्ट, चरण-दर-चरण निर्देश पुस्तिका का उपयोग करने जैसा है जिसे कोई भी पढ़ सकता है, बदल सकता है और भरोसा कर सकता है।

लेखक निष्कर्ष निकालते हैं कि यह "ह्यूरिस्टिक लर्निंग" पारंपरिक तरीकों का एक विश्वसनीय और रोमांचक विकल्प है, जो AI की शक्ति को मानवीय तर्क की स्पष्टता के साथ जोड़ता है। उन्होंने अपने कोड और प्रॉम्प्ट्स को दूसरों के परीक्षण के लिए उपलब्ध कराया है, जो यह साबित करता है कि यह केवल कोई गुप्त ट्रिक नहीं है, बल्कि प्रकृति की अदृश्य शक्तियों को नियंत्रित करने के बारे में सोचने का एक नया तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →