← नवीनतम पेपर
💻 computer science

M3^3P-R1: Reinforcement Learning for Large Language Model Guided Multi-Modal Motion Planning via MIP Code Generation

यह शोध पत्र M3^3P-R1 का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो बड़े भाषा मॉडलों को जटिल बहु-मोडल मोशन प्लानिंग कार्यों को हल करने योग्य चरों, बाधाओं और उद्देश्यों में विघटित करके, उन्हें मजबूती से हल करने के लिए निष्पादन योग्य मिक्स्ड-इंटिजर प्रोग्रामिंग (MIP) कोड उत्पन्न करने के लिए फाइन-ट्यून करता है।

मूल लेखक: Xingpeng Sun, Zherong Pan, Kai Cheng, Xindi Tang, Syed Talha Bukhari, Aniket Bera

प्रकाशित 2026-09-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingpeng Sun, Zherong Pan, Kai Cheng, Xindi Tang, Syed Talha Bukhari, Aniket Bera

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से एक सरल निर्देश और दुनिया में चलने की जटिल वास्तविकता के बीच के अंतर से जूझते रहे हैं। जब कोई इंसान किसी मशीन से कहता है कि "उस कप को उठाओ," तो यह अनुरोध सीधा लगता है, लेकिन एक रोबोट के लिए, यह अनंत चरों (variables) की एक पहेली है। मशीन को यह तय करना होता है कि पास पहुँचने के लिए अपने पैरों को कैसे हिलाना है, मेज से टकराए बिना अपने हाथ को कैसे मोड़ना है, और वस्तु को पकड़ने के लिए अपनी उंगलियों को ठीक कहाँ रखना है ताकि वह गिर न जाए। ये निर्णय दो अलग-अलग भाषाओं में होते हैं: "यहाँ जाओ, फिर यह करो" की विविक्त (discrete), चरण-दर-चरण तर्क, और "स्थान में सुचारू रूप से आगे बढ़ो" की निरंतर (continuous), तरल भौतिकी। दशकों से, इंजीनियर ऐसे सिस्टम बनाने की कोशिश कर रहे हैं जो इन दोनों भाषाओं को एक साथ बोल सकें, लेकिन इन समस्याओं को एक साथ हल करने के लिए आवश्यक गणित अक्सर कंप्यूटर के लिए वास्तविक समय (real time) में बहुत भारी होता है, या नई स्थितियों के अनुकूल होने के लिए बहुत कठोर होता है।

पर्ड्यू यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने एक अलग दृष्टिकोण अपनाया है, जिसमें इंसानों द्वारा हर संभावित परिदृश्य के लिए जटिल गणितीय नियम लिखने की आवश्यकता को दरकिनार कर दिया गया है। इसके बजाय, उन्होंने एक लार्ज लैंग्वेज मॉडल को—जो मानव बातचीत को समझने के लिए जाना जाने वाला एक प्रकार का आर्टिफिशियल इंटेलिजेंस है—एक अनुवादक के रूप में काम करने के लिए प्रशिक्षित किया जो प्राकृतिक भाषा के निर्देशों को सीधे एक कठोर गणितीय योजना में परिवर्तित कर सके। वे अपने सिस्टम को M3P-R1 कहते हैं। AI को उत्तर का अनुमान लगाने या केवल एक पथ का वर्णन करने देने के बजाय, यह सिस्टम AI को निष्पादन योग्य (executable) कंप्यूटर कोड लिखने के लिए मजबूर करता है जो एक विशेष गणितीय सॉल्वर के लिए निर्देशों का एक सेट के रूप में कार्य करता है। यह सॉल्वर फिर इस बात की जांच करने के लिए योजना को भौतिकी और ज्यामिति के नियमों के विरुद्ध परखता है कि क्या वह वास्तव में संभव है, इससे पहले कि रोबोट अपनी एक भी मांसपेशी हिलाए।

शोधकर्ताओं ने शुरुआत एक विशाल अभ्यास समस्याओं की लाइब्रेरी बनाकर की, जिसमें एक एकल रोबोटिक हाथ से किसी वस्तु तक पहुँचने से लेकर बाधाओं से बचते हुए फॉर्मेशन में उड़ने वाले कई ड्रोन तक सब कुछ शामिल था। उन्होंने AI को इन जटिल कार्यों को छोटे, प्रबंधनीय टुकड़ों में तोड़ने के लिए प्रशिक्षित किया, बिल्कुल वैसे ही जैसे एक मानव इंजीनियर करेगा, लेकिन एक महत्वपूर्ण अंतर के साथ: AI को वह कोड लिखना था जो खेल के नियमों को परिभाषित करता है। यदि कार्य किसी इमारत के चारों ओर ड्रोन उड़ाना और फिर एक चलते हुए प्लेटफॉर्म पर उतरना था, तो AI को उन विशिष्ट गणितीय बाधाओं (constraints) को उत्पन्न करना था जो यह सुनिश्चित करती थीं कि ड्रोन सुरक्षित क्षेत्रों के भीतर रहे और सही समय पर प्लेटफॉर्म से मिल सके। सिस्टम को एक ऐसी विधि का उपयोग करके प्रशिक्षित किया गया था जहाँ कंप्यूटर स्वयं शिक्षक के रूप में कार्य करता था। हर बार जब AI कोड का एक हिस्सा लिखता था, तो गणितीय सॉल्वर उसे चलाने का प्रयास करता था। यदि कोड टूटा हुआ था या योजना असंभव थी, तो सिस्टम को फिर से प्रयास करने के लिए एक स्पष्ट संकेत मिलता था। हजारों प्रयासों के बाद, AI ने न केवल रोबोटिक्स की भाषा बोलना सीखा, बल्कि उन सटीक गणितीय संरचनाओं का निर्माण करना भी सीखा जो रोबोटों को चलाने के लिए आवश्यक हैं।

इस प्रशिक्षण के परिणाम आश्चर्यजनक थे। विभिन्न प्रकार के कार्यों पर परीक्षण किए जाने पर, सिस्टम ने सिंगल-मोड समस्याओं, जैसे कि एक रोबोट का चलना या एक ड्रोन का उड़ना, को लगभग 92 प्रतिशत बार सफलतापूर्वक हल किया। जब कार्य अधिक जटिल हो गए, जिनमें रोबोट को चलना और फिर किसी वस्तु को पकड़ना, या दो ड्रोनों को अपने पथों में समन्वय स्थापित करना आवश्यक था, तो सफलता दर लगभग 81 प्रतिशत पर उच्च बनी रही। यह पिछले तरीकों की तुलना में एक महत्वपूर्ण सुधार था जो केवल अपने प्रशिक्षण डेटा के आधार पर सबसे अच्छे पथ का अनुमान लगाने वाले AI पर निर्भर थे, जो जटिल कार्यों पर आधे से भी कम समय सफल होते थे। शोधकर्ताओं ने इन निष्कर्षों को न केवल कंप्यूटर सिमुलेशन में सत्यापित किया, बल्कि योजनाओं को वास्तविक हार्डवेयर पर भेजा। उन्होंने एक भौतिक रोबोटिक हाथ और वास्तविक ड्रोनों पर इस सिस्टम का परीक्षण किया, जहाँ इसने 87.5 प्रतिशत की सफलता दर हासिल की। जो कुछ विफलताएं हुईं, वे मुख्य रूप से सिमुलेशन की स्वच्छ डिजिटल दुनिया और भौतिक दुनिया की अव्यवस्था के बीच के अंतर के कारण थीं, जैसे कि रोबोट के सेंसर द्वारा किसी वस्तु के आकार को पहचानने में मामूली अशुद्धियाँ।

जो काम इस कार्य को विशिष्ट बनाता है, वह है इसका वास्तविक दुनिया की अनिश्चितता को संभालना। पुराने सिस्टम अक्सर हर विशिष्ट स्थिति के लिए नियमों को पूर्व-प्रोग्राम करने के लिए मनुष्यों पर निर्भर थे, या वे "कोशिश करो और देखो" वाले दृष्टिकोण का उपयोग करते थे जो टक्कर या डेड एंड (dead end) का कारण बन सकता था। यह नई विधि AI को कार्य करने से पहले पूरी समस्या पर गणितीय रूप से विचार करने के लिए मजबूर करती है, जिससे यह सुनिश्चित होता है कि योजना शुरू से अंत तक वैध है। शोधकर्ताओं ने पाया कि AI ने इन योजनाओं को उन सरल बिल्डिंग ब्लॉक्स को जोड़कर बनाया जो उसने प्रशिक्षण के दौरान देखे थे, न कि केवल विशिष्ट उत्तरों को याद करके। इसने इसे उन नए कार्यों के संयोजन को संभालने की अनुमति दी जो उसने पहले कभी नहीं देखे थे, जैसे कि एक ड्रोन से जुड़ा रोबोटिक हाथ, उच्च विश्वसनीयता के साथ। अध्ययन यह सुझाव देता है कि आर्टिफिशियल इंटेलिजेंस को सत्यापन योग्य गणितीय उपकरणों में स्थापित करके, हम सरल कमांड-एंड-रिस्पॉन्स इंटरैक्शन से आगे बढ़कर एक ऐसे भविष्य की ओर बढ़ सकते हैं जहाँ रोबोट जटिल, बहु-चरणीय निर्देशों को समझ सकते हैं और उन्हें एक मानव विशेषज्ञ की सटीकता के साथ निष्पादित कर सकते हैं, जबकि वे भौतिक दुनिया की अप्रत्याशित चुनौतियों का सामना करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →