← नवीनतम पेपर
💻 computer science

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling

BayesFP एक एकीकृत, रिट्रेनिंग-मुक्त इन्फरेंस-टाइम फ्रेमवर्क प्रस्तुत करता है जो डिफ्यूजन और फ्लो-मैचिंग पॉलिसियों दोनों के लिए पोस्टीरियर सैंपलिंग को सक्षम करने हेतु फेनमैन-काक सुधारक (Feynman-Kac corrector) का लाभ उठाता है, जिससे रोबोट्स को सीखे गए विशेषज्ञ व्यवहार के प्रति वफादार रहते हुए सुरक्षा बाधाओं और कार्य उद्देश्यों को पूरा करने वाले प्रक्षेप पथ (trajectories) उत्पन्न करने की अनुमति मिलती है।

मूल लेखक: Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ BayesFP पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: वह रोबोट जो खतरे को देखकर "ना" नहीं कह सकता

कल्पना कीजिए कि आपने एक बहुत ही कुशल रोबोट शेफ (रसोइया) को काम पर रखा है। आपने उसे हफ्तों तक विशेषज्ञ शेफ के सब्ज़ियाँ काटने, पैनकेक पलटने और खाना सजाने के हज़ारों वीडियो दिखाकर प्रशिक्षित किया है। रोबोट ने इन गतिविधियों की नकल करना पूरी तरह से सीख लिया है। वह जानता है कि खाना कैसे बनाना है।

हालाँकि, एक पेच है: आप रोबोट को सुरक्षा के नियम उसी दिन बताते हैं जब आप वास्तव में उसका उपयोग कर रहे होते हैं।

  • परिदृश्य A: आप उसे कहते हैं, "स्टेक पकाओ, लेकिन चाकू को कांच की मेज से छूने मत देना।"
  • परिदृश्य B: आप उसे कहते हैं, "स्टेक पकाओ, लेकिन काउंटर पर एक बिल्ली चल रही है; उसे मत मारना।"

रोबोट के ट्रेनिंग डेटा में कभी कांच की मेज या बिल्ली नहीं देखी गई थी। यदि आप केवल रोबोट को "सुरक्षित रहने" के लिए कहते हैं, तो वह भ्रमित हो सकता है। वह चाकू को मेज के अंदर धकेलने की कोशिश कर सकता है (मेज तोड़ते हुए) या बिल्ली को अनदेखा कर सकता है क्योंकि उसके प्रशिक्षण में कहा गया था कि "तेज़ी से चलो।"

मौजूदा तरीके इसे ठीक करने की कोशिश करते हैं, या तो:

  1. पोस्ट-होक फ़िल्टरिंग (Post-hoc filtering): रोबोट को एक चाल चलने देते हैं, यह देखते हैं कि उसने मेज को टक्कर दी, और फिर जादुई रूप से हाथ को वापस "मोड़ने" की कोशिश करते हैं। यह अक्सर झटकेदार और अप्राकृतिक दिखता है।
  2. ह्यूरिस्टिक नजिंग (Heuristic nudging): रोबोट को कहना, "अरे, मेज से थोड़ा दूर हटो।" यह अस्पष्ट निर्देश देने जैसा है; इससे अक्सर रोबोट किसी कोने में फंस जाता है या ऐसे जाल में फंस जाता है जहाँ से निकलना मुश्किल होता है।

समाधान: BayesFP (एक "क्या होगा अगर" सिम्युलेटर)

लेखक BayesFP नामक एक नया तरीका प्रस्तावित करते हैं। रोबोट को बाद में अपनी राय बदलने के लिए मजबूर करने के बजाय, वे यह बदलते हैं कि रोबोट हिलने से पहले भविष्य के बारे में कैसे सोचता है।

वे रोबोट के निर्णय लेने की प्रक्रिया को "क्या होगा अगर?" (What If?) के खेल की तरह मानते हैं।

  1. द प्रायर (The Prior - विशेषज्ञ): रोबोट अपने मूल प्रशिक्षण के साथ शुरू करता है: "यहाँ एक विशेषज्ञ शेफ कैसे चलता है।" यह "प्रायर" है।
  2. द लाइकलीहुड (The Likelihood - लागत/दंड): वे एक नया नियम जोड़ते हैं: "लेकिन, यदि आप मेज या बिल्ली से टकराते हैं, तो यह एक बहुत बड़ा दंड है।" यह "लाइकलीहुड" है।
  3. द पोस्टीरियर (The Posterior - सबसे अच्छा अनुमान): रोबोट केवल एक रास्ता नहीं चुनता। वह पूछता है, "यदि मैं अपने विशेषज्ञ प्रशिक्षण को 'बिल्ली से न टकराने' के नियम के साथ मिला दूँ, तो सबसे अच्छा संभव रास्ता कैसा दिखेगा?"

परिणाम एक नया रास्ता है जो अभी भी एक विशेषज्ञ शेफ की तरह दिखता है (सुचारू, प्राकृतिक) लेकिन स्वाभाविक रूप से बिल्ली से बचता है।

असली सीक्रेट सॉस: फाइबोनैकी-काक सैंपलिंग (Feynman-Kac Sampling - "समानांतर ब्रह्मांड" वाली ट्रिक)

रोबोट हफ्तों तक री-ट्रेनिंग किए बिना इस "सबसे अच्छे संभावित पथ" की गणना कैसे करता है? पेपर एक गणितीय ट्रिक का उपयोग करता है जिसे Feynman-Kac sampling कहा जाता है।

कल्पना कीजिए कि आप एक भीड़भाड़ वाले शहर में सबसे अच्छा रास्ता खोजना चाहते हैं, लेकिन आपको अभी तक नहीं पता कि ट्रैफिक जाम कहाँ है।

  • पुराना तरीका: आप एक रास्ता चुनते हैं, चलते हैं, जाम में फंसते हैं, वापस मुड़ते हैं, और फिर से कोशिश करते हैं। (धीमा और झटकेदार)।
  • BayesFP तरीका: आप एक ही समय में अपने 32 समानांतर संस्करणों (particles) को बाहर भेजते हैं।
    • प्रत्येक संस्करण एक थोड़ा अलग रास्ता आज़माता है।
    • चलते समय, वे लगातार जाँच करते हैं: "क्या मैं लक्ष्य के करीब पहुँच रहा हूँ? क्या मैं किसी दीवार से टकरा रहा हूँ?"
    • यदि कोई संस्करण दीवार से टकरा जाता है, तो उसे एक "खराब स्कोर" मिलता है। यदि उसे एक सुचारू रास्ता मिलता है, तो उसे "अच्छा स्कोर" मिलता है।
    • सिस्टम फिर अच्छे संस्करणों की नकल (duplicate) करता है और बुरे संस्करणों को हटा देता है।
    • जब तक वे गंतव्य तक पहुँचते हैं, जीवित बचे हुए समूह ने स्वाभाविक रूप से पूर्ण, सुरक्षित मार्ग पर खुद को ढाल लिया होता है।

यह एक कंप्यूटर चिप पर एक सेकंड के अंश में होता है, जिससे रोबोट हज़ारों संभावनाओं का "सिमुलेशन" कर सकता है और विजेता को तुरंत चुन सकता है।

यह क्यों विशेष है

  1. यह "डिटरमिनिस्टिक" (Deterministic) रोबोट्स पर काम करता है: अधिकांश रोबोट जो "फ्लो मैचिंग" (एक प्रकार का AI जो सीधी, सुचारू रेखाओं में चलता है) का उपयोग करते हैं, उन्हें नियंत्रित करना कठिन होता है क्योंकि उनमें अंतर्निहित यादृच्छिकता (randomness) नहीं होती है। BayesFP एक चतुर तरीका बनाता है जिससे पर्याप्त "रैंडमनेस" जोड़ी जा सके ताकि रोबक विकल्पों को तलाश सके, और फिर अंत में इसे हटा दिया जाए ताकि अंतिम चाल सुचारू और सटीक हो।
  2. री-ट्रेनिंग की आवश्यकता नहीं: आपको रोबोट को नए कौशल सिखाने की ज़रूरत नहीं है। आप बस इसे एक नया "कॉस्ट फंक्शन" (किसी चीज़ से बचने का नियम) दे सकते हैं जब आप "स्टार्ट" दबाते हैं।
  3. यह अजीब आकृतियों को संभाल लेता है: चाहे बाधा एक साधारण वृत्त हो या एक जटिल, टेढ़ी-मेढ़ी "V" आकार की, रोबोट पेशेवर दिखते हुए भी उसके चारों ओर से निकलने का रास्ता खोज लेता है।

वास्तविक दुनिया के परिणाम

लेखकों ने वास्तविक रोबोट और सिमुलेशन पर इसका परीक्षण किया:

  • बाधाओं से बचना: उन्होंने रोबोट के रास्ते में एक सिलेंडर या "V" आकार की दीवार रखी जिसे उसने पहले कभी नहीं देखा था। रोबोट सफलतापूर्वक बिना टकराए उसके चारों ओर से निकल गया।
  • वास्तविक रोबट: उन्होंने एक असली रोबोट हाथ पर इसका परीक्षण किया जो मग पकड़े हुए था। जब उन्होंने उसके रास्ते में एक नई बाधा (एक कप) रखी, तो रोबोट ने उसके चारों ओर से सुचारू रूप से रास्ता बनाया।
  • बदलते लक्ष्य: उन्होंने इसका उपयोग रोबोट को यह बताने के लिए भी किया कि, "मग उठाओ, लेकिन केवल दाहिनी ओर वाला," जिससे रोबोट की बाईं ओर वाले को उठाने की स्वाभाविक प्रवृत्ति को दबाया जा सके।

निचोड़ (The Bottom Line)

BayesFP एक रोबोट को एक "सुपरपावर" देने जैसा है कि जब भी कोई नई बाधा आए, तो वह तुरंत अपने विशेषज्ञ प्रशिक्षण का पुनर्मूल्यांकन कर सके। टकराने और सुधार करने के बजाय, यह समानांतर में हजारों "क्या होगा अगर" परिदृश्यों का सिमुलेशन करता है, और तुरंत सबसे सुचारू, सुरक्षित पथ खोजता है जो उसके प्रशिक्षण और नए सुरक्षा नियमों दोनों का सम्मान करता है। यह एक कठोर, पूर्व-प्रोग्राम किए गए रोबोट को एक लचीले और प्रतिक्रियाशील रोबोट में बदल देता है जिसके लिए री-ट्रेनिंग की आवश्यकता नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →