← नवीनतम पेपर
🤖 machine learning

Counterfactual Transport Flows for Offline Conservative Trajectory Refinement

यह शोध पत्र काउंटरफैक्चुअल ट्रांसपोर्ट फ्लोज़ (Counterfactual Transport Flows) प्रस्तुत करता है, जो ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक ढांचा है जो लेटेंट स्पेस में उच्च प्रदर्शन करने वाले निकटवर्ती प्रक्षेप पथों (trajectories) को पुनः प्राप्त करके और उनसे सीखकर उम्मीदवार प्रक्षेप पथों को परिष्कृत करता है, जिससे लॉग किए गए डेटा के सपोर्ट से बाहर एक्सट्रपलेशन किए बिना, वर्ल्ड फीडबैक द्वारा निर्देशित रूढ़िवादी और व्याख्या योग्य नीति सुधार सक्षम होता है।

मूल लेखक: Lena Krieger, Xuan Zhao, Zhuo Cao, Qin Wang, Hanno Scharr, Ira Assent

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lena Krieger, Xuan Zhao, Zhuo Cao, Qin Wang, Hanno Scharr, Ira Assent

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जिसने अभी-अभी एक भोजन बनाया है। यह खाने योग्य है, लेकिन शायद थोड़ा फीका है। आप पूरे बर्तन को फेंककर शून्य से शुरुआत नहीं करना चाहते; आप बस उस रेसिपी में थोड़ा सुधार करना चाहते हैं ताकि वह बेहतर स्वाद दे सके।

यह शोध पत्र कंप्यूटरों (विशेष रूप से AI एजेंटों) के लिए ठीक यही करने का एक नया तरीका पेश करता है: एक मौजूदा योजना या "ट्रैजेक्टरी" (trajectory) को लेना और उसमें छोटे, स्मार्ट सुधार करना, बिना उस मूल योजना के गुणों को खोए जिसने उसे काम करने लायक बनाया था।

यहाँ उनके विचार, "काउंटरफैक्चुअल ट्रांसपोर्ट फ्लो" (Counterfactual Transport Flows), का विवरण सरल उपमाओं का उपयोग करके दिया गया है:

1. समस्या: पहिए का पुनरुvention न करें (Don't Reinvent the Wheel)

AI की दुनिया में, सीखने के दो मुख्य तरीके हैं:

  • ऑनलाइन लर्निंग (Online Learning): AI चीज़ें आज़माता है, असफल होता है, सीखता है, और फिर से कोशिश करता है। (जैसे एक शेफ खाना बनाते समय चखता है और बदलाव करता है)।
  • ऑफलाइन लर्निंग (Offline Learning): AI केवल पिछले प्रयासों (लॉग्स) की एक विशाल नोटबुक को देखता है। वह अब वास्तविक दुनिया को छू नहीं सकता।

ऑफलाइन लर्निंग के साथ समस्या यह है कि यदि AI एक ऐसा "परफेक्ट" नया प्लान बनाने की कोशिश करता है जो उसने पहले कभी नहीं देखा है, तो वह अक्सर भ्रमित (hallucinate) हो जाता है या खतरनाक गलतियाँ कर देता है। यह एक ऐसे शेफ की तरह है जो केवल उन सामग्रियों की सूची के आधार पर एक पूरी तरह से नया व्यंजन आविष्कार करने की कोशिश कर रहा है जिन्हें उसने अतीत में देखा है, बिना वास्तव में उसे पकाए। वे अंततः कुछ ऐसा बना सकते हैं जो खाने योग्य न हो।

2. समाधान: "क्या होगा अगर" का मानचित्र (The "What If" Map)

लेखक एक विधि प्रस्तावित करते हैं जिसे काउंटरफैक्चुअल ट्रांसपोर्ट फ्लो कहा जाता है। इसे एक निर्णयों के लिए "क्या होगा अगर?" (What If?) मानचित्र के रूप में समझें।

एक बिल्कुल नया परफेक्ट प्लान बनाने के बजाय, AI एक विशिष्ट, थोड़ी त्रुटिपूर्ण योजना (जिसे "सोर्स" या स्रोत कहा जाता है) को देखता है और पूछता है: "यदि मैंने यहाँ थोड़े अलग चुनाव किए होते, तो क्या मैं एक बेहतर परिणाम प्राप्त कर पाता?"

इसका उत्तर देने के लिए, AI एक लेटेंट स्पेस (Latent Space) का उपयोग करता है। कल्पना कीजिए कि एक विशाल, अदृश्य 3D मानचित्र है जहाँ एक रोबोट या एजेंट द्वारा लिए जा सकने वाले हर संभावित पथ का एक बिंदु (dot) है।

  • द सोर्स (The Source): एक बिंदु जो एक ऐसे पथ को दर्शाता है जो बहुत अच्छा नहीं रहा (कम फीडबैक)।
  • द टार्गेट (The Target): AI उस बिंदु के आसपास देखता है और एक निकटवर्ती बिंदु खोजता है जो एक ऐसे पथ का प्रतिनिधित्व करता है जिसने बहुत बेहतर प्रदर्शन किया (उच्च फीडबैक)।

3. जादू: "ट्रांसपोर्ट फ्लो" (The "Transport Flow")

एक बार जब AI एक पास का "बेहतर" पथ खोज लेता है, तो वह सीधे वहां नहीं कूदता। वह ऐसा करना एक अलग शहर में टेलीपोर्ट होने जैसा होगा; आप अपना मूल संदर्भ खो देंगे।

इसके बजाय, AI एक फ्लो (Flow) सीखता है। एक बहती हुई नदी की धारा की कल्पना करें।

  • AI उस धारा की दिशा सीखता है जो "बुरे" पथ से "अच्छे" पथ की ओर बहती है।
  • यह उस विशिष्ट शुरुआती बिंदु के लिए विशेष रूप से उस धारा को सीखता है। यह सभी के लिए एक सामान्य नदी नहीं है; यह आपकी विशिष्ट स्थिति के लिए एक कस्टम धारा है।

यही "ट्रांसपोर्ट फ्लो" है। यह मूल योजना को एक सुचारू पथ पर बेहतर परिणाम की ओर धीरे से धकेलता है।

4. कंट्रोल नॉब: कितना बदलाव करें? (The Control Knob)

इस प्रणाली का सबसे शानदार हिस्सा एक "डायल" या नॉब है जिसे रिफाइनमेंट स्ट्रेंथ (α\alpha) कहा जाता है।

  • इसे 0 पर घुमाने पर: आप बिल्कुल वहीं रहते हैं जहाँ से आपने शुरू किया था (मूल योजना)।
  • इसे 1 पर घुमाने पर: आप डेटा में मिले "बेहतर" पथ तक पूरी तरह से चलते हैं।
  • इसे 0.5 पर घुमाने पर: आप आधा रास्ता तय करते हैं।

यह उपयोगकर्ता को निर्णय लेने की अनुमति देता है: "मैं परिणाम में सुधार चाहता हूँ, लेकिन मैं योजना को बहुत अधिक नहीं बदलना चाहता क्योंकि मुझे सुरक्षा की चिंता है।" यह रूढ़िवादिता (सुरक्षित रहना) और सुधार (बेहतर परिणाम प्राप्त करना) के बीच एक आदर्श संतुलन प्रदान करता है।

5. उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने मानक रोबोट सिमुलेशन गेम्स (जैसे एक भूलभुलैया में नेविगेट करने वाला रोबोट चींटी या दौड़ता हुआ चीता) पर इसका परीक्षण किया।

  • उन्होंने उन रास्तों को लिया जो रोबots ने अतीत में लिए थे जो ठीक थे, लेकिन बहुत अच्छे नहीं थे।
  • उन्होंने इन रास्तों को डेटा में मौजूद बेहतर परिणामों की ओर "धकेलने" (nudge) के लिए अपनी विधि का उपयोग किया।
  • परिणाम: रोबोटों ने अजीब या असंभव गतिविधियों में भटके बिना बेहतर स्कोर (अधिक "फीडबैक") प्राप्त किया। वे मूल व्यवहार के करीब रहे लेकिन थोड़े अधिक स्मार्ट बन गए।

सारांश

संक्षेप में, यह शोध पत्र कहता है: "शून्य से एक आदर्श भविष्य का आविष्कार करने की कोशिश न करें। इसके बजाय, जो आपने पहले ही कर लिया है उसे देखें, उसी चीज़ का एक थोड़ा बेहतर संस्करण खोजें जो आपके इतिहास में मौजूद है, और अपनी वर्तमान योजना को उसकी ओर धीरे से मोड़ दें।"

यह एक GPS की तरह है जो आपको दूसरे शहर जाने के लिए नहीं कहता, बल्कि कहता है, "आप सही सड़क पर हैं, लेकिन यदि आप इस विशिष्ट निकास (exit) से मुड़ते हैं और यहाँ बाईं ओर मुड़ते हैं, तो आप 5 मिनट बचा लेंगे और उस गड्ढे से बच जाएंगे।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →