← नवीनतम पेपर
🤖 machine learning

STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation

STITCH-OPE एक मॉडल-आधारित जनरेटिव फ्रेमवर्क है जो गाइडेड डिफ्यूजन और ट्रजेक्टरी स्टिचिंग का लाभ उठाता है ताकि उच्च-आयामी, लंबे-क्षितिज वाले परिवेश में मौजूदा ऑफ-पॉलिसी इवैल्यूएशन विधियों की सीमाओं को दूर किया जा सके, जिससे महत्वपूर्ण रूप से कम वेरिएंस और बेहतर सटीकता प्राप्त होती है।

मूल लेखक: Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

प्रकाशित 2026-07-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं, लेकिन आप रोबोट को वास्तव में वास्तविक दुनिया में गेम खेलने नहीं दे सकते। शायद वह रोबोट बहुत महंगा है, या गेम बहुत खतरनाक है। इसके बजाय, आपके पास एक पुराने वीडियो रिकॉर्डिंग का विशाल पुस्तकालय है जो एक अलग रोबोट (मान लीजिए "Old Bot") को गेम खेलते हुए दिखाता है। आपका लक्ष्य यह पता लगाना है कि एक नया रोबोट ("New Bot") कैसा प्रदर्शन करेगा, केवल उन पुराने रिकॉर्डिंग को देखकर। इसे ऑफ-पॉलिसी इवैल्यूएशन (Off-Policy Evaluation - OPE) कहा जाता है।

समस्या यह है कि Old Bot और New Bot खेलने के तरीके में बहुत अलग हो सकते हैं। यदि New Bot कुछ ऐसा करने की कोशिश करता है जो Old Bot ने कभी नहीं किया, तो पुरानी रिकॉर्डिंग बेकार हो जाएगी। यदि आप पुरानी डेटा को खींचकर (stretch करके) New Bot के स्कोर का अनुमान लगाने की कोशिश करते हैं, तो गणित उलझ जाएगा और अराजकता में बदल जाएगा, खासकर लंबे, जटिल खेलों के लिए।

यहाँ STITCH-OPE आता है, जो एक चतुर वीडियो एडिटर और एक रचनात्मक निर्देशक (creative director) दोनों की तरह काम करता है।

पुराने तरीकों के साथ समस्या

इस समस्या को हल करने के पिछले प्रयास एक पूरी फिल्म का अनुमान लगाने की कोशिश करने जैसे थे, जहाँ हर एक फ्रेम का अनुमान एक ही बार में लगाने की कोशिश की जाती है।

  • "इम्पॉर्टेंस सैंपलिंग" (Importance Sampling) दृष्टिकोण: यह एक टूटी हुई फिल्म को ठीक करने की कोशिश करने जैसा था जहाँ हर फ्रेम के वॉल्यूम को एक बहुत बड़ी संख्या से गुणा किया जाता है। यदि फिल्म लंबी है, तो वॉल्यूम इतना तेज़ हो जाता है कि स्पीकर टूट जाते हैं (वेरिएंस विस्फोट/variance explodes)।
  • "मॉडल-बेस्ड" (Model-Based) दृष्टिकोण: यह दुनिया का एक आदर्श सिम्युलेटर बनाने की कोशिश करने जैसा था। लेकिन यदि आप पहले सेकंड में एक छोटी सी गलती करते हैं, तो वह गलती हर सेकंड के बाद बड़ी होती जाती है, जब तक कि अंत तक सिमुलेशन पूरी तरह से गलत न हो जाए।

STITCH-OPE समाधान: "लेगो" (Lego) रणनीति

STITCH-OPE खेल को बदल देता है और लंबी फिल्म को छोटे, प्रबंधनीय टुकड़ों में तोड़ देता है। इसे एक लंबा लेगो ब्रिज बनाने की तरह समझें। एक बार में पूरा पुल जोड़ने के बजाय (जो कठिन है और टूटने की संभावना रहती है), आप इसे एक-एक टुकड़े करके बनाते हैं, एक छोटे हिस्से के अंत को अगले हिस्से की शुरुआत से जोड़ते हुए।

यह कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

  1. "शॉर्ट-क्लिप" एडिटर:
    पूरी 10 मिनट की वीडियो एक साथ जेनरेट करने के लिए मॉडल को प्रशिक्षित करने के बजाय, STITCH-OPE गेम के केवल छोटे क्लिप्स जेनरेट करने के लिए एक "डिफ्यूजन मॉडल" (एक फैंसी AI जो रैंडम स्टैटिक नॉइज़ को स्पष्ट चित्रों में बदलना सीखता है) को प्रशिक्षित करता है। मान लीजिए कि यह 8-सेकंड के क्लिप जेनरेट करना सीखता है। यह एक क्लिप के अस्त-व्यस्त, शोर वाले संस्करण को साफ करने के लिए सीखता है जब तक कि वह एक वास्तविक चाल की तरह न दिखने लगे जो Old Bot करता।

  2. "स्टिचिंग" (Stitching) ट्रिक:
    एक लंबी वीडियो बनाने के लिए, STITCH-OPE इसे एक साथ जेनरेट नहीं करता है। यह एक 8-सेकंड का क्लिप जेनरेट करता है, रुकता है, और फिर AI से पूछता है: "ठीक है, तुम इस विशिष्ट स्थान पर समाप्त हुए। अब, अगला 8-सेकंड का क्लिप ठीक वहीं से शुरू करो जहाँ तुमने छोड़ा था।" यह छोटे क्लिप्स को एक के बाद एक जोड़ता जाता है।

  • यह क्यों शानदार है: यदि AI पहले क्लिप में एक छोटी सी गलती करता है, तो यह पूरे मूवी को खराब नहीं करता। यह बस पिछले क्लिप के वास्तविक अंत के आधार पर अगला क्लिप बनाता है। यह उस "एरर एक्सप्लोजन" (error explosion) को रोकता है जो अन्य तरीकों को परेशान करता है।
  1. "डायरेक्टर गाइडेंस" (Director's Guidance - निर्देशक का मार्गदर्शन) (गुप्त सूत्र):
    अब, हमें यह सुनिश्चित करने की आवश्यकता है कि ये क्लिप केवल Old Bot की तरह नहीं, बल्कि New Bot की तरह दिखें। AI के पास एक "स्कोर फंक्शन" होता है (यह जानने का तरीका कि New Bot क्या पसंद करता है)।
  • जाल (The Trap): यदि आप केवल AI को कहते हैं "वही करो जो New Bot पसंद करता है," तो यह भ्रमित हो सकता है और असंभव चालें बना सकता है क्योंकि New Bot की शैली Old Bot से बिल्कुल अलग है।
  • समाधान (The Fix): STITCH-OPE एक "नेगेटिव गाइडेंस" (negative guidance) ट्रिक का उपयोग करता है। यह AI को बताता है: "वही करो जो New Bot पसंद करता है, लेकिन उन चीजों को घटा दो जिन्हें Old Bot बहुत पसंद करता था।"
  • उपमा (The Analogy): कल्पना कीजिए कि आप एक दृश्य निर्देशित कर रहे हैं। Old Bot को घेरे में नाचने का शौक है। New Bot एक सीधी रेखा में दौड़ना चाहता है। यदि आप केवल कहते हैं "सीधी रेखा में दौड़ो," तो अभिनेता फंस सकता है। लेकिन यदि आप कहते हैं "घेरे में मत नाचो, और फिर दौड़ो," तो अभिनेता को पता चल जाता है कि उसे क्या टालना है। यह AI को Old Bot की चालों के "कंफर्ट ज़ोन" में फंसने से रोकता है और उसे New Bot की शैली को खोजने के लिए मजबूर करता है।

आंकड़े क्या कहते हैं

लेखकों ने रोबोट नियंत्रण के कुछ प्रसिद्ध कार्यों (जैसे रोबोट को कूदना, चलना या दौड़ना सिखाना) पर D4RL और OpenAI Gym जैसे डेटासेट का उपयोग करके इसका परीक्षण किया। उन्होंने बड़े रोबोटों के लिए गेम की लंबाई 768 स्टेप्स और छोटे रोबोटों के लिए 256 या 196 स्टेप्स रखी।

परिणाम उत्साहजनक थे:

  • सटीकता (Accuracy): STITCH-OPE ने 11 में से 15 विशिष्ट परीक्षण मामलों में लगभग हर अन्य विधि को पछाड़ दिया।
  • रैंकिंग (Ranking): यह यह पता लगाने में बहुत अच्छा था कि कौन सा रोबोट "सबसे अच्छा" है, भले ही रोबोट रिकॉर्डिंग वाले रोबोट से बहुत अलग क्यों न हो।
  • "विंडो" (Window) का आकार: उन्होंने पाया कि लंबाई 8 (विंडो साइज ww) के क्लिप जेनरेट करना सबसे सटीक रहा। इसने गलतियों को कम किए बिना चीजों को जोड़ने के बीच एक संतुलन बनाया।

वे अभी क्या नहीं जानते (अभी तक)

पेपर सावधानी से कहता है कि यह हर चीज़ के लिए जादू की छड़ी नहीं है।

  • "असंभव" चालें: यदि New Bot कुछ ऐसा करने की कोशिश करता है जो Old Bot ने कभी नहीं किया (जैसे चट्टान से कूदना जबकि Old Bot केवल जमीन पर चला था), तो AI भ्रमित हो सकता है और एक नकली, असंभव चाल बना सकता है। गणित यह मानता है कि Old Bot ने कम से कम वह सब देखा है जो New Bot करता है।
  • वास्तविक दुनिया की जटिलता: हालांकि यह इन कंप्यूटर सिमुलेशन पर बहुत अच्छा काम करता है, लेखक स्वीकार करते हैं कि वे अभी निश्चित नहीं हैं कि क्या यह वास्तविक दुनिया की जटिल समस्याओं पर भी पूरी तरह से काम करेगा जहाँ डेटा अधूरा हो सकता है या रोबोट सब कुछ स्पष्ट रूप से नहीं देख पाता है।

निष्कर्ष (The Bottom Line)

STITCH-OPE सुझाव देता है कि लंबी, डरावनी समस्याओं को छोटे, जोड़ने योग्य टुकड़ों में तोड़कर और AI को निर्देशित करने के लिए एक चतुर "ऐसा मत करो" नियम का उपयोग करके, हम वास्तविक दुनिया को छुए बिना एक नए रोबोट के प्रदर्शन का बेहतर अनुमान लगा सकते हैं। यह उच्च-जोखिम वाली स्थितियों में रोबोटों को सुरक्षित रूप से टेस्ट करने की दिशा में एक बड़ा कदम है, लेकिन लेखक हमें याद दिलाते हैं कि यह अभी भी एक सिमुलेशन-आधारित सफलता है, और वास्तविक दुनिया का परीक्षण अगला पड़ाव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →