← नवीनतम पेपर
💻 computer science

FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift

FlowMo-WM एक एंड-टू-एंड ट्रेन करने योग्य विजुअल वर्ल्ड मॉडल है जो इमेज-एक्शन इतिहास को शॉर्ट-टर्म मोशन स्टेट्स और लॉन्ग-टर्म कॉन्टेक्स्ट रिप्रेजेंटेशन्स में फैक्टराइज़ करके उन ऑब्जेक्ट्स के लिए लॉन्ग-होरिज़न प्रेडिक्शन सटीकता में सुधार करता है जो हिडन एम्बिएंट ड्रिफ्ट के अधीन होते हैं, जिसमें फ्लो फील्ड्स के प्रत्यक्ष पर्यवेक्षण की आवश्यकता नहीं होती है।

मूल लेखक: Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह अनुमान लगाने की कोशिश कर रहे हैं कि एक पत्ता नदी में बहते हुए एक मिनट में कहाँ होगा।

यदि आप केवल पत्ते को देखते हैं और उस दिशा को देखते हैं जिसमें आपने उसे धकेला था, तो आप गलत अनुमान लगा सकते हैं। ऐसा इसलिए क्योंकि पत्ते में मोमेंटम (संवेग) होता है (यह तब भी फिसलना जारी रखता है जब आप धक्का देना बंद कर देते हैं), और नदी की धारा (एक छिपा हुआ बल) इसे तिरछा ले जा रही है। यदि आप अदृश्य धारा का हिसाब नहीं रखते हैं, तो आपका अनुमान भटक जाएगा।

यही वह समस्या है जिसे FlowMo-WM नामक पेपर रोबोट्स के लिए हल करने की कोशिश करता है, विशेष रूप से पानी पर तैरती नावों के लिए।

समस्या: "अदृश्य हाथ"

अधिकांश रोबोट लर्निंग मॉडल उन ड्राइवरों की तरह होते हैं जो केवल स्टीयरिंग व्हील पर ध्यान देते हैं। वे सोचते हैं: "मैंने बाएँ मुड़ा, इसलिए कार बाईं ओर जाएगी।"

लेकिन वास्तविक दुनिया में (विशेष रूप से पानी पर), चीजें अधिक जटिल होती हैं। एक नाव अपनी गति के कारण आगे बढ़ती रह सकती है (मोमेंटम), भले ही इंजन बंद हो जाए। इससे भी बदतर, एक छिपी हुई नदी की धारा नाव को तिरछा धकेल सकती है। रोबोट नाव को देख सकता है, लेकिन वह पानी की धारा को नहीं देख सकता। उसे यह अनुमान लगाना होगा कि धारा कहाँ है, बस यह देखकर कि अतीत में नाव कैसे चली थी।

समाधान: एक दो-दिमाग वाला सिस्टम

लेखकों ने FlowMo-WM नामक एक नया AI मॉडल बनाया है। एक ही दिमाग के सब कुछ करने के बजाय, उन्होंने इसे दो विशिष्ट "टेम्पोरल ब्रान्चेस" (समय को देखने के दो तरीके) दिए:

  1. "शॉर्ट-टर्म" दिमाग (द स्प्रिंटर - धावक):

    • यह क्या करता है: यह वीडियो और क्रियाओं के पिछले कुछ सेकंडों को देखता है।
    • यह क्या सीखता है: यह नाव के तत्काल व्यवहार पर ध्यान केंद्रित करता है। क्या इसकी गति बढ़ रही है? क्या यह मुड़ रहा है? क्या इंजन में देरी हुई? यह मोमेंटम और रोबोट के नियंत्रण के प्रत्यक्ष परिणाम को ट्रैक करता है।
    • उपमा: यह एक धावक की तरह है जो अपने पैरों और अपने ठीक सामने के ट्रैक को देख रहा है।
  2. "लॉन्ग-टर्म" दिमाग (द डिटेक्टिव - जासूस):

    • यह क्या करता है: यह एक बहुत लंबे इतिहास (पिछले 30+ सेकंड) को देखता है।
    • यह क्या सीखता है: यह उन पैटर्न्स को ढूंढता है जो नियंत्रणों (controls) से मेल नहीं खाते। यदि नाव सीधे इंजन होने के बावजूद बाईं ओर बहती रही, तो यह दिमाग समझ जाता है, "आह, ज़ाहिर है कि हमें बाईं ओर धकेलने के लिए कोई धारा मौजूद है।" यह छिपे हुए बहाव (hidden drift) का एक नक्शा बनाता है।
    • उपमा: यह एक जासूस की तरह है जो हवा किस दिशा में चल रही है, यह जानने के लिए पदचिह्नों के निशान को देख रहा है, भले ही वह हवा को देख न सके।

जादू का तरीका: "ज़ीरो-कॉन्टेक्स्ट" स्विच

इन दोनों दिमागों को जोड़ने का तरीका उनके डिज़ाइन का सबसे चतुर हिस्सा है। वे "ज़ीरो-कॉन्टेक्स्ट रेसिड्यूल ट्रांजिशन" नामक एक गणितीय ट्रिक का उपयोग करते हैं।

इसे एक ऐसी कार के रूप में सोचें जिसमें एक मानक इंजन और एक "विंड-असिस्ट" (हवा की सहायता) बटन है।

  • मानक इंजन (शॉर्ट-टर्म दिमाग) भविष्यवाणी करता है कि कार गैस पेडल के आधार पर कहाँ जाती है।
  • विंड-असिस्ट (लॉन्ग-टर्म दिमाग) भविष्यवाणी करता है कि हवा उसे कितना धकेलेगी।
  • ट्रिक: मॉडल को इस तरह प्रशिक्षित किया गया है कि यदि आप "ज़ीरो बटन" दबाते हैं (विंड-असिस्ट को बंद करते हैं), तो भविष्यवाणी वापस केवल इंजन पर लौट आती है। यह शोधकर्ताओं को परीक्षण करने की अनुमति देता है: "क्या होगा यदि हम मान लें कि हवा का अस्तित्व ही नहीं है?"

जब उन्होंने इसका परीक्षण किया, तो उन्होंने पाया कि यदि उन्होंने "लॉन्ग-टर्म डिटेक्टिव" को बंद कर दिया, तो रोबोट के अनुमान गड़बड़ा गए। मॉडल ने साबित कर दिया कि अदृश्य धाराओं को संभालने के लिए "डिटेक्टिव" वास्तव में आवश्यक था।

परिणाम: बेहतर भविष्यवाणियाँ, बेहतर प्लानिंग

टीम ने कंप्यूटर सिमुलेशन में विभिन्न प्रकार की नावों और कठिन जलधाराओं (भंवर, सीधी धाराएं, अशांत पैच) के साथ इसका परीक्षण किया।

  • सटीकता: जब 60 स्टेप्स भविष्य में नाव कहाँ होगी, इसकी भविष्यवाणी करने के लिए कहा गया, तो FlowMo-WM अन्य मॉडलों की तुलना में बहुत अधिक सटीक था। इसने कम गलतियाँ कीं क्योंकि यह नाव की गति और छिपे हुए पानी के प्रवाह, दोनों को समझता था।
  • प्लानिंग (योजना): जब उन्होंने इस मॉडल का उपयोग नाव को रास्ता तय करने में मदद करने के लिए किया (जैसे किसी विशिष्ट डॉक तक पहुँचने की कोशिश करना), तो नाव बहुत अधिक सफल रही। वह धारा में खोई नहीं।
  • "शफल" टेस्ट: उन्होंने मॉडल को गलत इतिहास देने की कोशिश की (एक नाव की धारा को दूसरी नाव के साथ बदल दिया)। मॉडल विफल रहा, जिससे साबित हुआ कि वह केवल अनुमान नहीं लगा रहा था; वह वास्तव में वातावरण की विशिष्ट स्थितियों को सीख रहा था।

निष्कर्ष

यह पेपर दिखाता है कि रोबोट्स को अव्यवस्थित, वास्तविक दुनिया के वातावरण (जैसे समुद्र) में अच्छी तरह काम करने के लिए, वे केवल यह नहीं देख सकते कि वे अभी क्या कर रहे हैं। उन्हें यह समझने के लिए अतीत को याद रखने की आवश्यकता है कि कौन सी अदृश्य ताकतें (जैसे हवा या पानी) उन्हें धकेल रही हैं।

FlowMo-WM एक ऐसा टूल है जो रोबोट्स को अच्छे जासूस बनना सिखाता है, जो अपने स्वयं के कार्यों को प्रकृति के छिपे हुए बलों से अलग करके भविष्य की अधिक सटीक भविष्यवाणी कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →