← नवीनतम पेपर
🤖 AI

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

यह शोध पत्र R2\text{R}^2VLM का प्रस्ताव करता है, जो एक आवर्ती तर्क ढांचा (recurrent reasoning framework) है जो पूर्ण वीडियो प्रक्षेपवक्र (full video trajectories) को संसाधित करने की कम्प्यूटेशनल लागत के बिना, लंबी अवधि के एम्बॉडीड टास्क प्रोग्रेस (long-horizon embodied task progress) का कुशलतापूर्वक और सटीक रूप से अनुमान लगाने के लिए एक विकसित होता हुआ चेन ऑफ थॉट (Chain of Thought) बनाए रखते हुए स्थानीय वीडियो स्निपेट्स को पुनरावृत्ति से संसाधित करता है और अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

प्रकाशित 2026-03-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखा रहे हैं, जैसे कि "एक कप कॉफी बनाना।" रोबोट को केवल वीडियो देखने की ही नहीं जरूरत है; उसे यह भी समझने की जरूरत है कि वह प्रक्रिया में कहाँ है। क्या वह पूरा हो गया है? क्या वह आधा हुआ है? क्या वह दूध लेना भूल गया है?

यह पेपर एक नया AI सिस्टम पेश करता है जिसे R2VLM (Recurrent Reasoning Vision-Language Model) कहा जाता है, जो एक सुपर-स्मार्ट, धैर्यवान कुकिंग इंस्ट्रक्टर की तरह रोबोट के बगल में बैठा रहता है। इसका काम लगातार इस सवाल का जवाब देना है: "हमने वास्तव में कार्य का कितना हिस्सा पूरा कर लिया है?"

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "लंबी वीडियो" का दुःस्वप्न (The "Long Video" Nightmare)

कल्पना कीजिए कि आप यह समझने के लिए 2 घंटे की फिल्म देखने की कोशिश कर रहे हैं कि पहले 5 मिनट में क्या हुआ था। यदि आप हर बार एक नया दृश्य आने पर पूरी फिल्म को फिर से देखने की कोशिश करेंगे, तो आप थक जाएंगे, और आपका दिमाग भ्रमित हो जाएगा।

  • पुराने AI तरीके ठीक यही करने की कोशिश करते थे। वे प्रगति का अनुमान लगाने के लिए हर सेकंड पूरे वीडियो इतिहास को देखते थे। यह धीमा, महंगा है, और AI अक्सर "भ्रमित" (hallucinations) हो जाता है (पहले क्या हुआ था इसे लेकर उलझन में पड़ जाता है) क्योंकि वीडियो बहुत लंबा होता है।
  • चुनौती: वास्तविक दुनिया के कार्यों (जैसे घर की सफाई करना या खाना बनाना) में लंबा समय लगता है और उनके कई चरण होते हैं। यदि AI भूल जाता है कि उसने पहले कॉफी का मग उठा लिया था, तो वह उसे फिर से उठाने की कोशिश कर सकता है, या इससे भी बुरा, यह सोच सकता है कि काम पूरा हो गया है जबकि उसने अभी तक शुरुआत भी नहीं की है।

2. समाधान: "रनिंग नोटबुक" (The "Running Notebook" - Recurrent Reasoning)

पूरे वीडियो को फिर से देखने के बजाय, R2VLM एक चतुर ट्रिक का उपयोग करता है: रनिंग नोटबुक (चलती हुई डायरी)।

AI को एक जासूस के रूप में समझें जो एक रहस्य सुलझा रहा है।

  • पुराना तरीका: हर बार जब एक नया सुराग आता है, तो जासूस पेज 1 से 500 पन्नों की पूरी केस फाइल फिर से पढ़ता है।
  • R2VLM का तरीका: जासूस एक नोटबुक (जिसे "चेन ऑफ थॉट" या CoT कहा जाता है) रखता है।
    1. जासूस नवीनतम 2-सेकंड का वीडियो क्लिप (नवीनतम सुराग) देखता है।
    2. वे अपनी नोटबुक खोलते हैं, जिसमें पहले से लिखा है: "मुझे कॉफी बीन्स मिल गए हैं, लेकिन मैंने उन्हें अभी तक पीसा नहीं है।"
    3. वे नया क्लिप देखते हैं, देखते हैं कि रोबोट बीन्स पीस रहा है, और नोटबुक को अपडेट करते हैं: "ठीक है, बीन्स पिस गए हैं। अब मुझे पानी लेने की जरूरत है।"
    4. वे प्रगति का नया प्रतिशत लिखते हैं (जैसे, "40% पूरा हुआ")।

केवल नवीनतम क्लिप और नोटबुक को देखकर, AI तेज़ रहता है, भ्रमित नहीं होता, और बड़े चित्र (big picture) को पूरी तरह से याद रखता है।

3. प्रशिक्षण: "डिस्ट्रैक्टर गेम" (The "Distractor Game")

इस AI को स्मार्ट बनाने के लिए, शोधकर्ताओं ने इसे केवल लोगों को कार्य करते हुए वीडियो नहीं दिखाए। उन्होंने इसके साथ एक पेचीदा खेल खेला।

कल्पना कीजिए कि आप एक छात्र को "लाल कार" पहचानने के लिए सिखा रहे हैं। यदि आप उन्हें केवल लाल कारें ही दिखाएंगे, तो वे बिना देखे ही केवल "लाल" का अनुमान लगा सकते हैं।

  • ट्रिक: शोधकर्ताओं ने AI को किसी व्यक्ति द्वारा कॉफी बनाने का वीडियो दिखाया, लेकिन इसे बताया, "यह एक वीडियो है जिसमें कोई सैंडविच बना रहा है।"
  • परिणाम: AI को बारीकी से देखना पड़ा। उसे एहसास हुआ, "रुको, वे कॉफी डाल रहे हैं, ब्रेड पर चीज़ नहीं रख रहे हैं। कार्य का विवरण वीडियो से मेल नहीं खाता!"
  • इसने AI को शॉर्टकट के आधार पर अनुमान लगाने के बजाय वास्तव में चरणों के बारे में तर्क (reason) करने के लिए मजबूर किया, जिससे यह सुनिश्चित हुआ कि वह कार्य की संरचना को वास्तव में समझता है।

4. यह क्यों महत्वपूर्ण है: रोबोटों के लिए "कोच" (The "Coach" for Robots)

यह केवल नंबरों का अनुमान लगाने के बारे में नहीं है; यह रोबोटों को सीखने और हमारी मदद करने में मदद करने के बारे में है। पेपर में इस "कोच" के उपयोग के तीन शानदार तरीके दिखाए गए हैं:

  • पर्सनल ट्रेनर (पॉलिसी लर्निंग): यदि कोई रोबोट चलना या खाना बनाना सीख रहा है, तो कोच उसे बताता है, "आप बहुत अच्छा कर रहे हैं, आपने 5 में से 3 चरण पूरे कर लिए हैं!" यह रोबोट को अंत में केवल "हाँ/नहीं" मिलने की तुलना में तेज़ी से सीखने में मदद करता है।
  • रेफरी (रिवॉर्ड मॉडलिंग): वीडियो गेम में, आपको अच्छे मूव्स के लिए अंक मिलते हैं। वास्तविक दुनिया में, रोबोटों के पास अंक नहीं होते। R2VLM एक रेफरी के रूप में कार्य करता है, जो रोबोट को हर बार एक छोटा कदम पूरा करने पर एक "स्कोर" (रिवॉर्ड) देता है, जिससे उसे सही काम करने के लिए निर्देशित किया जाता है।
  • सहायक (प्रोएक्टिव हेल्प): कल्पना कीजिए कि आप फर्नीचर असेंबल करने की कोशिश कर रहे हैं एक बुजुर्ग व्यक्ति हैं। AI कैमरे के माध्यम से आपको देखता है। वह देखता है कि आप एक स्क्रू के साथ संघर्ष कर रहे हैं और कहता है, "आपने पैर (legs) तो जोड़ लिए हैं, लेकिन आपने ऊपर का हिस्सा अभी तक नहीं लगाया है। यहाँ अगला चरण है।" वह केवल देखता नहीं है; वह आपके काम के प्रवाह (flow) को समझता है।

सारांश

R2VLM एक स्मार्ट, चौकस सहायक की तरह है जो एक डायरी रखता है कि रोबोट क्या कर रहा है। लंबे वीडियो से अभिभूत होने के बजाय, यह चरण-दर-चरण अपनी डायरी को अपडेट करता है। यह इसे हमें सटीक रूप से यह बताने की अनुमति देता है कि कार्य का कितना हिस्सा पूरा हुआ है, जिससे रोबोटों को तेज़ी से सीखने, कम गलतियाँ करने और हमारे दैनिक जीवन में मनुष्यों की अधिक प्रभावी ढंग से सहायता करने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →