← नवीनतम पेपर
🤖 AI

Are Video Reasoning Models Ready to Go Outside?

यह शोध पत्र ROVA को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो कठिनाई-जागरूक अनुकूलन प्रशिक्षण (difficulty-aware adaptive training) और एक सुदृढ़ता-जागरूक निरंतरता पुरस्कार (robustness-aware consistency reward) के माध्यम से मौसम और अवरोध जैसे वास्तविक दुनिया के व्यवधानों के विरुद्ध वीडियो रीजनिंग मॉडलों की सुदृढ़ता को बढ़ाता है, जिसे नए PVRBench बेंचमार्क द्वारा प्रमाणित किया गया है जो मौजूदा मॉडलों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

मूल लेखक: Yangfan He, Changgyu Boo, Jaehong Yoon

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yangfan He, Changgyu Boo, Jaehong Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आपने उसे एक बेहतरीन, कंप्यूटर-जनरेटेड ड्राइविंग सिम्युलेटर में पूरी तरह से प्रशिक्षित किया है जहाँ सूरज हमेशा चमकता है, सड़कें हमेशा साफ रहती हैं, और कोई भी आपको अचानक रास्ता नहीं काटता। रोबोट हर टेस्ट में शानदार प्रदर्शन करता है।

लेकिन फिर, आप उस रोबोट को असली दुनिया में ले जाते हैं। अचानक मूसलाधार बारिश होने लगती है, कोहरे की एक चादर छा जाती है, एक ट्रक आपका दृश्य बाधित कर देता है, और सड़क ऊबड़-खाबड़ होने के कारण कैमरा हिलने लगता है। रोबोट घबरा जाता है। वह कार चलाना भूल जाता है। वह शायद बाएं मुड़ने की कोशिश करता है जब उसे सीधा जाना चाहिए था, या वह इसलिए जम जाता है क्योंकि उसे लेन मार्कर दिखाई नहीं दे रहे हैं।

यह वर्तमान "विज़न-लैंग्वेज मॉडल्स" (AI जो देखता है और बात करता है) की समस्या है। वे लैब में बहुत प्रतिभाशाली हैं लेकिन वास्तविक दुनिया की अव्यवस्था में बहुत नाजुक साबित होते हैं।

आपके द्वारा साझा किया गया पेपर ROVA (Robust Video Alignment) पेश करता है, जो इन AI मॉडल्स को प्रशिक्षित करने का एक नया तरीका है ताकि वे केवल वास्तविक दुनिया की अराजकता में जीवित ही न रहें—बल्कि उसमें निपुण भी बनें।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "ग्लास हाउस" (कांच के घर) का प्रभाव

अधिकांश AI मॉडल एक "ग्लास हाउस" में प्रशिक्षित होते हैं। वे केवल एकदम साफ, शुद्ध वीडियो देखते हैं। जब वे वास्तविक दुनिया के "व्यवधानों" (जैसे बारिश, कोहरा, या कैमरे के लेंस पर हाथ आना) का सामना करते हैं, तो उनका तर्क (reasoning) टूट जाता है।

  • उपमा: कल्पना कीजिए कि एक छात्र केवल एक ऐसी पाठ्यपुस्तक से गणित की परीक्षा के लिए पढ़ाई करता है जिसमें एकदम स्पष्ट चित्र दिए गए हैं। यदि आप उसे ऐसी परीक्षा देते हैं जहाँ चित्रों पर स्याही बिखरी हुई है, या कागज गीला और धुंधला है, तो वह असफल हो जाता है। उसने गणित नहीं सीखा है; उसने केवल परफेक्ट चित्रों को पहचानना सीखा है।

2. समाधान: ROVA (एक "स्ट्रेस-टेस्ट" ट्रेनर)

लेखकों ने ROVA नामक एक प्रशिक्षण ढांचा बनाया है। केवल साफ वीडियो दिखाने के बजाय, वे प्रशिक्षण के दौरान जानबूझकर वीडियो को "खराब" करते हैं ताकि वास्तविक जीवन की अराजकता का अनुकरण किया जा सके।

  • "अव्यवस्थित" वीडियो: वे एक साफ वीडियो लेते हैं और उस पर "करप्शन" (विकार) लागू करते हैं।
    • मौसम: वे डिजिटल बारिश, कोहरा या बर्फबारी जोड़ते हैं।
    • ओक्लूजन (Occlusion): वे स्क्रीन के कुछ हिस्सों को डिजिटल रूप से ब्लॉक कर देते हैं (जैसे लेंस के सामने से उड़ता हुआ पक्षी)।
    • कैमरा शेक: वे वीडियो को झटकेदार बनाते हैं।
    • टाइम जम्प्स: वे फ्रेम का क्रम बदल देते हैं ताकि AI को यह समझना पड़े कि पहले क्या हुआ था।

3. सीक्रेट सॉस: तीन स्मार्ट ट्रिक्स

ROVA केवल AI को अव्यवस्थित वीडियो दिखाने के बारे में नहीं है। यह सीखने को पक्का बनाने के लिए तीन चतुर रणनीतियों का उपयोग करता है:

A. "स्व-चिंतनशील" कोच (डिफिकल्टी-अवेयर ट्रेनिंग)

कल्पना कीजिए कि एक जिम ट्रेनर आपको वजन उठाते हुए देख रहा है।

  • बहुत आसान: यदि आप 5 पाउंड का वजन उठाते हैं और यह बहुत सहज है, तो ट्रेनर कहता है, "आपने इसमें महारत हासिल कर ली है। समय बर्बाद करना बंद करें।" (AI इन आसान नमूनों को अनदेखा कर देता है)।
  • बहुत कठिन: यदि आप 500 पाउंड उठाने की कोशिश करते हैं और तुरंत विफल हो जाते हैं, तो ट्रेनर कहता है, "अभी नहीं। इसे शेल्फ पर रख दें और बाद में तब वापस आएं जब आप अधिक मजबूत हो जाएं।" (AI इन "कठिन" नमूनों को बाद में फिर से प्रयास करने के लिए मेमोरी बफर में सुरक्षित रखता है)।
  • बिल्कुल सही: ट्रेनर उन 50 पाउंड वाले वजन पर ध्यान केंद्रित करता है जो चुनौतीपूर्ण तो हैं लेकिन संभव भी हैं। यहीं पर सबसे अधिक विकास होता है।
  • ROVA इसे स्वचालित रूप से करता है: यह लगातार जांचता है, "क्या यह वीडियो AI के लिए अभी बहुत आसान है या बहुत कठिन?" और केवल उन "गोल्डिलॉक्स" (Goldilocks) नमूनों पर प्रशिक्षण देता है जो सबसे अच्छा लर्निंग सिग्नल प्रदान करते हैं।

B. "जुड़वां" रणनीति (डुअल-ब्रांच अलाइनमेंट)

यही प्रशिक्षण का मुख्य हिस्सा है।

  • सेटअप: AI एक ही समय में दो वीडियो देखता है।
    • वीडियो A: मूल, साफ वीडियो।
    • वीडियो B: वही वीडियो, लेकिन डिजिटल बारिश और कोहरे से ढका हुआ।
  • लक्ष्य: AI को दोनों वीडियो के लिए बिल्कुल एक जैसा उत्तर और वही तर्क देना होगा।
  • उपमा: यह एक जासूस को अपराध सुलझाने के लिए कहने जैसा है। पहले, वे अपराध स्थल की एक स्पष्ट फोटो देखते हैं। फिर, वे उसी फोटो को देखते हैं लेकिन संदिग्ध के चेहरे पर कीचड़ का धब्बा लगा हुआ है। यदि जासूस साफ फोटो के लिए कहता है, "संदिग्ध ने लाल टोपी पहनी है," लेकिन कीचड़ वाली फोटो के लिए कहता है, "मैं नहीं बता सकता," तो वह विफल हो जाता है। उन्हें दोनों मामलों में कहना होगा, "संदिगत ने लाल टोपी पहनी है," जो यह साबित करता है कि वे कीचड़ के बावजूद देख सकते हैं।

C. "रिवॉर्ड सिस्टम" (निरंतरता ही सर्वोपरि है)

AI को केवल सही उत्तर देने के लिए ही नहीं, बल्कि निरंतर (consistent) रहने के लिए भी अंक (रिवॉर्ड) मिलते हैं।

  • यदि AI साफ वीडियो के लिए "सीधे जाओ" कहता है लेकिन बारिश वाले वीडियो के लिए "बाएं मुड़ें" कहता है, तो उसे दंड (penalty) मिलता है।
  • यदि वह दोनों के लिए "सीधे जाओ" कहता है, और कारण भी बताता है (जैसे, "बारिश के बावजूद सड़क साफ है"), तो उसे भारी रिवॉर्ड मिलता है। यह AI को शोर (noise) को अनदेखा करने और सत्य पर ध्यान केंद्रित करने की शिक्षा देता है।

4. नया टेस्ट: PVRBench

यह साबित करने के लिए कि उनकी विधि काम करती है, लेखकों ने PVRBench नामक एक नई परीक्षा बनाई है।

  • पुराने टेस्ट: अधिकांश AI बेंचमार्क धूप वाले दिन बिना ट्रैफिक के ड्राइविंग टेस्ट की तरह हैं।
  • PVRBench: यह एक ड्राइविंग टेस्ट है जहाँ बारिश हो रही है, सड़क बर्फीली है, और एक ट्रक आपका दृश्य बाधित कर रहा है।
  • परिणाम: जब उन्होंने इस नए टेस्ट पर शीर्ष AI मॉडल्स का परीक्षण किया, तो कई बुरी तरह विफल रहे (सटीकता में 20-35% की गिरावट आई)। लेकिन ROVA के साथ प्रशिक्षित मॉडल्स? वे शांत रहे, सही तर्क दिया, और अपना प्रदर्शन उच्च बनाए रखा।

मुख्य निष्कर्ष

ROVA AI को "एंटी-फ्रेजाइल" (Anti-fragile) बनाना सिखाता है।
चीजें अस्त-व्यस्त होने पर टूटने के बजाय, मॉडल सीखता है कि "अव्यवस्था" काम का एक हिस्सा है। "अव्यवस्थित" डेटा पर प्रशिक्षण देकर और AI को साफ और अव्यवस्थित संस्करणों के बीच सुसंगत होने के लिए मजबूर करके, मॉडल दुनिया की वास्तविक संरचना को सीखता है, न कि केवल सुंदर चित्रों को।

संक्षेप में: ROVA AI को स्टेराइल लैब से बाहर निकालता है, उसे डिजिटल तूफान में डालता है, और उसे रास्ता भटके बिना बारिश में गाड़ी चलाना सिखाता है। इसका मतलब है कि भविष्य में, सेल्फ-ड्राइविंग कारें, बचाव ड्रोन और घरेलू रोबोट वास्तविक दुनिया के कठिन होने पर बहुत अधिक सुरक्षित और विश्वसनीय होंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →