← नवीनतम पेपर
💻 computer science

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

ParaVT सुदृढीकरण सीखने (reinforcement learning) में समानांतर वीडियो टूल कॉलिंग के लिए एक नवीन मल्टी-एजेंट फ्रेमवर्क पेश करता है, जो अपने PARA-GRPO एल्गोरिदम के माध्यम से "टूल प्रायर पैराडॉक्स" (Tool Prior Paradox) पर विजय प्राप्त करते हुए अनुक्रमिक बेसलाइन की तुलना में बेहतर फॉर्मेट स्थिरता और दोष सहिष्णुता के साथ उत्कृष्ट दीर्घ-वीडियो समझ प्राप्त करता है।

मूल लेखक: Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bing

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ParaVT पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के माध्यम से समझाया गया है।

बड़ी तस्वीर: एक रोबोट को फिल्म देखना सिखाना

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट (एक लार्ज मल्टीमॉडल मॉडल) है जिसे 90 मिनट के फुटबॉल मैच के बारे में सवालों के जवाब देने हैं। रोबोट एक बार में पूरी फिल्म नहीं देख सकता क्योंकि डेटा बहुत अधिक है। इसलिए, आप उसे उत्तर खोजने के लिए वीडियो के विशिष्ट हिस्सों पर क्रॉप (ज़ूम इन) करने के लिए एक "रिमोट कंट्रोल" टूल का उपयोग करना सिखाते हैं।

समस्या यह है कि रोबोट वर्तमान में इस रिमोट का उपयोग करने में बहुत अनाड़ी है। वह ज़ूम करने की कोशिश करता है, लेकिन यदि उससे कोई गलती हो जाती है, तो वह त्रुटियों के एक लूप (चक्कर) में फंस जाता है। नया पेपर, ParaVT, रोबोट को रिमोट का बेहतर उपयोग करना सिखाता है और प्रशिक्षण प्रक्रिया को ठीक करता है ताकि रोबोट वास्तव में सीख सके।


1. पुराना तरीका: "एक-समय-पर-एक" ट्रैफिक जाम

समस्या:
पहले, रोबोट्स को बारी-बारी से वीडियो देखने के लिए प्रशिक्षित किया जाता था।

  • टर्न 1: "मुझे पहले 10 सेकंड पर ज़ूम करने दो।" (रोबोट यह करता है)।
  • टर्न 2: "ठीक है, अब मुझे अगले 10 सेकंड पर ज़ूम करने दो।" (रोबोट यह करता है)।

उपमा (Analogy):
एक जासूस की कल्पना करें जो एक सुराग देखने, उसे लिखने, उसे फोल्डर में रखने और फिर अगले सुराग के लिए पूछने के बाद अपराध को सुलझाने की कोशिश कर रहा है।

  • जोखिम: यदि जासूस पहले सुराग को गलत पढ़ लेता है, तो वे अपना पूरा सिद्धांत एक झूठ पर बनाते हैं। उन्हें सुधारने वाला कोई नहीं है।
  • लागत: इसमें सभी सुराग प्राप्त करने में बहुत समय लगता है क्योंकि उन्हें अगला कदम शुरू करने से पहले प्रत्येक चरण के समाप्त होने का इंतज़ार करना पड़ता है।

ParaVT का समाधान:
एक-एक करके सुराग मांगने के बजाय, रोबोट एक जासूसों की टीम की तरह काम करता है। एक ही टर्न में, मुख्य रोबोट कहता है, "तुम, मिनट 10 को देखो! तुम, मिनट 20 को देखो! तुम, मिनट 30 को देखो!"

  • पैरेलल प्रोसेसिंग (समानांतर प्रसंस्करण): तीनों "सब-रोबोट्स" अपने निर्धारित समय को एक ही समय में देखते हैं।
  • पीयर करेक्शन (सहकर्मी सुधार): यदि एक सब-रोबोट गलत समय पर देखता है, तो अन्य दो कह सकते हैं, "नहीं, यह वह नहीं है," और मुख्य रोबोट उस खराब सुराग को अनदेखा कर देता है।
  • परिणाम: तेज़ उत्तर और कम गलतियाँ।

2. छिपा हुआ जाल: "टूल प्रायर पैराडॉक्स" (Tool Prior Paradox)

यह इस पेपर का सबसे दिलचस्प हिस्सा है। शोधकर्ताओं ने इन रोबोट्स को प्रशिक्षित करते समय एक अजीब विरोधाभास की खोज की।

पैराडॉक्स (विरोधाभास):
रोबोट्स में टूल्स का उपयोग करने की एक "मसल्स मेमोरी" (पूर्व-प्रशिक्षित आदत) होती है (उनके पिछले कोड और डेटा प्रशिक्षण से)।

  • यदि आप इस मसल मेमोरी पर बहुत अधिक भरोसा करते हैं: तो रोबोट टूल का उपयोग करने के लिए उत्साहित हो जाता है, लेकिन वह बड़बड़ाने (gibberish) लगता है। वह खेल के नियमों (फॉर्मेट) को भूल जाता है और आवश्यक "ज़ूम इन" कमांड के बजाय अव्यवस्थित कोड लिख देता है।
  • यदि आप मसल मेमोरी को रोकने की कोशिश करते हैं: तो रोबोट नियमों का पूरी तरह से पालन करता है, लेकिन वह टूल का उपयोग करने से बहुत डर जाता है। वह बिना देखे ही उत्तर का अनुमान लगाने लगता है।

उपमा:
एक छात्र की कल्पना करें जो परीक्षा दे रहा है।

  • परिदृश्य A: छात्र को उत्तर कुंजी (प्रायर) पता है लेकिन वह इतना आत्मविश्वासी है कि वह निर्देशों को नज़रअंदाज़ कर देता है कि "नीली स्याही में लिखें।" वह सही उत्तर लिखता है लेकिन लाल स्याही में, इसलिए शिक्षक (कंप्यूटर) उसे ग्रेड नहीं दे पाता।
  • परिदृश्य B: छात्र "नीली स्याही" के नियम का पूरी तरह से पालन करता है लेकिन वह इतना घबराया हुआ है कि वह कठिन सवालों के जवाब देने की कोशिश भी नहीं करता।

पेपर इसे टूल प्रायर पैराडॉक्स कहता है: वही चीज़ जो रोबोट को टूल का उपयोग करने के लिए प्रेरित करती है, उसे नियम तोड़ने पर मजबूर भी करती है।


3. समाधान: PARA-GRPO (द "सेफ्टी नेट" और द "चैलेंज")

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया प्रशिक्षण तरीका विकसित किया जिसे PARA-GRPO कहा जाता है। यह रोबोट को ट्रैक पर रखने के लिए दो चतुर तरीकों का उपयोग करता है।

ट्रिक 1: "सेफ्टी नेट" (एक्सप्लोरेशन एंकरिंग)

समस्या: रोबोट अपने वाक्यों को बंद करना भूल जाता रहता है (जैसे क्लोजिंग टैग </answer> भूल जाना)।
समाधान: प्रशिक्षण प्रणाली रोबोट के नीचे एक "सेफ्टी नेट" रखती है। यह रोबोट को एक छोटा बोनस रिवॉर्ड (इनाम) देती है केवल तभी जब वह अपने टैग्स को सही ढंग से याद रखता है।

  • उपमा: एक रस्सी पर चलने वाले (tightrope walker) की कल्पना करें। यदि वह डगमगाता है, तो उसे केंद्र में वापस लाने के लिए एक हल्का धक्का मिलता है। रोबोट को विशेष रूप से अपना वाक्य पूरा करने के लिए एक "अच्छा काम किया" का संकेत मिलता है, जो उसे अव्यवस्थित कोड के जाल में गिरने से रोकता है।

ट्रिक 2: "चैलेंज" (nFrames गेटिंग)

समस्या: कभी-कभी रोबोट केवल कुछ धुंधले फ्रेम्स को देखकर ही उत्तर का अनुमान लगा सकता है। वह सीख जाता है कि "टूल को छोड़ना" आसान है और उसे समान इनाम मिलता है, इसलिए वह टूल का उपयोग करना पूरी तरह से बंद कर देता है।
समाधान: प्रशिक्षण प्रणाली बेतरतीब ढंग से नियम बदल देती है। कभी-कभी यह रोबोट को एक स्पष्ट वीडियो देती है; अन्य समय में, यह उसे एक धुंधला, निम्न-गुणवत्ता वाला वीडियो देती है जहाँ ज़ूम किए बिना उत्तर का अनुमान लगाना असंभव है।

  • उपमा: एक वीडियो गेम की कल्पना करें। यदि लेवल बहुत आसान है, तो खिलाड़ी अपने विशेष शक्तियों का उपयोग करना बंद कर देता है। डेवलपर्स कुछ लेवल्स को अंधेरे और धुंधले बना देते हैं। अब, खिलाड़ी को जीतने के लिए अपनी टॉर्च (टूल) का उपयोग करना ही होगा। यह रोबोट को यह सीखने के लिए मजबूर करता है कि टूल का उपयोग करना वास्तव में आवश्यक है।

4. परिणाम: एक स्मार्ट, तेज़ रोबोट

Parallel Team दृष्टिकोण के साथ Safety Net और Challenge को जोड़कर, ParaVT रोबोट बहुत बेहतर हो गया।

  • सटीकता (Accuracy): इसने पिछले मॉडल्स की तुलना में लंबे वीडियो टेस्ट पर काफी अधिक स्कोर किया (औसतन लगभग 8% का सुधार)।
  • विश्वसनीयता (Reliability): इसने नियमों को तोड़ना बंद कर दिया (फॉर्मेटिंग त्रुटियां 87% विफलता से घटकर 36% विफलता रह गईं)।
  • दक्षता (Efficiency): इसने समस्याओं को तेज़ी से हल किया क्योंकि इसे टर्न समाप्त होने का इंतज़ार नहीं करना पड़ा।

सारांश

यह पेपर ParaVT पेश करता है, एक ऐसा सिस्टम जो AI को एक "टीम" के माध्यम से अलग-अलग हिस्सों पर एक साथ ज़ूम करके लंबी वीडियो देखने के लिए सिखाता है। इसे सफल बनाने के लिए, उन्होंने एक कठिन प्रशिक्षण समस्या को हल किया जहाँ AI या तो बहुत अव्यवस्थित था या बहुत आलसी। उन्होंने इसे AI को व्याकरण सही रखने के लिए एक "सेफ्टी नेट" और टूल का वास्तव में उपयोग करने के लिए मजबूर करने के लिए एक "चैलेंज" देकर ठीक किया। परिणाम एक ऐसा रोबोट है जो लंबी वीडियो को समझने में तेज़, स्मार्ट और अधिक विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →