← नवीनतम पेपर
💻 computer science

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

यह शोध पत्र CARE को प्रस्तुत करता है, जो एक क्षमता-जागरूक रिवॉर्ड शेपिंग फ्रेमवर्क है जो मॉडल के विकसित होते प्रदर्शन के आधार पर अन्वेषण-उन्मुख दीर्घ-रूप तर्क (long-form reasoning) से दक्षता-उन्मुख संक्षिप्त तर्क (concise reasoning) में संक्रमण करके वीडियो-MLLMs में तर्क की लंबाई को गतिशील रूप से अनुकूलित करता है, जिससे बिना किसी इन्फरेंस ओवरहेड के सटीकता, प्रशिक्षण स्थिरता और टोकन दक्षता में सुधार होता है।

मूल लेखक: Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो क्लिप्स का उपयोग करके जटिल पहेलियाँ हल करना सिखा रहे हैं। आप चाहते हैं कि रोबोट उत्तर देने से पहले ज़ोर से सोचे (अपना काम दिखाए)। लेकिन एक पेच है: रोबोट को कितना सोचना चाहिए, यह दो चीजों पर निर्भर करता है: रोबोट अभी इस समय कितना बुद्धिमान है, और पहेली कितनी कठिन है।

यह पेपर एक नई प्रशिक्षण विधि पेश करता है जिसे CARE (कॉम्पिटेंस-अवेयर रिवॉर्ड शेपिंग) कहा जाता है ताकि एक विशिष्ट समस्या को हल किया जा सके: वर्तमान विधियाँ रोबोट के "सोचने के समय" को एक निश्चित नियम पुस्तिका की तरह मानती हैं। वे या तो कहते हैं, "हमेशा 5 मिनट तक सोचें," या "हमेशा 2 मिनट से कम रखें।"

लेखक तर्क देते हैं कि यह एक बच्चे को तैरना सिखाने के लिए यह बताने जैसा है कि "चाहे तुम बाथटब में हो या गहरे समुद्र में, हमेशा 50 बार लात मारो।"

CARE कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग करके समझाया गया है:

1. समस्या: "एक ही आकार सबके लिए" वाला जाल (The "One-Size-Fits-All" Trap)

अतीत में, शोधकर्ताओं ने एक स्थिर नियम (static rule) का उपयोग किया था।

  • प्रशिक्षण के शुरुआती दौर में: रोबोट एक "नौसिखिया" होता है। इसे सही उत्तर खोजने के लिए कई अलग-अलग रास्तों को तलाशने (explore करने) की आवश्यकता होती है। यदि आप इसे संक्षिप्त रहने के लिए मजबूर करते हैं, तो आप इसकी सीखने की प्रक्रिया को बाधित कर देते हैं।
  • प्रशिक्षण के बाद के दौर में: रोबोट एक "विशेषज्ञ" बन जाता है। वह सही रास्ते को जल्दी से जान लेता है। यदि आप अभी भी इसे लंबे समय तक बड़बड़ाने की अनुमति देते हैं, तो यह केवल ऊर्जा बर्बाद करता है और खुद को दोहराता है (जैसे एक छात्र जो उत्तर जानता है लेकिन जगह भरने के लिए बार-बार एक ही वाक्य लिखता रहता है)।

स्थिर नियम विफल होते हैं क्योंकि उन्हें यह नहीं पता होता कि रोबोट कब "बड़ा" हो गया है। वे या तो बहुत जल्दी रोबोट को अन्वेषण (exploration) करने से रोक देते हैं या उसे बहुत देर तक आलसी और बातूनी रहने देते हैं।

2. समाधान: CARE (एक "स्मार्ट कोच")

CARE एक स्मार्ट कोच की तरह कार्य करता है जो वास्तविक समय में रोबोट की प्रगति को देखता है और उसके अनुसार नियमों को बदलता है।

  • "कॉम्पिटेंस मॉनिटर" (कोच की आँख):
    कोच इस बात का औसत रखता है कि रोबमाट कितना अच्छा प्रदर्शन कर रहा है। यदि रोबोट आज एक कठिन पहेली में विफल हो जाता है, तो कोच घबराता नहीं है; वह दीर्घकालिक रुझान (long-term trend) को देखता है। यह कोच को बताता है: "क्या रोबोट एक नौसिखिया है, एक अन्वेषक (Explorer) है, एक कुशल छात्र है, या एक उस्ताद (Master) है?"

  • "स्टेज राउटर" (नियम पुस्तिका बदलने वाला):
    कोच के मूल्यांकन के आधार पर, नियम बदल जाते हैं:

    • नौसिखिया चरण (Novice Phase): कोच कहता है, "मनमर्जी करो! जितना आवश्यक हो उतना सोचो। इस बात की चिंता मत करो कि तुम बहुत लंबा बोल रहे हो। हमें समाधान खोजने की ज़रूरत है।"
    • अन्वेषक चरण (Explorer Phase): "तुम बेहतर हो रहे हो। अन्वेषण जारी रखो, लेकिन फालतू बातों को छाँटना शुरू करो।"
    • कुशल/उस्ताद चरण (Proficient/Master Phase): "अब तुम एक विशेषज्ञ हो। संक्षिप्त रहो। यदि तुम इसे 10 शब्दों में हल कर सकते हो, तो 100 शब्द इस्तेमाल मत करो। हम दक्षता (efficiency) चाहते हैं।"
  • "डिफिकल्टी नॉर्मलाइज़र" (संदर्भ की जाँच):
    कोच जानता है कि कुछ पहेलियाँ दूसरों की तुलना में अधिक कठिन होती हैं। यदि रोबोट एक बहुत कठिन वीडियो पहेली को हल कर रहा है, तो कोच एक लंबे उत्तर की अनुमति देता है। यदि यह एक आसान पहेली है, तो कोच संक्षिप्तता की मांग करता है। यह रोकता है कि रोबोट किसी कठिन समस्या को केवल इसलिए "आसान" न समझ ले क्योंकि वह छोटी है, या किसी सरल समस्या को "कठिन" न मान ले क्योंकि वह लंबी है।

  • "सरप्राइज एम्प्लीफायर" (चीयरलीडर):
    कभी-कभी, एक नौसिखिया रोबोट गलती से या किस्मत से किसी बहुत कठिन समस्या को हल कर लेता है। कोच इस "अपेक्षित सफलता" को नोट करता है और एक बड़ा इनाम देता है, कहता है, "वाह! यह शानदार था! इसी तरह की सोच को जारी रखो!" यह रोब सहित कठिन कार्यों को तेजी से सीखने में मदद करता है।

3. परिणाम: "इनवर्टेड-यू" (उल्टा U) की यात्रा

यदि आप समय के साथ रोबोट के व्यवहार को देखते हैं, तो यह एक पहाड़ी की तरह एक विशिष्ट पैटर्न का पालन करता है:

  1. ऊपर चढ़ना (विस्तार/Expansion): शुरुआत में, रोबोट के उत्तर लंबे होते जाते हैं। वह बारीकियों को समझने के लिए हर कोने-कोने की खोज कर रहा होता है।
  2. शिखर (The Peak): वह उस बिंदु पर पहुँचता है जहाँ वह सबसे अधिक जानता है।
  3. नीचे उतरना (संपीड़न/Compression): जैसे-जैसे वह कौशल में महारत हासिल करता है, उसके उत्तर छोटे और सटीक होते जाते हैं। वह बड़बड़ाना बंद कर देता है और काम पूरा करने के लिए आवश्यक "सघन" जानकारी देने लगता है।

4. यह क्यों महत्वपूर्ण है

इस पेपर का परीक्षण वीडियो रीजनिंग (वीडियो देखना और प्रश्नों के उत्तर देना) पर किया गया।

  • पुराना तरीका: रोबोट या तो छोटे, अधूरे विचारों में फंस जाता या लंबे, दोहराव वाले किस्से लिखने में समय बर्बाद करता।
  • CARE तरीका: रोबोट ने अपने "सोचने के बजट" को पूरी तरह से आवंटित करना सीख लिया। उसने कठिन वीडियो पर बहुत समय बिताया और आसान वीडियो पर बहुत कम।

मुख्य बात:
CARE AI को अनुकूलनशील (adaptable) बनाना सिखाता है। यह सीखता है कि "स्मार्ट" होने का मतलब केवल सही उत्तर प्राप्त करना नहीं है; बल्कि यह जानना भी है कि उस उत्तर तक पहुँचने के लिए कितने प्रयास खर्च करने हैं। प्रशिक्षण के अंत तक, रोबोट न केवल अधिक सटीक होता है, बल्कि बहुत तेज़ और कुशल भी होता है, जो एक ही बात कहने के लिए कम "शब्दों" (टोकन) का उपयोग करता है।

लेखक इस "स्मार्ट कोच" सिस्टम के लिए कोड प्रदान करते हैं, जो यह दर्शाता है कि यह वास्तविक परीक्षण चरण के दौरान बिना किसी अतिरिक्त कंप्यूटिंग पावर के काम करता है—यह बस प्रशिक्षण प्रक्रिया को स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →