← नवीनतम पेपर
💬 NLP

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

यह शोध पत्र VCIFBench प्रस्तुत करता है, जो वीडियो समझ कार्यों में जटिल, बाधा-युक्त निर्देशों का पालन करने की मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया एक व्यापक बेंचमार्क है, जो वर्तमान प्रदर्शन अंतराल को प्रकट करता है और संवर्धन के लिए DPO प्रशिक्षण की प्रभावकारिता को प्रदर्शित करता है।

मूल लेखक: Huangchen Xu, Yuan Wu, Yi Chang

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huangchen Xu, Yuan Wu, Yi Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने लिए एक वीडियो देखने और उसकी रिपोर्ट लिखने के लिए एक बहुत ही बुद्धिमान, बहुत तेज़ सहायक को काम पर रख रहे हैं। आप नहीं चाहते कि वे बस इतना कहें, "एक कुत्ते ने बिल्ली का पीछा किया।" आप उन्हें नियमों की एक बहुत ही विशिष्ट, जटिल सूची देना चाहते हैं:

  • "मुझे ठीक से बताएं कि क्या हुआ, लेकिन केवल उन शब्दों का उपयोग करें जो 'B' अक्षर से शुरू होते हों।"
  • "रिपोर्ट को एक JSON कोड ब्लॉक के रूप में लिखें।"
  • "इसे 50 शब्दों से कम रखें।"
  • "कुत्ते के रंग का उल्लेख न करें।"
  • "वाक्य 'Once upon a time' से शुरू करें और 'The End' पर समाप्त करें।"

यही वह समस्या है जिसे VCIFBench नामक पेपर हल करने की कोशिश कर रहा है।

समस्या: "बुद्धिमान लेकिन अनाड़ी" सहायक

लेखकों ने पाया कि जबकि आधुनिक AI मॉडल (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स कहा जाता है) वीडियो समझने में बहुत अच्छे हो रहे हैं, वे सख्त, जटिल नियमों का पालन करने में अक्सर बहुत खराब होते हैं।

इन AI मॉडल्स को एक प्रतिभाशाली शेफ की तरह समझें जो एक स्वादिष्ट भोजन तो बना सकता है (वीडियो समझ सकता है) लेकिन ग्राहक के विशिष्ट आहार संबंधी प्रतिबंधों (कन्स्ट्रेंट्स) का पालन करना बार-बार भूल जाता है।

  • शेफ एक बेहतरीन सूप बना सकता है, लेकिन वह नमक डालना छोड़ सकता है।
  • वे एक सुंदर कहानी लिख सकते हैं, लेकिन उन्होंने गलत फॉन्ट का उपयोग किया या शब्द सीमा पार कर दी।
  • कभी-कभी, यदि आप उनसे दो ऐसी चीजें करने को कहते हैं जो एक-दूसरे का विरोध करती हैं (जैसे "छोटा रहें" और "हर विवरण शामिल करें"), तो वे नियमों को अनदेखा कर देते हैं और सामान्य उत्तर दे देते हैं।

समाधान: एक नया "तनाव परीक्षण" (VCIFBench)

शोधकर्ताओं ने VCIFBench (वीडियो कॉम्प्लेक्स इंस्ट्रक्शन फॉलोइंग बेंचमार्क) नामक एक नया परीक्षण मैदान बनाया है। यह AI के लिए एक ड्राइविंग टेस्ट की तरह है, लेकिन केवल यह जांचने के बजाय कि कार सड़क पर चल सकती है या नहीं, वे यह जांचते हैं कि क्या ड्राइवर यह कर सकता है:

  1. दाईं ओर ड्राइव करें।
  2. हर लाल बत्ती पर रुकें।
  3. गति को ठीक 30 मील प्रति घंटे पर रखें।
  4. ऐसा करते समय एक गाना गाएं।
  5. यह सब बिना किसी शंकु (cone) से टकराए करें।

उन्होंने इसे कैसे बनाया:

  • उन्होंने मौजूदा वीडियो डेटासेट्स (जैसे कुकिंग शो, विज्ञान क्लिप और दैनिक जीवन के वीडियो) का उपयोग किया।
  • उन्होंने AI के लिए 306 विशिष्ट "आदेश" लिखे, जिनमें विभिन्न प्रकार के नियमों का मिश्रण था:
    • फॉर्मेट: "एक सूची में लिखें," "JSON का उपयोग करें," "बुलेट पॉइंट्स का उपयोग न करें।"
    • कंटेंट: "केवल लाल कार के बारे में बात करें," "बैकग्राउंड म्यूजिक का उल्लेख न करें।"
    • स्टाइल: "एक समुद्री डाकू (pirate) की तरह बोलें," "बहुत औपचारिक रहें।"
    • स्ट्रक्चर: "सबसे महत्वपूर्ण चीज़ को पहले रखें," "चीजों को समय के अनुसार समूहबद्ध करें।"

उन्होंने एक विशेष "ट्रैप" (जाल) अनुभाग भी शामिल किया जिसमें 30 असंभव आदेश थे (जैसे, "एक नीले हाथी का वर्णन करें जो वीडियो में नहीं है, लेकिन केवल उन्हीं चीजों का वर्णन करें जिन्हें आप देख सकते हैं")। एक अच्छा AI कहता, "मैं यह नहीं कर सकता," जबकि एक बुरा AI उस नीले हाथी की कल्पना कर लेगा।

परिणाम: AI अभी भी सीख रहा है

शोधकर्ताओं ने 10 अलग-अलग AI मॉडल्स (कुछ बड़ी टेक कंपनियों के, कुछ ओपन-सोर्स) का इस नए टेस्ट पर परीक्षण किया। यहाँ उन्होंने क्या पाया:

  1. "एक चीज़" बनाम "सब कुछ" का अंतर:
    अधिकांश मॉडल एक नियम का पालन करने में ठीक थे। यदि आपने पूछा, "JSON में लिखें," तो वे यह कर सकते थे। यदि आपने पूछा, "वीडियो का सारांश दें," तो वे वह भी कर सकते थे। लेकिन जब आपने उन्हें एक ही समय में दोनों करने के लिए कहा, तो वे विफल होने लगे।

    • उपमा: यह एक ऐसे छात्र की तरह है जो गणित के सवालों को पूरी तरह से हल कर सकता है और एक शानदार निबंध भी लिख सकता है, लेकिन यदि आप उन्हें निबंध के अंदर गणित का सवाल हल करने के लिए कहते हैं बिना वर्तनी की गलती किए, तो वे भ्रमित हो जाते हैं और गड़बड़ी कर देते हैं।
  2. "करीब से चूक जाने" की समस्या (The "Near Miss" Problem):
    सबसे अच्छे मॉडल (जैसे गूगल और OpenAI के) करीब थे। उन्होंने वीडियो को सही पकड़ा और स्टाइल भी सही रखा, लेकिन वे अक्सर एक छोटी सी चीज़ भूल जाते थे, जैसे एक कॉमा भूल जाना या एक शब्द ज्यादा उपयोग करना।

    • उपमा: उन्होंने एक आदर्श घर बनाया, लेकिन वे भूल गए कि सामने का दरवाजा दाईं ओर लगाना है।
  3. "अंधाधुंध आज्ञाकारिता" की समस्या (The "Blind Obedience" Problem):
    असंभव निर्देशों (ट्रैप प्रश्नों) के मामले में, कमजोर मॉडल्स ने बस चीजें बना लीं। उन्हें यह एहसास नहीं हुआ कि अनुरोध विरोधाभासी था।

    • उपमा: यदि आप एक रोबोट को कहते हैं, "दीवार को एक ही समय में नीला और लाल रंग से पेंट करें," तो एक स्मार्ट रोबोट कहता है, "मैं यह नहीं कर सकता।" एक मूर्ख रोबोट बस एक गंदा बैंगनी रंग का पेंट कर देता है और उम्मीद करता है कि आप ध्यान न दें।
  4. अधिक वीडियो का मतलब हमेशा बेहतर नहीं होता:
    शोधकर्ताओं ने यह देखने के लिए AI को उच्च-गुणवत्ता वाला वीडियो (अधिक फ्रेम्स, बेहतर रिज़ॉल्यूशन) दिया कि क्या इससे मदद मिलेगी। आश्चर्यजनक रूप से, इसने हमेशा मदद नहीं की। कभी-कभी, अधिक देखने से AI बहुत अधिक बोलने लगता था और शब्द सीमा भूल जाता था।

    • उपमा: एक छात्र को 10 पन्नों के सारांश के बजाय 1,000 पन्नों की पाठ्यपुस्तक देने से मदद नहीं मिली; इसने उसे बस अधिक बोलने के लिए उकसाया।

अच्छी खबर: प्रशिक्षण मदद करता है

लेखकों ने एक विशेष तकनीक DPO (डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन) का उपयोग करके एक मॉडल को "सिखाने" का भी प्रयास किया। उन्होंने मॉडल को "अच्छे" उत्तरों (जो सभी नियमों का पालन करते थे) और "बुरे" उत्तरों (जो नियमों को तोड़ते थे) के उदाहरण दिखाए।

  • इस प्रशिक्षण के बाद, मॉडल जटिल नियमों का पालन करने में काफी बेहतर हो गया। वह अधिकांश समय विफल होने से बढ़कर लगभग 33% बार पास होने लगा।
  • उपमा: यह एक शेफ को एक विशिष्ट चेकलिस्ट और नियमों का पूरी तरह से पालन करने के लिए इनाम देने जैसा है। कुछ अभ्यास सत्रों के बाद, वे आखिरकार ऑर्डर सही करने लगे।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि AI वीडियो "देखने" में बहुत अच्छा हो रहा है, लेकिन यह एक "अच्छा कर्मचारी" बनने के लिए संघर्ष कर रहा है जो निर्देशों की एक लंबी, सख्त सूची का पालन करता है। इन मॉडल्स को वास्तविक दुनिया के कार्यों (जैसे स्वचालित रिपोर्टिंग या टूल्स) के लिए उपयोगी बनाने के लिए, हमें उन्हें न केवल वीडियो को समझने के लिए, बल्कि हमें दिए गए सीमाओं और नियमों का सम्मान करने के लिए भी सिखाने की आवश्यकता है।

लेखक चेतावनी देते हैं कि यह परीक्षण केवल नियमों के लिए एक "तनाव परीक्षण" है, न कि AI की समग्र बुद्धिमत्ता का पूर्ण माप, लेकिन यह एक महत्वपूर्ण अंतर को उजागर करता है जिसे ठीक करने की आवश्यकता है इससे पहले कि इन मॉडल्स पर जटिल कार्यों के लिए भरोसा किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →