← नवीनतम पेपर
💬 NLP

Structured Causal Video Reasoning via Multi-Objective Alignment

यह शोध पत्र Factum-4B को प्रस्तुत करता है, जो एक वीडियो रीजनिंग मॉडल है जो संरचित घटना तथ्यों (structured event facts) को उत्पन्न करके और कारण संबंधी निष्ठा (causal fidelity) एवं तर्क दक्षता (reasoning efficiency) के बीच संतुलन बनाने के लिए एक बहु-उद्देश्यीय सुदृढीकरण शिक्षण ढांचे (multi-objective reinforcement learning framework) का उपयोग करके मानव संज्ञानात्मक संरचनाओं और मौजूदा Video-LLMs के बीच के अंतर को पाटता है।

मूल लेखक: Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang, Mohammed Bennamoun, Farid Boussaid, Feng Zheng, Qiuhong Ke

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang, Mohammed Bennamoun, Farid Boussaid, Feng Zheng, Qiuhong Ke

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "स्ट्रक्चर्ड कॉज़ल वीडियो रीजनिंग वाया मल्टी-ऑब्जेक्टिव अलाइनमेंट" (Factum-4B) के पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं में विभाजित किया गया है।

बड़ी समस्या: "बड़बड़ाने वाला जासूस"

कल्पना कीजिए कि आपने एक 10 मिनट का वीडियो देखने और आपको ठीक-ठीक बताने के लिए एक जासूस को काम पर रखा है कि कोई विशिष्ट घटना कब हुई (जैसे, "आदमी ने अपनी चाबियाँ कब गिरा दीं?")।

वर्तमान AI मॉडल उन जासूसों की तरह हैं जिन्होंने बहुत सारी किताबें पढ़ी हैं लेकिन कभी कोई फिल्म नहीं देखी है। जब वे वीडियो देखते हैं, तो वे तुरंत बोलना शुरू कर देते हैं: "ठीक है, मैं एक दरवाज़ा देख रहा हूँ, फिर एक बिल्ली, फिर एक कार, फिर शायद आदमी चल रहा है... रुकिए, क्या वह एक चाबी थी? नहीं, शायद वह एक सिक्का था... मुझे फिर से बिल्ली के बारें में सोचने दें..."

वे विचारों का एक लंबा, अव्यवस्थित और बिना किसी संरचना के प्रवाह पैदा करते हैं। वे विवरणों में खो जाते हैं, मुख्य प्रश्न को भूल जाते हैं, और अक्सर गलत समय का अनुमान लगाते हैं क्योंकि उन्होंने पहले सुरागों को व्यवस्थित नहीं किया था। इसे अनस्ट्रक्चर्ड रीजनिंग (Unstructured Reasoning) कहा जाता है।

समाधान: "स्ट्रक्चर्ड जासूस" (Factum-4B)

लेखकों ने एक नया AI मॉडल बनाया है जिसे Factum-4B कहा जाता है। सीधे उत्तर देने के बजाय, वे मॉडल को एक अत्यधिक संगठित, पेशेवर अन्वेषक की तरह कार्य करने के लिए प्रशिक्षित करते हैं जो एक सख्त तीन-चरणीय प्रक्रिया का पालन करता है:

  1. नोट्स लें (स्ट्रक्चर्ड इवेंट फैक्ट्स): रहस्य को सुलझाने से पहले, मॉडल रुकता है और एक "चीट शीट" बनाता है। यह वीडियो को छोटे टुकड़ों में तोड़ता है और बिल्कुल सटीक रूप से लिखता है: कौन वहाँ है, वे क्या कर रहे हैं, वे कहाँ हैं, और यह कब होता है।
    • उपमा: इसे एक पुलिस अधिकारी द्वारा कहानी लिखने से पहले एक मानकीकृत रिपोर्ट फॉर्म भरने की तरह समझें। "समय: सुबह 10:00 बजे। व्यक्ति: लाल टोपी वाला आदमी। क्रिया: चाबियाँ गिराना।"
  2. कड़ियों को जोड़ें (कॉज़ल थिंकिंग): अब, केवल चरण 1 के नोट्स का उपयोग करके, मॉडल उत्तर की तलाश करता है। यह जाँचता है: "आदमी ने चाबियाँ इसलिए गिरा दीं क्योंकि वह देर हो रहा था।" यह कारण और प्रभाव (cause and effect) को सत्यापित करता है।
  3. उत्तर दें: अंत में, यह सटीक समय सीमा देता है।

यह बेहतर क्यों है?
मॉडल को पहले "चीट शीट" लिखने के लिए मजबूर करके, यह अप्रासंगिक विवरणों (जैसे पृष्ठभूमि में बिल्ली) से विचलित नहीं हो सकता। यह तर्क को संक्षिप्त, तार्किक और जांचने में आसान रखता है।


प्रशिक्षण की चुनौती: "टग-ऑफ-वार" (खींचातानी)

इस मॉडल को प्रशिक्षित करना कठिन था। शोधकर्ताओं ने एक तकनीक का उपयोग किया जिसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है (जैसे इनाम देकर कुत्ते को प्रशिक्षित करना)। वे चाहते थे कि मॉडल को निम्नलिखित के लिए पुरस्कृत किया जाए:

  • सटीक होना (सही समय प्राप्त करना)।
  • संक्षिप्त होना (लंबा उपन्यास न लिखना)।
  • स्ट्रक्चर्ड होना (फॉर्मेट का पालन करना)।

समस्या: ये लक्ष्य अक्सर एक-दूसरे से टकराते हैं।

  • यदि आप मॉडल को बहुत सटीक होने के लिए कहते हैं, तो यह सभी संभावनाओं को कवर करने के लिए एक बहुत लंबी व्याख्या लिख सकता है।
  • यदि आप इसे बहुत छोटा रखने के लिए कहते हैं, तो यह महत्वपूर्ण विवरण छोड़ सकता है और गलत उत्तर दे सकता है।

मानक प्रशिक्षण विधियाँ एक बॉस की तरह हैं जो कहती हैं, "बस मुझे सटीकता और गति का संयोजन करके 10 में से एक एकल स्कोर दें।" यह मॉडल को भ्रमित करता है। इसे नहीं पता कि किस दिशा में बढ़ना है।

गुप्त नुस्खा: "P-FAB" एल्गोरिदम

इस खींचतानी को हल करने के लिए, लेखकों ने एक नया एल्गोरिदम बनाया जिसे P-FAB (पारेटो-फ्रंटियर गाइडेड एडवांटेज बैलेंसिंग) कहा जाता है।

उपमा: डाइट प्लान
कल्पना कीजिए कि आप वजन कम करने (उद्देश्य A) और साथ ही मांसपेशियां बनाने (उद्देश्य B) की कोशिश कर रहे हैं।

  • यदि आप केवल कम खाते हैं, तो आप वजन कम करते हैं लेकिन मांसपेशियां खो देते हैं।
  • यदि आप केवल भारी वजन उठाते हैं, तो आप मांसपेशियां बनाते हैं लेकिन वजन कम नहीं कर पाते।
  • एक मानक ट्रेनर कह सकता है, "बस दोनों का मिश्रण करें," लेकिन यह अस्पष्ट है।

P-FAB एक जीनियस न्यूट्रिशनिस्ट की तरह है जो हर दिन आपकी विशिष्ट प्रगति को देखता है। वह कहता है: "आज, आप मांसपेशियों के मामले में बहुत अच्छा कर रहे हैं लेकिन वजन घटाने में पिछड़ रहे हैं। आइए उन्हें बिना किसी को नुकसान पहुँचाए दोनों को पूरी तरह से संतुलित करने के लिए आपके आहार को थोड़ा समायोजित करें।"

तकनीकी शब्दों में, P-FAB "पारेटो फ्रंटियर" (Pareto Frontier) को खोजता है। यह वह "स्वीट स्पॉट" है जहाँ आप एक लक्ष्य (जैसे गति) में सुधार किए बिना दूसरे (जैसे सटीकता) को नुकसान पहुँचाए बिना बेहतर नहीं हो सकते। यह पुरस्कारों को गतिशील रूप से संतुलित करता है ताकि मॉडल न केवल एक को चुनने के बजाय, तेज़ और स्मार्ट दोनों होने के लिए सीख सके।

परिणाम: "Factum-4B" मॉडल

अंतिम मॉडल, Factum-4B, एक छोटा लेकिन शक्तिशाली AI है (केवल 4 बिलियन पैरामीटर्स के साथ, जो AI के लिए छोटा है)।

  • यह इंसान की तरह सोचता है: यह तर्क करने से पहले वीडियो का एक मानसिक खाका तैयार करता है।
  • यह विश्वसनीय है: यह भ्रमित (hallucinate) नहीं होता या लंबे वीडियो में खोता नहीं है।
  • यह कुशल है: यह बहुत बड़े मॉडलों की तुलना में अधिक तेज़ी से और अधिक सटीकता से उत्तर देता है।

सारांश में:
यह पेपर AI को "बड़बड़ाना" बंद करने और "नोट्स लेना" शुरू करने की शिक्षा देता है। मॉडल को पहले वीडियो तथ्यों को व्यवस्थित करने के लिए मजबूर करके और फिर एक विशेष संतुलन एल्गोरिदम का उपयोग करके, उन्होंने एक ऐसा वीडियो-समझने वाला AI बनाया है जो वर्तमान में उपलब्ध किसी भी अन्य मॉडल की तुलना में अधिक स्मार्ट, तेज़ और तार्किक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →