← नवीनतम पेपर
💻 computer science

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF एक एकीकृत वीडियो संपादन फ्रेमवर्क पेश करता है जो सटीक निर्देश-से-क्षेत्र संरेखण और मोशन निरंतरता प्राप्त करने के लिए 'देखें, तर्क दें, फिर संपादित करें' (see, reason, then edit) वाले 'चेन-ऑफ-फ्रेम्स' दृष्टिकोण का उपयोग करते हुए एडिट-रीजन लेटेंट्स को स्पष्ट रीजनिंग टोकन के रूप में अनुमानित करता है, जिससे बिना किसी उपयोगकर्ता-प्रदान मास्क के उच्च दक्षता और न्यूनतम प्रशिक्षण डेटा के साथ कार्य संपन्न होता है।

मूल लेखक: Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक व्यस्त सड़क का वीडियो है और आप उसे एडिट करना चाहते हैं। शायद आप किसी विशिष्ट व्यक्ति को हटाना चाहते हैं, एक कुत्ता जोड़ना चाहते हैं, या किसी कार का रंग बदलना चाहते हैं।

वर्तमान AI के साथ समस्या:
अभी, अधिकांश AI वीडियो एडिटर दो अलग-अलग प्रकार के श्रमिकों की तरह हैं:

  1. "विशेषज्ञ" (Expert) कार्यकर्ता: यह कार्यकर्ता सटीकता में अद्भुत है। यदि आप उन्हें एक मास्क (एक डिजिटल स्टेंसिल) देते हैं कि "इस व्यक्ति को हटा दें," तो वे इसे पूरी तरह से करते हैं। लेकिन वे धीमे और कष्टदायक हैं क्योंकि आपको हर एक संपादन के लिए खुद स्टेंसिल बनाना पड़ता है।
  2. "सामान्यवादी" (Generalist) कार्यकर्ता: यह कार्यकर्ता तेज़ है और इसे स्टेंसिल की आवश्यकता नहीं होती है। आप बस कहते हैं, "व्यक्ति को हटा दो," और वे कोशिश करते हैं। लेकिन वे अक्सर भ्रमित हो जाते हैं। वे गलत व्यक्ति को हटा सकते हैं, या वे गलती से बैकग्राउंड को भी मिटा सकते हैं क्योंकि उन्हें ठीक से पता नहीं होता कि कहाँ देखना है।

समाधान: VideoCoF
VideoCoF (वीडियो चेन-ऑफ-फ्रेम्स) के पीछे के शोधकर्ताओं ने AI को सोचने का एक नया तरीका सिखाने का निर्णय लिया। केवल अनुमान लगाने या स्टेंसिल की आवश्यकता होने के बजाय, उन्होंने AI को तीन-चरणीय प्रक्रिया का पालन करने के लिए बनाया: देखें → तर्क दें → एडिट करें (See → Reason → Edit)।

इसे अपनी फिल्म के लिए एक साधारण कैमरा ऑपरेटर के बजाय एक स्मार्ट डायरेक्टर को काम पर रखने जैसा समझें।

"देखें, तर्क दें, एडिट करें" की प्रक्रिया

यहाँ बताया गया है कि VideoCoF कैसे काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:

1. देखें (तैयारी) [SEE (The Setup)]
AI मूल वीडियो को देखता है। यह निर्देशक द्वारा कच्चे फुटेज को समझने के लिए देखने जैसा है।

2. तर्क दें ("भूतिया" स्केच) [REASON (The "Ghost" Sketch)]
यही जादुई हिस्सा है। वीडियो को वास्तव में बदलने से पहले, यह पहले एक "रीजनिंग फ्रेम" (Reasoning Frame) बनाता है।

  • उपमा: कल्पना करें कि AI एक चित्रकार है। अंतिम कृति बनाने से पहले, वह कैनवास पर एक धुंधला, ग्रे स्केच बनाता है ताकि यह दिखाया जा सके कि बदलाव बिल्कुल कहाँ होंगे। यह ऐसा है जैसे AI खुद से कह रहा हो, "ठीक है, मुझे निर्देश मिला है 'बेज रंग की पैंट वाली महिला को हटाओ।' मैं पहले उसे एक भूतिया ग्रे रंग में हाईलाइट करूँगा ताकि यह सुनिश्चित हो सके कि मैं सही व्यक्ति को देख रहा हूँ।"
  • यह क्यों मायने रखता है: AI को काम करने से पहले यह "सोचने" के लिए मजबूर करके कि बदलाव कहाँ होगा, यह भ्रम की समस्या को हल करता है। यह AI को गलत व्यक्ति को मिटाने से रोकता है।

3. एडिट करें (अंतिम स्पर्श) [EDIT (The Final Touch)]
एक बार जब AI ने सही स्थान को "तर्क" देकर हाईलाइट कर लिया है, तो वह उच्च सटीकता के साथ वास्तविक संपादन (महिला को हटाना, कुत्ता जोड़ना, आदि) करता है।

"टाइम-ट्रैवल" ट्रिक (RoPE अलाइनमेंट)

पेपर में एक और शानदार ट्रिक है। आमतौर पर, यदि आप AI को छोटे वीडियो (जैसे 30 सेकंड) पर प्रशिक्षित करते हैं, तो यह लंबे वीडियो (जैसे 5 मिनट) को एडिट करने के लिए भ्रमित हो जाता है। यह समय का ट्रैक खो देता है और मोशन (गति) गड़बड़ा जाती है।

VideoCoF इस समस्या को ठीक करने के लिए एक चतुर नंबरिंग सिस्टम (RoPE Alignment) का उपयोग करता है।

  • उपमा: कल्पना करें कि आप एक बच्चे को कदम गिनना सिखा रहे हैं। यदि आप उन्हें एक छोटी सैर के लिए "कदम 1, कदम 2, कदम 3" सिखाते हैं, तो वे लंबी पैदल यात्रा में खो सकते हैं।
  • VideoCoF AI को नए वीडियो भागों के लिए अपना "स्टेप काउंटर" रीसेट करना सिखाता है। यह AI को बताता है: "मूल वीडियो कदम 1 से 30 तक है। 'सोचने' वाला हिस्सा कदम 0 है। नया संपादित हिस्सा फिर से कदम 1 से शुरू होता है।"
  • परिणाम: यह AI को उन वीडियो को एडिट करने की अनुमति देता है जो उसके प्रशिक्षण काल से 16 गुना लंबे हैं, बिना मोशन के धुंधले होने या पात्रों के अचानक गायब (teleporting) होने के।

यह एक बड़ी बात क्यों है?

  1. स्टेंसिल की आवश्यकता नहीं: आपको मास्क बनाने की ज़रूरत नहीं है। आप बस जो चाहते हैं उसे टाइप करते हैं, और AI खुद ही समझ जाता है कि "कहाँ" और "क्या" करना है।
  2. अत्यधिक कुशल: शोधकर्ताओं ने इस शक्तिशाली मॉडल को केवल 50,000 वीडियो उदाहरणों पर प्रशिक्षित किया। अन्य शीर्ष मॉडलों को इस स्तर की गुणवत्ता प्राप्त करने के लिए 1 मिलियन उदाहरणों की आवश्यकता थी। यह एक छोटी मैनुअल पढ़कर रेस कार चलाना सीखने जैसा है, बजाय इसके कि 10 साल तक ड्राइविंग सीखी जाए।
  3. जटिल दृश्यों को संभालता है: यदि दो लोग एक जैसी शर्ट पहने हुए हैं, तो VideoCoF उनमें अंतर कर सकता है (जैसे, "बाएँ वाले को हटा दें") क्योंकि वह पहले स्थान के बारे में "तर्क" (reasoned) करता है।

संक्षेप में:
VideoCoF एक वीडियो एडिटर को "सोचने वाली टोपी" (thinking cap) देने जैसा है। केवल अंधे होकर अनुमान लगाने या किसी इंसान द्वारा स्क्रीन की ओर इशारा किए जाने की प्रतीक्षा करने के बजाय, AI पहले यह सोचने के लिए रुकता है कि सटीक रूप से क्रिया कहाँ होनी चाहिए, एक मानसिक मानचित्र बनाता है, और फिर पूर्णता के साथ संपादन करता है। यह वीडियो एडिटिंग को पहले से कहीं अधिक तेज़, स्मार्ट और लंबे तथा जटिल वीडियो को संभालने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →