Aurora: Unified Video Editing with a Tool-Using Agent
यह शोध पत्र ऑरोरा (Aurora) प्रस्तुत करता है, जो एक एजेंटिक वीडियो एडिटिंग फ्रेमवर्क है जो कच्चे उपयोगकर्ता अनुरोधों को संरचित संपादन योजनाओं (structured edit plans) में अनुवाद करने के लिए एक टूल-ऑगमेंटेड विजन-लैंग्वेज मॉडल का उपयोग करता है, जिससे यूनिफाइड वीडियो डिफ्यूजन ट्रांसफॉर्मर्स के प्रदर्शन को बढ़ाने के लिए टेक्स्टुअल और विजुअल अंडरस्पेसिफिकेशन (underspecification) को हल किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक होम वीडियो एडिट करना चाहते हैं, लेकिन आपके दिमाग में केवल एक धुंधला सा विचार है। आप एक वीडियो एडिटर से कहते हैं, "बैकग्राउंड में दिख रहे आदमी को एक सुपरहीरो जैसा बना दो," लेकिन आप यह नहीं बताते कि वह कौन सा सुपरहीरो है, और न ही आप यह बताते कि वह आदमी ठीक कहाँ खड़ा है।
वर्तमान AI वीडियो एडिटिंग की दुनिया में, यह एक समस्या है। अधिकांश उन्नत AI मॉडल बेहद प्रतिभाशाली लेकिन शाब्दिक अर्थों में काम करने वाले शेफ (रसोइयों) की तरह हैं। वे कुछ भी बना सकते हैं, लेकिन तभी जब आप उन्हें एक सटीक रेसिपी और सटीक माप के साथ सही सामग्री दें। यदि आप सिर्फ कहते हैं, "इसे तीखा बना दो," तो वे मिर्च के बजाय नमक डाल सकते हैं, या वे खाना बनाने से मना भी कर सकते हैं क्योंकि उन्हें नहीं पता कि "तीखा" दिखने का क्या मतलब है।
Aurora एक नया सिस्टम है जो इसे हल करता है, क्योंकि यह शेफ के सामने एक स्मार्ट असिस्टेंट (स्मार्ट सहायक) जोड़ देता है।
समस्या: "गायब सामग्री" का अंतर (The "Missing Ingredients" Gap)
वर्तमान वीडियो एडिटिंग AI मॉडल शक्तिशाली हैं। वे वस्तुओं को बदल सकते हैं, लोगों को हटा सकते हैं, या बैकग्राउंड बदल सकते हैं। लेकिन उनका एक सख्त नियम है: उन्हें शुरू करने से पहले सब कुछ तैयार चाहिए।
- यदि आप एक शर्ट को "बर्बरी चेक स्कार्फ" (Burberry check scarf) से बदलना चाहते हैं, तो AI को उस विशिष्ट स्कार्फ की एक तस्वीर चाहिए।
- यदि आप किसी व्यक्ति को हटाना चाहते हैं, तो AI को एक मैप (मास्क) चाहिए जो दिखाता हो कि वह व्यक्ति ठीक कहाँ है।
- यदि आप कहते हैं "इसे तेज़ करो," तो AI को जानना होगा कि "यह" क्या है।
असली लोग आमतौर पर ये विवरण नहीं देते। हम अस्पष्ट निर्देश देते हैं। शोध पत्र इसे "अल्प-विशिष्टीकरण" (underspecification) कहता है। AI काम करने के लिए तैयार है, लेकिन उपयोगकर्ता ने उसे वे उपकरण नहीं दिए हैं जिनकी उसे शुरुआत करने के लिए आवश्यकता है।
समाधान: "Aurora" की टीम
लेखकों ने Aurora बनाया है, जो दो लोगों की एक टीम की तरह काम करता है:
एजेंट (द स्मार्ट असिस्टेंट - स्मार्ट सहायक): यह एक बड़ा AI मॉडल (एक VLM) है जो एक प्रोजेक्ट मैनेजर के रूप में कार्य करता है। यह आपके अस्पष्ट अनुरोध ("महिला की शर्ट को बर्बरी स्कार्फ जैसा बना दो") को सुनता है और समझ जाता है, "रुको, मेरे पास उस स्कार्फ की तस्वीर नहीं है, और मुझे यह भी जानना होगा कि महिला की शर्ट ठीक कहाँ है।"
- यह खरीदारी करता है: यह वेब पर उस बर्बरी स्कार्फ की तस्वीर खोजने के लिए एक टूल का उपयोग करता है।
- यह एक नक्शा बनाता है: यह वीडियो में महिला की शर्ट की सटीक रूपरेखा (आउटलाइन) खोजने के लिए एक टूल का उपयोग करता है।
- यह रेसिपी को फिर से लिखता है: यह आपके अनौपचारिक अनुरोध को एक अत्यंत विस्तृत, तकनीकी निर्देश में बदल देता है जिसे वीडियो एडिटर पूरी तरह से समझ सके।
वीडियो मॉडल (द शेफ - रसोइया): यह वास्तविक वीडियो एडिटिंग इंजन ("डिफ्यूजन ट्रांसफॉर्मर") है। यह आपसे सीधे बात नहीं करता है। इसे केवल एजेंट से प्राप्त पूर्ण, पूर्व-पैकेज किए गए निर्देश मिलते हैं। यह मूल वीडियो, नए स्कार्फ की तस्वीर और शर्ट की आउटलाइन लेता है, और जादुई एडिटिंग करता है।
यह असल जिंदगी में कैसे काम करता है
शोध पत्र इसके उदाहरण दिखाता है:
- परिदृश्य A: आप कहते हैं, "महिला की शर्ट को बर्बरी स्कार्फ से बदल दो।"
- Aurora के बिना: AI एक सामान्य स्कार्फ का अनुमान लगा सकता है या विफल हो सकता है।
- Aurora के साथ: एजेंट एक असली बर्बरी स्कार्फ की इमेज खोजता है, वीडियो में शर्ट को ढूंढता है, और वीडियो मॉडल को बताता है: "यहाँ वीडियो है, यहाँ सटीक स्कार्फ की इमेज है, और यहाँ शर्ट की सटीक लोकेशन है। अब शुरू करो।"
- परिदृश्य B: आप कहते हैं, "पैदल यात्री (pedestrian) को हटा दो।"
- Without Aurora: AI गलत व्यक्ति को हटा सकता है या पीछे एक गंदा खाली स्थान छोड़ सकता है।
- With Aurora: एजेंट पहचान लेता है कि कौन सा व्यक्ति पैदल यात्री है, उनके चारों ओर एक सटीक रूपरेखा बनाता है, और वीडियो मॉडल को ठीक से बताता है कि किसे मिटाना है और बैकग्राउंड को किससे भरना है।
परिणाम: एक नया बेंचमार्क
शोधकर्ताओं ने एक नया टेस्ट बनाया जिसे AgentEdit-Bench कहा जाता है। यह टेस्ट विशेष रूप से अस्पष्ट निर्देशों के साथ AI को चुनौती देने के लिए बनाया गया है।
- जब उन्होंने इन अस्पष्ट अनुरोधों पर मानक AI मॉडल का परीक्षण किया, तो उनका स्कोर खराब (लगभग 67-70%) रहा।
- जब उन्होंने इसमें Aurora Agent को जोड़ा, तो स्कोर काफी बढ़ गया (87.9% तक)।
शोध पत्र यह भी दिखाता है कि यह "स्मार्ट असिस्टेंट" केवल उनके विशिष्ट वीडियो मॉडल के लिए ही अच्छा नहीं है। उन्होंने इसे अन्य वीडियो एडिटिंग मॉडल्स के साथ भी टेस्ट किया, और एजेंट ने उन्हें बेहतर प्रदर्शन करने में मदद की। यह किसी भी शेफ को एक सार्वभौमिक अनुवादक (universal translator) देने जैसा है; चाहे कोई भी खाना बना रहा हो, अगर सामग्री को पहले सही तरीके से तैयार किया जाए, तो खाना बेहतर ही बनेगा।
सारांश
Aurora केवल वीडियो एडिट नहीं करता है; यह एडिटिंग शुरू करने से पहले समझता है कि आपका मतलब क्या है। यह एक टूल-उपयोग करने वाले एजेंट के रूप में काम करके मानवीय अस्पष्टता और मशीन की सटीकता के बीच के अंतर को पाटता है, जो गायब तस्वीरें इकट्ठा करता है, गायब नक्शे बनाता है, और स्पष्ट निर्देश लिखता है, जिससे यह सुनिश्चित होता है कि अंतिम वीडियो आपकी कल्पना के बिल्कुल अनुरूप हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।