← नवीनतम पेपर
💻 computer science

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

यह शोध पत्र Goku को प्रस्तुत करता है, जो जटिल मल्टी-टास्क और संरचनात्मक हेरफेर को कवर करने वाले 2 मिलियन इंस्ट्रक्शन-अलाइन्ड वीडियो एडिटिंग पेयर्स का एक बड़े पैमाने का डेटासेट है, साथ ही इसमें Goku-Edit मॉडल और Goku-Bench बेंचमार्क भी शामिल है, ताकि सरल अपीयरेंस परिवर्तनों से परे इंस्ट्रक्शन-आधारित वीडियो एडिटिंग क्षमताओं को उन्नत किया जा सके।

मूल लेखक: Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई वीडियो एडिटर है जो केवल एक वाक्य टाइप करके किसी भी फिल्म में कुछ भी बदल सकता है, जैसे, "कुत्ते को तेज़ी से दौड़ने दो और आसमान को बैंगनी कर दो।" लंबे समय तक, ये जादुई उपकरण अनाड़ी प्रशिक्षुओं (apprentices) की तरह थे: वे शर्ट का रंग बदल सकते थे या किसी फालतू वस्तु को हटा सकते थे, लेकिन यदि आपने उनसे किसी पात्र को कमरे के एक कोने से दूसरे कोने तक ले जाने या कैमरा एंगल बदलने के लिए कहा, तो वे भ्रमित हो जाते, रुक जाते, या सब कुछ बिगाड़ देते।

यह पेपर Goku को पेश करता है, जो एक विशाल नया प्रोजेक्ट है जिसे इन जादुई संपादकों को वास्तविक उस्ताद (masters) बनाने के लिए प्रशिक्षित करने के लिए डिज़ाइन किया गया है। यहाँ बताया गया है कि उन्होंने क्या किया, जिसे सरल भाषा में समझाया गया है:

1. समस्या: "एक ही काम करने वाले" (One-Trick Pony) डेटासेट

इससे पहले, इन AI वीडियो एडिटरों के लिए प्रशिक्षण डेटा एक ऐसी लाइब्रेरी की तरह था जिसमें केवल एक विषय पर किताबें भरी हों: जैसे कार का रंग बदलना। यदि आप एक कार चलाना सीखना चाहते (विषय को हिलाना/मूव करना) या दृश्य बदलना चाहते (कैमरा मूवमेंट), तो उस लाइब्रेरी में ऐसी कोई किताबें नहीं थीं। AI मॉडल अटके हुए थे क्योंकि वे केवल सरल "पेंट-बाय-नंबर्स" जैसे कार्यों को ही जानते थे।

2. समाधान: "Goku" लाइब्रेरी

शोधकर्ताओं ने Goku बनाया, जो 20 लाख (2 million) वीडियो जोड़ों वाला एक विशाल डेटासेट है। इसे एक विशाल, हाई-टेक ट्रेनिंग जिम के रूप में सोचें।

  • इसके अंदर क्या है? पिछली लाइब्रेरी के विपरीत, इसमें जटिल चुनौतियाँ शामिल हैं। इसमें ऐसे वीडियो शामिल हैं जहाँ कैमरा चारों ओर घूमता है (pan), जहाँ एक व्यक्ति कमरे के एक तरफ से दूसरी तरफ जाता है, और जहाँ एक साथ कई बदलाव होते हैं (जैसे, "शर्ट बदलो और टोपी भी पहना दो")।
  • उन्होंने इसे कैसे बनाया? उन्होंने केवल इन वीडियो की शूटिंग नहीं की; उन्होंने इन्हें बनाने के लिए एक रोबोट फैक्ट्री बनाई। उन्होंने जटिल अनुरोधों को छोटे, प्रबंधनीय चरणों में तोड़ने के लिए उन्नत AI का उपयोग किया। उदाहरण के लिए, कुत्ते को दौड़ने के लिए बनाने के लिए, पहले उन्होंने AI को एक एकल छवि में कुत्ते को दौड़ना सिखाया, फिर उस छवि को एक सहज वीडियो में कैसे बदला जाए, यह सिखाया।
  • गुणवत्ता नियंत्रण (Quality Control): यह सुनिश्चित करने के लिए कि वीडियो बेकार न हों, उन्होंने एक "ट्रिपल-चेक" सुरक्षा प्रणाली स्थापित की। प्रत्येक वीडियो की तीन बार एक सुपर-स्मार्ट AI (Gemini) द्वारा जाँच की गई ताकि यह सुनिश्चित हो सके कि निर्देशों का पालन किया गया है, गति वास्तविक दिख रही है, और वीडियो में कोई गड़बड़ी (glitch) नहीं है। उन्होंने केवल बेहतरीन 20 लाख को रखने के लिए लगभग 88% प्रयासों को हटा दिया।

3. नया टूल: Goku-Edit

इस नई लाइब्रेरी के साथ, उन्होंने एक नया वीडियो एडिटर बनाया जिसे Goku-Edit कहा जाता है।

  • दिमाग (The Brain): केवल टेक्स्ट पढ़ने के बजाय, यह एडिटर एक "मल्टीमॉडल लार्ज लैंग्वेज मॉडल" (MLLM) का उपयोग करता है। इसे एक ऐसे एडिटर के रूप में सोचें जिसके पास वास्तव में कहानी और निर्देशों को समझने वाला एक दिमाग है, न कि केवल कीवर्ड्स को मिलाने वाला।
  • दो-हाथों वाला दृष्टिकोण (The Two-Handed Approach): सबसे बड़ा नवाचार यह है कि इस एडिटर के दो "हाथ" मिलकर काम करते हैं:
    • हाथ A (आर्किटेक्ट/Architect): यह हाथ एक मोटा नक्शा (मास्क) बनाता है कि बदलाव कहाँ होने चाहिए। यह संरचना और गति पर ध्यान केंद्रित करता है।
    • हाथ B (पेंटर/Painter): यह हाथ विवरण, रंगों और बनावट (textures) पर ध्यान केंद्रित करता है।
    • यह क्यों महत्वपूर्ण है: "कहाँ" को "क्या" से अलग करके, एडिटर भ्रमित नहीं होता है। वह जानता है कि कुत्ते को कहाँ हिलाना है बिना गलती से कुत्ते के बालों को नीला किए।
  • "Spatial CFG": यह एक फैंसी शब्द है जिसका अर्थ है एक सुरक्षा जाल (safety net)। यह सुनिश्चित करता है कि जब एडिटर कोई बदलाव करता है, तो वह गलती से बाकी वीडियो को खराब न कर दे। यह बदलावों को सटीक और सीमित रखता है।

4. परीक्षण: Goku-Bench

अपने नए एडिटर को सर्वश्रेष्ठ साबित करने के लिए, उन्होंने Goku-Bench नामक एक नया परीक्षण बनाया।

  • साधारण परीक्षणों के बजाय, उन्होंने AI को 1,000 कठिन चुनौतियाँ दीं, जैसे "बिल्ली के कूदने के दौरान कैमरा को बाईं ओर घुमाएं।"
  • उन्होंने परिणामों को ग्रेड करने के लिए 7 नए तरीकों का उपयोग किया, जिसमें यह जाँच की गई कि "क्या भौतिकी (physics) समझ में आती है?" और "क्या कैमरा सुचारू रूप से चला?"
  • परिणाम: Goku-Edit ने सभी ओपन-सोर्स मॉडल्स को पीछे छोड़ दिया, जिससे निर्देशों का पालन करने की इसकी क्षमता में 8% तक सुधार हुआ। यह चीजों को इधर-उधर करने और जटिल, बहु-चरणीय अनुरोधों को संभालने में विशेष रूप से अच्छा था जहाँ अन्य मॉडल विफल रहे थे।

सारांश

संक्षेप में, पेपर कहता है: "हमने एक विशाल, उच्च-गुणवत्ता वाली प्रशिक्षण लाइब्रेरी (Goku) बनाई है जो AI को जटिल वीडियो एडिटिंग सिखाती है, न कि केवल साधारण रंग बदलना। हमने एक नया एडिटर (Goku-Edit) बनाया है जो संरचना और विवरणों को अलग-अलग समझने के लिए दो-भाग वाली प्रणाली का उपयोग करता है, और हमने एक नए, कठिन परीक्षण (Goku-Bench) पर साबित किया है कि यह किसी भी अन्य चीज़ से बेहतर काम करता है।"

उन्होंने यह दावा नहीं किया कि यह तकनीक अस्पतालों या विशिष्ट नैदानिक (clinical) उपयोगों के लिए तैयार है; उन्होंने पूरी तरह से वीडियो एडिटिंग को स्मार्ट, अधिक लचीला और जटिल रचनात्मक अनुरोधों को संभालने में अधिक सक्षम बनाने पर ध्यान केंद्रित किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →