← नवीनतम पेपर
💻 computer science

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning

यह शोधपत्र SyncDPO प्रस्तुत करता है, जो एक कुशल पोस्ट-ट्रेनिंग फ्रेमवर्क है जो पारंपरिक सुपरवाइज्ड फाइन-ट्यूनिंग की सीमाओं को दूर करने के लिए ऑन-द-फ्लाई रूल-बेस्ड नेगेटिव कंस्ट्रक्शन और करिकुलम लर्निंग के साथ डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन का लाभ उठाकर वीडियो-ऑडियो संयुक्त पीढ़ी में टेम्पोरल सिंक्रोनाइज़ेशन को बढ़ाता है।

मूल लेखक: Xin Cheng, Xihua Wang, Ying Ba, Yuyue Wang, Kaisi Guan, Yinbo Wang, Wenpu Li, Ruihua Song

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Cheng, Xihua Wang, Ying Ba, Yuyue Wang, Kaisi Guan, Yinbo Wang, Wenpu Li, Ruihua Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक ऐसी फिल्म बनाना सिखाने की कोशिश कर रहे हैं जहाँ ध्वनि और चित्र पूरी तरह से मेल खाते हों। यदि रोबोट देखता है कि एक व्यक्ति ताली बजा रहा है, तो "ताली" की आवाज़ ठीक उसी मिलीसेकंड में आनी चाहिए जब हाथ आपस में टकराते हैं। यदि आवाज़ एक सेकंड के बहुत छोटे हिस्से की देरी से आती है, तो फिल्म नकली और अजीब लगती है।

यह पेपर AI वीडियो जनरेटरों में इस टाइमिंग की समस्या को ठीक करने के लिए SyncDPO नामक एक नई प्रशिक्षण विधि पेश करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

समस्या: "लैगी" (Laggy) रोबोट

वर्तमान में, AI मॉडल वीडियो बनाने में बहुत अच्छे हैं जो दिखने में वास्तविक लगते हैं और ध्वनि भी सामान्य रूप से सही होती है। हालाँकि, वे अक्सर टाइमिंग (समय निर्धारण) में संघर्ष करते हैं।

  • उपमा: एक खराब कराओके मशीन के बारे में सोचें जहाँ गायक की आवाज़ संगीत के साथ थोड़ी आउट-ऑफ-सिंक होती है। आप शब्द सुन सकते हैं, और आप संगीत भी सुन सकते हैं, लेकिन वे आपस में मेल नहीं खाते।
  • पुराना तरीका (SFT): पहले, इसे ठीक करने के लिए इंजीनियरों ने "सुपरवाइज्ड फाइन-ट्यूनिंग" (Supervised Fine-Tuning) नामक विधि का उपयोग किया था। कल्पना कीजिए कि यह एक शिक्षक की तरह है जो रोबोट को सही फिल्म दिखाता है और कहता है, "ठीक वैसा ही वीडियो बनाने की कोशिश करो जैसा यह है।" रोबोट चित्र और ध्वनि की नकल करने की कोशिश करता है, लेकिन क्योंकि थोड़ा सा गलत समय होने पर मिलने वाला "दंड" बहुत छोटा होता है, रोबोट छोटी-छोटी टाइमिंग की गलतियाँ करता रहता है। यह एक ऐसे छात्र की तरह है जो जानता है कि उत्तर "5" है लेकिन वह "5.001" लिखता रहता है क्योंकि शिक्षक ने दशमलव (decimal) को सख्ती से ठीक नहीं किया।

समाधान: "गलत उदाहरण" का सबक

लेखकों ने महसूस किया कि रोबोट को सटीक टाइमिंग सिखाने के लिए, आपको केवल उसे सही उत्तर दिखाने की आवश्यकता नहीं है; आपको उसे गलत उत्तर दिखाने की भी आवश्यकता है और कहना है, "यह बुरा है, ऐसा मत करो।"

उन्होंने डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization - DPO) नामक तकनीक का उपयोग किया।

  • उपमा: केवल रोबोट को एक आदर्श फिल्म दिखाने के बजाय, आप उसे दो क्लिप दिखाते हैं:
    1. विजेता (The Winner): एक क्लिप जहाँ बंदूक चलने की आवाज़ ठीक उसी समय आती है जब बंदूक चलती है।
    2. हारने वाला (The Loser): एक क्लिप जहाँ बंदूक चलने की आवाज़ बंदूक चलने के दो सेकंड बाद आती है।
      रोबोट सीखता है, "आह! मुझे दूसरे वाले से बचना चाहिए।" यह उसकी टाइमिंग की समझ को तेज करता है।

नवाचार: "गलत उदाहरणों" को तुरंत बनाना

आमतौर पर, इन "हारने वाले" क्लिप्स को बनाना महंगा और धीमा होता है। आपको कई वीडियो बनाने होंगे, मनुष्यों द्वारा उन्हें रैंक करने का इंतज़ार करना होगा, या गलतियों को खोजने के लिए अन्य जटिल AI का उपयोग करना होगा। यह 100 खराब फिल्में देखने के लिए एक फिल्म समीक्षक को काम पर रखने जैसा है ताकि एक भी खराब टाइमिंग वाला उदाहरण मिल सके।

SyncDPO एक "नियम-आधारित शेफ" (Rule-Based Chef) बनकर खेल बदल देता है।
एक बुरा उदाहरण खोजने के लिए पूरा नया भोजन पकाने के बजाय, शेफ एक आदर्श भोजन लेता है और साधारण नियमों का उपयोग करके उसे तुरंत बिगाड़ देता है:

  • गति बढ़ा दें (Speed it up): वीडियो को तेज़ करें लेकिन ऑडियो को धीमा रखें (या इसके विपरीत)।
  • बदल दें (Swap it): किसी दूसरे वीडियो का ऑडियो लें और उसे वर्तमान वीडियो पर पेस्ट कर दें।
  • देरी करें (Delay it): ध्वनि को कुछ सेकंड आगे या पीछे धकेल दें।
  • छिपा दें (Hide it): ऑडियो के किसी हिस्से को म्यूट कर दें या वीडियो को फ्रीज कर दें।

ये "बिगड़े हुए" संस्करण डेटा लोड होते समय तुरंत बनाए जाते हैं। कोई अतिरिक्त इंसान नहीं, कोई अतिरिक्त प्रतीक्षा नहीं, और कोई अतिरिक्त लागत नहीं।

रणनीति: "वीडियो गेम" दृष्टिकोण (Curriculum Learning)

लेखकों ने यह भी देखा कि यदि वे रोबोट को बहुत ही स्पष्ट रूप से गलत उदाहरण (जैसे 10 सेकंड की देरी) दिखाना शुरू करते हैं, तो वह बहुत आसानी से सीख जाता है। लेकिन यदि वे बहुत मामूली गलतियों (जैसे 0.1 सेकंड की देरी) के साथ शुरू करते हैं, तो रोबोट भ्रमित हो जाता है और सीख नहीं पाता है।

इसलिए, उन्होंने करिकुलम लर्निंग (Curriculum Learning) रणनीति का उपयोग किया, जो एक वीडियो गेम की तरह है:

  1. लेवल 1 (आसान): स्पष्ट गलतियों (जैसे पूरी तरह से अलग ध्वनि के साथ ऑडियो बदलना) के साथ शुरू करें। रोबोट सीखता है कि "ध्वनि चित्र से मेल खानी चाहिए।"
  2. लेवल 2 (कठिन): धीरे-धीरे सूक्ष्म गलतियों (जैसे वीडियो को थोड़ा तेज़ करना) की ओर बढ़ें। अब रोबोट को बारीक, सटीक टाइमिंग सीखने की आवश्यकता है।

कठिनाई को धीरे-धीरे बढ़ाकर, रोबोट सिंक्रोनाइज़ेशन (तालमेल) का उस्ताद बन जाता है।

परिणाम

इस पेपर का परीक्षण चार अलग-अलग प्रकार के वीडियो पर किया गया:

  • लोग बात कर रहे हैं (लिप-सिंक)।
  • बंदूक की आवाज़ और विस्फोट।
  • जानवर शोर मचा रहे हैं।
  • सामान्य पर्यावरणीय ध्वनियाँ।

परिणाम:
SyncDPO पिछले तरीकों की तुलना में ध्वनि और चित्र को संरेखित (align) करने में काफी बेहतर था।

  • इसने "ताली" की आवाज़ ठीक उसी समय कराई जब हाथ मिले।
  • इसने बंदूक की आवाज़ ठीक उसी समय कराई जब बंदूक चली।
  • यह उन प्रकार के वीडियो पर भी अच्छी तरह से काम करता है जिन्हें उसने पहले नहीं देखा था (जनरलाइजेशन)।

महत्वपूर्ण रूप से, लेखकों ने पाया कि इस पद्धति ने वीडियो या ऑडियो की गुणवत्ता को खराब नहीं किया; इसने केवल टाइमिंग को एकदम सटीक बना दिया। उन्होंने परिणामों को देखने के लिए मनुष्यों का भी उपयोग किया, और मनुष्यों ने लगातार SyncDPO वीडियो को प्राथमिकता दी क्योंकि वे अधिक "वास्तविक" और इमर्सिव (immersive) महसूस हुए।

सारांश

संक्षेप में, SyncDPO AI को ध्वनि और वीडियो को सिंक करने के लिए प्रशिक्षित करने का एक स्मार्ट तरीका है। केवल अच्छे उदाहरणों की नकल करने के बजाय, यह साधारण नियमों का उपयोग करके तुरंत "बुरे" उदाहरण बनाकर AI को सिखाता है, जो आसान गलतियों से शुरू होकर सूक्ष्म और सटीक गलतियों तक जाता है। परिणाम स्वरूप, AI-जनरेटेड वीडियो में ध्वनि और क्रिया पूरी तरह से एक साथ फिट बैठते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →