← नवीनतम पेपर
💻 computer science

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

यह शोध पत्र ScenA को प्रस्तुत करता है, जो एक संदर्भ-संचालित मल्टी-स्पीकर ऑडियो जनरेशन विधि है जो यथार्थवादी, ओवरलैपिंग संवाद दृश्यों को परिवेशी शोर के साथ बनाने के लिए इन-द-वाइल्ड डेटा पर प्री-ट्रेन किए गए टेक्स्ट-टू-ऑडियो फ्लो-मैचिंग मॉडल का लाभ उठाता है, जो संदर्भ आवाजों और फ्री-फॉर्म प्रॉम्प्ट्स पर आधारित होता है, जबकि एक हाई-नॉइज़-बायस्ड ट्रेनिंग रणनीति के माध्यम से "रेफरेंस शॉर्टकट" चुनौती पर विजय प्राप्त करता है।

मूल लेखक: Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दो अलग-अलग अभिनेताओं, बैकग्राउंड म्यूजिक और एक व्यस्त कैफे की आवाज़ के साथ एक छोटा, जीवंत रेडियो प्ले बनाना चाहते हैं।

पुराना तरीका (द "असेंबली लाइन" अप्रोच)
पहले, यदि आप यह दृश्य बनाना चाहते, तो आपको एक क्लिपबोर्ड के साथ एक सख्त फिल्म निर्देशक की तरह काम करना पड़ता। आपको करना होता:

  1. एक स्क्रिप्ट लिखना जो बताता हो कि कौन कब बोलता है (जैसे, "लाइन 1: स्पीकर A," "लाइन 2: स्पीकर B")।
  2. स्पीकर A के लिए आवाज़ अलग से जेनरेट करना।
  3. स्पीकर B के लिए आवाज़ अलग से जेनरेट करना।
  4. क्लिप्स को मैन्युअल रूप से आपस में जोड़ना।
  5. ऊपर से बैकग्राउंड शोर (noise) जोड़ना।

परिणाम अक्सर "साफ" लेकिन नकली लगता था, जैसे दो लोग वैक्यूम में बात कर रहे हों, क्योंकि सिस्टम को यह पता नहीं होता था कि उन्हें कैसे ओवरलैप होना चाहिए, साथ में हंसना चाहिए, या कमरे की ध्वनिकी (acoustics) के प्रति कैसी प्रतिक्रिया देनी चाहिए।

नया तरीका (SCENA: द "इम्प्रोवाइजेशनल डायरेक्टर")
यह शोध पत्र SCENA नामक एक नया सिस्टम पेश करता है। क्लिपबोर्ड के बजाय, आप AI को साधारण अंग्रेजी में एक मुक्त-प्रवाह वाली कहानी का विवरण देते हैं।

  • प्रॉम्प्ट (The Prompt): आप टाइप करते हैं: "धीमा पियानो बज रहा है। पहला वक्ता तेज़ी से 'हाय!' कहता है। दूसरा वक्ता उसी समय 'वेलकम!' चिल्लाता है, और उनकी आवाज़ें पूरी तरह से एक साथ मिल जाती हैं।"
  • रेफरेंस (The References): आप उन आवाजों के दो छोटे ऑडियो क्लिप अपलोड करते हैं जिन्हें आप उपयोग करना चाहते हैं (आवाज़ 1 और आवाज़ 2)।
  • जादू (The Magic): AI आपकी कहानी पढ़ता है और तुरंत पूरा दृश्य जेनरेट कर देता है। वह तय करता है कि कौन कब बोलेगा, आवाज़ों को स्वाभाविक रूप से ओवरलैप करता है, पियानो जोड़ता है, और यहाँ तक कि कमरे को वास्तविक ध्वनि देता है—यह सब एक ही बार में।

बड़ी समस्या जिसे उन्होंने हल किया: "चीटिंग शॉर्टकट"

जब शोधकर्ताओं ने पहली बार AI को इस तरह से सिखाने की कोशिश की, तो इसने "चीटिंग" करने की कोशिश की।

कल्पना कीजिए कि एक छात्र एक परीक्षा दे रहा है जहाँ उसे किसी व्यक्ति की फोटो को एक विवरण से मिलाना है।

  • लक्ष्य: छात्र को विवरण पढ़ना चाहिए ("लाल टोपी वाला आदमी") और फिर मिलान करने वाली फोटो ढूंढनी चाहिए।
  • चीटिंग: छात्र उस फोटो को देखता है जिसे उसे हल करना है, लाल टोपी देखता है, और बस उस फोटो को चुन लेता है जो दिखने में सबसे अधिक समान है, विवरण को पूरी तरह से अनदेखा कर देता है।

AI के मामले में, ट्रेनिंग के दौरान, "टेस्ट" ऑडियो का एक शोर वाला, बिखरा हुआ संस्करण था। AI ने महसूस किया कि वह बस बिखरे हुए शोर को सुन सकता है, उस आवाज़ को ढूंढ सकता है जो सबसे अधिक समान सुनाई देती है, और उसकी नकल कर सकता है। उसे यह जानने के लिए आपके टेक्स्ट प्रॉम्प्ट को पढ़ने की ज़रूरत नहीं थी कि कौन बोल रहा है। यह ट्रेनिंग के दौरान बहुत अच्छा काम करता था (कम एरर स्कोर), लेकिन जब आप वास्तवв में इसका उपयोग करते हैं, तो यह बुरी तरह विफल हो जाता है, क्योंकि वास्तविक जनरेशन शुद्ध सन्नाटे (pure silence) से शुरू होती है (चीटिंग करने के लिए कोई शोर नहीं होता)। AI ने आपके निर्देशों को सुनने के बजाय शॉर्टकट ढूंढना सीख लिया था।

समाधान: "हाई-नॉइज़ डाइट"

इसे ठीक करने के लिए, शोधकर्ताओं ने AI के लिए "ट्रेनिंग डाइट" बदल दी।

सामान्य तौर पर, AI ट्रेनिंग "मीडियम नॉइज़" स्तर पर होती है जहाँ उत्तर अभी भी कुछ हद तक दिखाई देता है। शोधकर्ताओं ने महसूस किया कि यही वह जगह थी जहाँ चीटिंग हो रही थी। उन्होंने एक हाई-नॉइज़-बायस्ड शेड्यूल (High-Noise-Biased schedule) में बदलाव किया।

इसे ऐसे समझें जैसे किसी को बर्फीले तूफान में चेहरा पहचानना सिखाना:

  1. पुराना तरीका: उन्हें एक थोड़ी धुंधली फोटो दिखाएं। वे अभी भी विशेषताओं को देख सकते हैं और बिना सुराग पढ़े नाम का अनुमान लगा सकते हैं।
  2. नया तरीका (SCENA): उन्हें 90% सफेद बर्फ वाली फोटो दिखाएं। एकमात्र तरीका जिससे वे अनुमान लगा सकते हैं कि वह कौन है, वह है सुराग को पढ़ना ("यह वही आदमी है जिसकी लाल टोपी है")।

AI को ज्यादातर तब सीखने के लिए मजबूर करके जब ऑडियो लगभग शुद्ध स्टैटिक (static) हो, शोधकर्ताओं ने इसे चीटिंग करने से रोका और वास्तव में आपके टेक्स्ट निर्देशों को सुनने के लिए मजबूर किया ताकि यह तय किया जा सके कि कौन सी आवाज़ कब बोलेगी।

परिणाम

जब उन्होंने इस नए सिस्टम का परीक्षण किया:

  • बेहतर बाइंडिंग (Better Binding): इसने पिछले सिस्टमों की तुलना में कहानी के सही हिस्से को सही आवाज़ असाइन करने में बहुत बेहतर प्रदर्शन किया।
  • यथार्थवाद (Realism): इसने ओवरलैपिंग स्पीच, हंसी, आहें और बैकग्राउंड शोर बनाया जो एक वास्तविक, अव्यवस्थित बातचीत जैसा लगा, न कि एक बेजान स्टूडियो रिकॉर्डिंग।
  • वाइल्ड कार्ड्स (Wild Cards): यह तब भी अच्छी तरह से काम करता है जब वॉइस क्लिप्स शोर वाले, वास्तविक वातावरण (जैसे सड़क या पार्क) में रिकॉर्ड किए गए हों, न कि केवल एक शांत स्टूडियो में।

संक्षेप में, SCENA एक ऐसा सिस्टम है जो आपको केवल एक कहानी और कुछ वॉइस क्लिप्स का उपयोग करके एक मल्टी-एक्टर ऑडियो सीन को निर्देशित करने की अनुमति देता है, बिना किसी जटिल स्क्रिप्ट को लिखे या ऑडियो को मैन्युअल रूप से एडिट किए, क्योंकि इसने आपके शब्दों को सुनने के बजाय शॉर्टकट ढूंढना सीखा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →