← नवीनतम पेपर
💻 computer science

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

यह शोध पत्र InteracVid को प्रस्तुत करता है, जो लाइव-चैट वीडियो से निकाले गए 454,000 से अधिक संदर्भ-प्रश्न-प्रतिक्रिया (context-query-response) ट्रिपलेट्स वाला पहला ओपन-सोर्स बड़े पैमाने का डेटासेट है, जो बाहरी उपयोगकर्ता उद्दीपनों (stimuli) के प्रति प्राकृतिक, कारण-संबंधी (causal) ऑडियो-विजुअल प्रतिक्रियाएं उत्पन्न करने के लिए मल्टीमॉडल मॉडलों को प्रशिक्षित करने हेतु आवश्यक इंटरैक्शन-स्ट्रक्चर्ड सुपरविजन प्रदान करता है।

मूल लेखक: Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

प्रकाशित 2026-08-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बेहतरीन बातचीत करने वाला साथी बनने के लिए सिखा रहे हैं। अब तक, हमने मुख्य रूप से रोबोट्स को केवल टेक्स्ट का उपयोग करके बात करना सिखाया है, जैसे कि एक बहुत ही स्मार्ट चैटबॉट। लेकिन वास्तविक जीवन केवल स्क्रीन पर शब्दों तक सीमित नहीं है; यह एक पूर्ण संवेदी अनुभव है। जब आप किसी मित्र से कोई प्रश्न पूछते हैं, तो वे केवल एक वाक्य के साथ उत्तर नहीं देते; वे अपनी भौंहें ऊपर उठा सकते हैं, हंस सकते हैं, हाथ हिला सकते हैं, या आपको दिखाने के लिए कोई वस्तु भी उठा सकते हैं। यह पेपर मल्टीमॉडल एआई (multimodal AI) की दुनिया में है, जो कि मल्टीमॉडल एआई के लिए एक फैंसी शब्द है—यानी ऐसे कंप्यूटर बनाना जो एक साथ देख, सुन और बोल सकें। बड़ी चुनौती यह रही है कि जहाँ हमारे पास रोबोट्स को चीजों का वर्णन करने (जैसे कि "एक चटाई पर बैठा हुआ बिल्ली") के लिए बेहतरीन उपकरण हैं, वहीं हमारे पास उन्हें वास्तविक समय में किसी विशिष्ट व्यक्ति के प्रश्न पर सही चेहरे के भावों, इशारों और आवाज के साथ प्रतिक्रिया देने के लिए सिखाने के लिए पर्याप्त प्रशिक्षण डेटा नहीं था। यह एक स्क्रिप्ट पढ़ने और अपने साथी के साथ वास्तव में एक दृश्य में सुधार (इम्प्रोवाइज) करने के बीच का अंतर है।

यहाँ InteracVid आता है, जो त्सिंगहुआ विश्वविद्यालय के शोधकर्ताओं द्वारा बनाया गया एक विशाल नया डेटासेट है जो "वास्तविक जीवन की प्रतिक्रियाओं" के एक विशाल पुस्तकालय की तरह कार्य करता है। केवल एक वीडियो का वर्णन करने के बजाय, यह डेटासेट उस सटीक क्षण को कैप्चर करता है जब एक स्ट्रीमर (एक व्यक्ति जो लाइव वीडियो प्रसारित कर रहा है) एक दर्शक से प्रश्न सुनता है और तुरंत मुस्कान, एक इशारे या एक बोले गए उत्तर के साथ प्रतिक्रिया देता है। शोधकर्ताओं ने 59,000 से अधिक लाइव-स्ट्रीम वीडियो को खंगाला और इन 454,000 से अधिक सटीक "प्रश्न-और-प्रतिक्रिया" क्षणों को निकाला। उन्होंने पाया कि वास्तविक दुनिया में, स्ट्रीमर "यह कौन सा गेम है?" से लेकर "आपकी पीठ में दर्द कैसे है?" जैसे हर सवाल पर पूर्ण-शरीर, ऑडियो-विजुअल प्रतिक्रिया देते हैं।

टीम ने इस अव्यवस्थपूर्ण डेटा को एक प्रशिक्षण उपकरण में बदलने के लिए एक चतुर दो-चरणीय प्रणाली बनाई। सबसे पहले, उन्होंने यह पता लगाने के लिए एआई का उपयोग किया कि स्ट्रीम के लंबे हिस्सों में से कौन से हिस्से वास्तव में चैट कमेंट के प्रति वास्तविक प्रतिक्रियाएं थे, और कौन से हिस्से केवल स्ट्रीमर द्वारा खुद से बात करने के थे। उन वीडियो के लिए जहाँ चैट इतिहास गायब था, उन्होंने एआई का उपयोग करके यह अनुमान लगाया कि स्ट्रीमर की प्रतिक्रिया के आधार पर प्रश्न क्या रहा होगा, जिससे एक "पुनर्निर्मित" (reconstructed) प्रश्न तैयार हुआ जो वास्तविक वीडियो प्रतिक्रिया के साथ मेल खाता था। अंततः उनके पास 39,000 वास्तविक प्रश्न-और-उत्तर जोड़े और 414,000 पुनर्निर्मित जोड़े वाला एक डेटासेट था, जिसमें कुकिंग शो से लेकर गेमिंग सत्र तक सब कुछ शामिल था।

जब उन्होंने इस डेटासेट का परीक्षण नई पीढ़ी के एआई मॉडल्स पर किया, तो परिणाम आशाजनक लेकिन सूक्ष्म थे। उन्होंने पाया कि केवल एआई को यह "इंटरैक्शन डेटा" खिलाने से वह ऐसे वीडियो बनाने में बहुत बेहतर हो गया जो एक वास्तविक व्यक्ति के उपयोगकर्ता को जवाब देने के रूप में दिखते और सुनाई देते हैं। विशेष रूप से, इंटरएकविड (InteracVid) पर वीडियो जनरेटर को फाइन-ट्यून करने से आउटपुट की गुणवत्ता में काफी सुधार हुआ, जिससे लिप-सिंकिंग और इशारे बहुत अधिक स्वाभाविक हो गए। हालाँकि, शोधकर्ताओं ने एक बाधा भी खोजी: सबसे कठिन हिस्सा वीडियो को अच्छा दिखाना नहीं था, बल्कि सबसे पहले यह तय करना था कि क्या कहना या करना है। सबसे अच्छे वीडियो जनरेटर के साथ भी, यदि एआई उपयोगकर्ता के प्रश्न को सही ढंग से नहीं समझता है, तो प्रतिक्रिया गलत होती है। उनके प्रयोग बताते हैं कि जबकि हम अब रोबोट्स को एक प्रतिक्रिया को अच्छी तरह से परफॉर्म करना सिखा सकते हैं, उन्हें सही प्रतिक्रिया की योजना बनाना सिखाना अभी भी सबसे बड़ी चुनौती है। पेपर निष्कर्ष निकालता है कि इंटरएकविड एक महत्वपूर्ण पहला कदम है, जो मानव संपर्क का वह "ग्राउंड ट्रुथ" प्रदान करता है जिसकी आवश्यकता ऐसे एआई अवतार बनाने के लिए है जो न केवल वास्तविक दिखते हैं, बल्कि वास्तव में ऐसा महसूस कराते हैं जैसे वे आपकी बात सुन रहे हैं और जवाब दे रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →