← أحدث الأبحاث
💻 computer science

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

تقدم الورقة البحثية InteracVid، وهو أول مجموعة بيانات مفتوحة المصدر واسعة النطاق تضم أكثر من 454,000 ثلاثية (سياق-استعلام-استجابة) مستخرجة من فيديوهات الدردشة المباشرة، والتي توفر الإشراف الهيكلي التفاعلي الحاسم اللازم لتدريب النماذج متعددة الوسائط على توليد استجابات سمعية بصرية طبيعية وسببية للمحفزات الخارجية للمستخدمين.

المؤلفون الأصليون: Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

نُشر 2026-08-04
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً ليكون الشريك المثالي في المحادثة. حتى الآن، علمنا الروبوتات التحدث باستخدام النصوص فقط، مثل برامج الدردشة الآلية الذكية جداً. لكن الحياة الواقعية ليست مجرد كلمات على شاشة؛ إنها تجربة حسية كاملة. عندما تطرح سؤالاً على صديق، فهو لا يكتفي بالرد بجملة فحسب، بل قد يرفع حاجباً، أو يضحك، أو يلوح بيديه، أو حتى يلتقط شيئاً ما ليريك إياه. تعيش هذه الورقة البحثية في عالم الذكاء الاصطناعي متعدد الوسائط (multimodal AI)، وهو المصطلح الفاخر لبناء حواسيب يمكنها الرؤية والسمع والتحدث في آن واحد. كان التحدي الكبير هو أنه بينما نمتلك أدوات رائعة لجعل الروبوتات تصف الأشياء (مثل "قطة تجلس على سجادة")، لم يكن لدينا بيانات تدريب كافية لتعليمها كيفية التفاعل مع سؤال شخص معين في الوقت الفعلي بالتعبيرات الوجهية والإيماءات ونبرة الصوت المناسبة. إنه الفرق بين قراءة نص مكتوب وبين الارتجال الفعلي في مشهد مع شريك.

هنا يأيد InteracVid، وهي مجموعة بيانات ضخمة وجديدة أنشأها باحثون في جامعة تسينغ هوا، والتي تعمل كمكتبة عملاقة لـ "ردود الفعل في الحياة الواقعية". فبدلاً من مجرد وصف الفيديو، تلتقط مجموعة البيانات هذه اللحظة الدقيقة التي يسمع فيها "البث المباشر" (شخص يبث فيديو حياً) سؤالاً من أحد المشاهدين ويستجيب فوراً بابتسامة، أو إيماءة، أو إجابة منطوقة. لقد قام الباحثون بجمع أكثر من 59,000 فيديو من البث المباشر واستخرجوا أكثر من 454,000 من لحظات "السؤال والاستجابة" المثالية هذه. ووجدوا أن المذيعين في الواقع يتفاعلون مع كل شيء، بدءاً من "ما هذه اللعبة؟" وصولاً إلى "كيف حال ظهرك؟"، باستجابة جسدية وبصرية وصوتية كاملة.

بنى الفريق نظاماً ذكياً من خطوتين لتحويل هذه البيانات الفوضوية إلى أداة تدريب. أولاً، استخدموا الذكاء الاصطناعي لتحديد أي أجزاء من البث الطويل هي ردود فعل فعلية على تعليق من الدردشة، وأيها مجرد حديث للمذيع مع نفسه. وبالنسبة للفيديوهات التي كان تاريخ الدردشة فيها مفقوداً، استخدموا الذكاء الاصطناعي لتخمين السؤال الذي قد يكون طُرح بناءً على رد فعل المذيع، مما خلق سؤالاً "مُعاد بناؤه" يتوافق مع استجابة الفيديو الحقيقية. انتهى بهم المطاف بمجموعة بيانات تحتوي على 39,000 زوج حقيقي من الأسئلة والأجوبة و414,000 زوج مُعاد بناؤه، تغطي كل شيء من برامج الطبخ إلى جلسات الألعاب.

عندما اختبروا مجموعة البيانات هذه على جيل جديد من نماذج الذكاء الاصطناعي، كانت النتائج واعدة ولكنها دقيقة. وجدوا أن مجرد تغذية الذكاء الاصطناعي ببيانات "التفاعل" هذه جعلته أفضل بكثير في توليد فيديوهات تبدو وتسمع كأنها لشخص حقيقي يستجيب للمستخدم. وتحديداً، أدى ضبط مولد الفيديو (fine-tuning) باستخدام InteracVid إلى تحسين جودة المخرجات بشكل كبير، مما جعل مزامنة حركة الشفاه والإيماءات أكثر طبيعية. ومع ذلك، اكتشف الباحثون وجود عقبة: الجزء الأصعب لم يكن جعل الفيديو يبدو جيداً، بل في تحديد ماذا يجب قوله أو فعله في المقام الأول. فحتى مع أفضل مولد فيديو، إذا لم يفهم الذكاء الاصطناعي سؤال المستخدم بشكل صحيح، ستكون الاستجابة غير ملائمة. تشير تجاربهم إلى أنه بينما يمكننا الآن تعليم الروبوتات كيفية أداء رد الفعل بشكل جيد، فإن تعليمهم كيفية تخطيط رد الفعل الصحيح لا يزال هو العقبة الكبرى. وتخلص الورقة البحثية إلى أن InteracVid هي خطوة أولى حاسمة، توفر "الحقيقة الأساسية" للتفاعل البشري اللازمة لبناء صور رمزية (avatars) للذكاء الاصطناعي لا تبدو واقعية فحسب، بل تشعر حقاً بأنها تستمع إليك وتستجيب لك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →