← أحدث الأبحاث
💻 computer science

LongCat-Video-Avatar 1.5 Technical Report

يُعد LongCat-Video-Avatar 1.5 إطار عمل مفتوح المصدر مطوراً يمنح الأولوية للجاهزية للإنتاج والهندسة المنهجية لتقديم توليد فيديوهات طويلة ذات جودة تجارية، ومستقرة، ومتسقة الهوية مع استدلال متسارع، متفوقاً بذلك على الأنظمة المغلقة الرائدة عبر سيناريوهات متنوعة.

المؤلفون الأصليون: Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد إنشاء شخصية رقمية يمكنها التحدث، والغناء، والتمثيل تماماً مثل البشر الحقيقيين، ولكن ليس لديك سوى صورة لهم وتسجيل صوتي لصوتهم. لفترة طويلة، كان صنع هذه الشخصيات لتبدو "واقعية" لأكثر من بضع ثوانٍ يشبه محاولة موازنة منزل من ورق اللعب في وسط عاصفة: قد تبدو جيدة للحظة، ولكن بعد ذلك تتعثر وجوههم، أو لا تتطابق شفاههم مع الكلمات، أو تبدأ أجسادهم بالتحرك بشكل غريب.

ورقة البحث LongCat-Video-Avatar 1.5 الصادرة عن فريق Meituan LongCat هي تقرير تقني حول "وصفة" جديدة مفتوحة المصدر لبناء هذه الشخصيات الرقمية. وبدلاً من اختراع نوع جديد من السحر، ركزوا على إتقان الهندسة لجعل النتيجة مستقرة بما يكفي للاستخدام في العالم الحقيقي (مثل الأفلام، أو الأخبار، أو خدمة العملاء).

إليك كيف فعلوا ذلك، مشروحاً بتشبيهات بسيطة:

1. ترقية "الأذن": Whisper Large

في النسخة القديمة، استخدم النموذج "أذناً" قياسية (مشفر صوتي يسمى Wav2Vec2) للاستماع إلى الصوت. كان الأمر جيداً، لكنه كان يفشل أحياناً في التقاط الفروق الدقيقة في الكلام.

  • الترقية: قاموا باستبداله بـ Whisper Large، وهو نظام صوتي أكثر قوة بكثير.
  • التشبيه: تخيل الأذن القديمة كشخص يستمع إلى أغنية في غرفة صاخبة مع وضع سدادات الأذن. أما نظام Whisper Large الجديد فهو مثل ارتداء سماعات عالية الجودة عازلة للضوضاء في استوديو هادئ. إنه يسم يسمع كل تفصيل دقيق للصوت، مما يسمح لشفاه الشخصية بالتحرك بدقة مثالية، متطابقة مع الصوت تماماً، حتى في الفيديوهات الطويلة.

2. "صالة الألعاب الرياضية" للبيانات: تنظيم مجموعة التدريب

لا يمكنك تعليم ممثل رقمي بمجرد عرض فيديوهات عشوائية عليه. إذا عرضت عليه فيديو لوجه ضبابي، أو شخص يحمل لافتة، أو شخصين يتحدثان في وقت واحد، فسيصاب النموذج بالارتباك.

  • الحل: قاموا ببناء "صالة ألعاب رياضية" صارمة للبيانات. لم يقوموا فقط بضخ آلاف الفيديوهات في النظام، بل قاموا بفرزها مثل أمين مكتبة ينظم مكتبة:
    • البيانات الصامتة: علموا النموذج ما يجب فعله عندما لا يتحدث أحد (مثل الرمش، التنفس، النظر حوله) حتى لا تتجمد الشخصية أو تبدو غريبة عندما يتوقف الصوت.
    • بيانات المشاعر: قاموا بتغذية النموذج خصيصاً بفيديوهات لأشخاص يظهرون مشاعر مختلفة (الضحك، البكاء، التفاعل) حتى لا تبدو الشخصية مجرد روبوت يقرأ نصاً.
    • بيانات متعددة الأشخاص: علموا النموذج كيفية التعامل مع مشهد يتحدث فيه شخصان. استخدموا حيلة خاصة (إعطاء الشخصيات الخلفية مساراً صوتياً "صامتاً") بحيث يتحرك الشخص الذي يُفترض أن يتحدث فقط، بينما يظل الآخرون ثابتين.

3. "المدرب" (RLHF): التعلم من التعليقات البشرية

حتى مع وجود بيانات جيدة، قد يرتكب النموذج أخطاء صغيرة، مثل يد تبدو ملتوية قليلاً أو وجه يتحرك بشكل غير طبيعي.

  • الطريقة: استخدموا تقنية تسمى تحسين السياسة النسبي للمجموعات (GRPO).
  • التشبيه: تخيل مدرب رقص يراقب طالباً. بدلاً من مجرد قول "عمل جيد" أو "عمل سيء"، يقارن المدرب رقص الطالب بمجموعة من الراقصين الآخرين ويقول: "حركة ذراعك أفضل بنسبة 10% من المتوسط، لكن حركة قدمك أسوأ بنسبة 5%". يتعلم النموذج من هذه المقارنات لضبط حركاته إطاراً بإطار، مما يضمن أن تبدو الأيدي واقعية وأن يتحرك الجسم بشكل طبيعي.

4. "الوضع التربو": جعل العملية سريعة

عادة ما يكون توليد الفيديو عالي الجودة بطيئاً. الأمر يشبه خبز كعكة حيث يتعين عليك فحص الفرن كل 5 دقائق لمدة ساعة.

  • الابتكار: استخدموا تقنية التقطير (Distillation) لضغط العملية.
  • التشبيه: علموا النموذج خبز الكعكة في 8 خطوات بدلاً من الـ 50 المعتادة. إنه يشبه تدريب عداء على الركض في السباق بأكملç في 8 خطوات واسعة وعظيمة بدلاً من 50 خطوة صغيرة وبطيئة. النتيجة هي فيديو يبدو بجودة مماثلة ولكنه يتم إنتاجه بشكل أسرع بكثير، مما يجعله عملياً للاستخدام في الوقت الفعلي.

5. النتائج: كيف يقارن بالآخرين؟

اختبر الفريق نموذجهم الجديد مقابل أفضل الأنظمة "مغلقة الصندوق" (السرية والمدفوعة) الموجودة حالياً في السوق، مثل HeyGen و Kling Avatar.

  • الحكم النهائي: في اختبار أعمى شمل أكثر من 500 سيناريو مختلف (بما في ذلك الرؤوس المتحدثة، الغناء، أساليب الأنمي، وحتى الحيوانات)، تم تقييم LongCat-Video-Avatar 1.5 غالباً على أنه أفضل أو مساوٍ لهذه الأنظمة التجارية باهظة الثمن.
  • الانتصارات الرئيسية:
    • تزامن الشفاه: تطابقت حركات الفم مع الصوت بشكل مثالي.
    • الاستقرار: لم تتذبذب الشخصية أو يتغير وجهها خلال الفيديوهات الطويلة.
    • الهوية: بدت الشخصية وكأنها نفس الشخص من البداية إلى النهاية.
    • التعقيد: تعامل النموذج مع المواقف الصعبة، مثل شخص يحمل غيتاراً أو شخصين يتحدثان، دون أن تتحرك شفاه الشخصيات في الخلفية عن طريق الخطأ.

الملخص

إن LongCat-Video-Avatar 1.5 هو في الأساس مجموعة أدوات "جاهزة للإنتاج". إنه يأخذ الطبيعة التجريبية والفوضوية لتوليد الفيديو بالذكاء الاصطناعي ويصقلها بآذان أفضل (Whisper)، وبيانات تدريب أفضل (صامتة/مشاعر/متعددة الأشخاص)، ومدرب صارم (RLHF)، وتعزيز للسرعة (التقطير). الهدف لم يكن مجرد صنع عرض تجريبي رائع، بل بناء نظام يعمل بموثوقية كافية ليتم استخدامه في الأعمال التجارية الحقيقية، وقد أثبتوا أنه يعمل بقدر كفاءة (أو أفضل من) الأدوات المدفوعة الرائدة المتاحة اليوم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →