← أحدث الأبحاث
💻 computer science

EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration

يُعد EverAnimate طريقة فعالة لما بعد التدريب تتيح تحريك البشر على نطاق الدقائق من خلال الجمع بين الانتشار الكامن المستمر ومطابقة التدفق الترميمي لترسيخ التوليد في ذاكرة سياقية كامنة، مما يؤدي إلى القضاء على الانجراف البصري والدلالي المتراكم مع الحفاظ على هوية الشخصية وجودة الخلفية.

المؤلفون الأصليون: Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تصوير فيلم طويل ومتواصل لراقصة تؤدي رقصة معقدة. لديك صورة للراقصة (المرجع) ونص لحركاتها (الوضعيات). هدفك هو إنشاء فيديو يتبع النص بدقة مع الحفاظ على مظهر الراقصة تماماً كما في الصورة، حتى بعد 90 ثانية من الرقص.

تعالج ورقة بحثية بعنوان EverAnimate مشكلة محددة: عندما يحاول الذكاء الاصطناعي إنشاء فيديوهات طويلة كهذه، فإنها تميل إلى "الانحراف" والابتعاد عن الأصل، تماماً مثل النسخة من نسخة من نسخة التي تصبح في النهاية ضبابية وغير قابلة للتمييز.

إليك كيف تشرح الورقة البحثية المشكلة وحلها، باستخدام تشبيهات بسيطة:

المشكلة: خلل "النسخ واللصق"

تحاول الطرق الحالية إنشاء فيديوهات طويلة عن طريق دمج مقاطع قصيرة (كتل). تخيل أنك تقوم بنسخ فقرة نصية، ثم تنسخ تلك النسخة لتصنع الفقرة التالية، وهكذا.

  • انحراف الخلفية (مستوى منخفض): من المفترض أن تظل الخلفية (مثل جدار أو شجرة) ثابتة. ولكن لأن الذكاء الاصطناعي يستمر في إعادة نسخ الصورة لبدء المقطع التالي، يبدأ الجدار في الظهور بشكل ضبابي، وتتغير الألوان، وفي النهاية يبدو كأنه نسخة ضوئية سيئة.
  • انحراف الهوية (مستوى عالٍ): من المفترض أن تبدو الراقصة كما هي. ولكن مع طول الفيديو، قد يتغير شكل وجه الراقصة ببطء، أو يتغير لون ملابسها، أو يبدو شعرها مختلفاً. إنهم يفقدون "هويتهم".

تجادل الورقة بأن الطرق الموجودة تحاول إصلاح ذلك عبر إظهار الصورة الأصلية للذكاء الاصطناعي مراراً وتكراراً (مثل "مصب" أو مرساة)، لكن هذا ليس كافياً. لا يزال الذكاء الاصطناعي يصاب بالارتباك بسبب عملية النسخ المتكررة.

الحل: EverAnimate

تقترح الورقة طريقة جديدة لإنشاء هذه الفيديوهات تحدث بالكامل داخل "عقل" الذكاء الاصطناعي (المجال الكامن - latent space) بدلاً من إعادة تصوير الفيديو. يستخدمون حيلتين رئيسيتين:

1. "حقيبة الظهر المستمرة" (الانتشار الكامن المستمر)

بدلاً من أخذ مخرجات الفيديو، وتحويلها مرة أخرى إلى صورة، ثم تغذية هذه الصورة مرة أخرى في الذكاء الاصطناعي للمقطع التالي (مما يسبب أخطاء "النسخ واللصق")، يحتفظ EverAnimate بـ حقيبة ظهر للذاكرة داخل الذكاء الاصطناعي.

  • كيف يعمل: عندما ينتهي الذكاء الاصطناعي من كتلة واحدة من الفيديو، فإنه لا ينظر إلى الصورة النهائية. بدلاً من ذلك، يقوم بتمرير "حقيبة ظهر" من البيانات الخام (الأكواد الكامنة) إلى الكتلة التالية.
  • ماذا يوجد في الحقيبة؟
    • ذاكرة قصيرة المدى: الثواني القليلة الأخيرة من الحركة للحفاظ على سلاسة الرقص.
    • ذاكرة طويلة المدى: مجموعة من "بطاقات الهوية" (صور متعددة الزوايا) لوجه الراقصة وملابسها لضمان عدم تغير مظهرها أبداً.
  • التشبيه: تخيل سباق تتابع. بدلاً من أن يسلمك العداء صورة ضبابية للعداء السابق لتقوم بنسخها، فإنه يسلمك شريحة بيانات مباشرة وعالية الجودة تخبرك بكيفية مواصلة السباق بدقة دون فقدان ملامح العداء الأصلي.

2. "البوصلة ذاتية التصحيح" (مطابقة التدفق الاستردادي)

حتى مع وجود حقيبة ظهر جيدة، قد ينحرف الذكاء الاصطناعي أحياناً عن المسار أثناء إنشاء مقطع واحد.

  • المشكلة: إذا بدأ الذكاء الاصطناعي في الانحراف قليلاً عن المسار (على سبيل المثال، بدا ذراع الراقصة غريباً بعض الشيء)، فإن الطرق القياسية تستمر في المضي قدماً، مما يجعل الخطأ يزدهاد سوءاً.
  • الإصلاح: يتم تدريب EverAnimate باستخدام "بوصلة" خاصة. أثناء التدريب، يُعطى الذكاء الاصطناعي عمداً مساراً "مكسوراً" أو مشوهاً قليلاً ليتبعه. يتعلم الذكاء الاصطناعي التعرف على كونه خارج المسار الصحيح، ويعمل بنشاط لتوجيه نفسه عائداً إلى المسار الصحيح والنظيف.
  • التشبيه: فكر في متنزّه يمشي في الضباب. المتنزّه العادي قد يهيم بعيداً نحو منحدر لأنه لا يستطيع رؤية الطريق. EverAnimate يشبه المتنزّه الذي يمتلك نظام GPS يهتز كلما خطا خطوة خارج المسار، ليدفعه بلطف للعودة إلى المسار الآمن قبل أن يضيع.

النتائج

تزعم الورقة البحثية أنه باستخدام هاتين الطريقتين (حقيبة ذاكرة الظهر والبوصلة ذاتية التصحيح)، يمكن لـ EverAnimate إنشاء فيديوهات تصل مدتها إلى دقائق (90 ثانية في اختباراتهم) دون أن تصبح الخلفية ضبابية أو يتغير وجه الشخصية.

  • الفيديوهات القصيرة (10 ثوانٍ): هي بالفعل أفضل من أفضل الطرق الموجودة حالياً.
  • الفيديوهات الطويلة (90 ثانية): التحسن هائل. يظل الفيديو حاداً، والخلفية مستقرة، وتظل الشخصية تبدو تماماً كما هي من البداية إلى النهاية.

الملخص

باختصار، يمنع EverAnimate الذكاء الاصطناعي من صنع "نسخ من النسخ" للفيديو. بدلاً من ذلك، يحتفظ بذاكرة رقمية عالية الجودة للشخصية والمشهد، ويدرب الذكاء الاصطناعي على إصلاح أخطائه أثناء العمل، مما يسمح بإنشاء رسوم متحركة سلسة وعالية الجودة لمدة دقيقة كاملة دون أن تنهار.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →