← أحدث الأبحاث
💻 computer science

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

تقترح الورقة البحثية TS-Attn، وهي آلية انتباه مبتكرة لا تتطلب تدريباً تعمل على إعادة ترتيب توزيعات الانتباه ديناميكياً لمعالجة عدم المحاذاة الزمنية وازدواجية الانتباه المتعارضة، مما يحسن بشكل كبير جودة واتساق توليد الفيديو متعدد الأحداث في النماذج سابقة التدريب مع حد أدنى من التكاليف الإضافية عند الاستنتاج.

المؤلفون الأصليون: Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

نُشر 2026-04-22
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مخرج يحاول تصوير فيلم قصير بناءً على سيناريو يقول: "قطة تدخل غرفة، تقفز على طاولة، تسقط مزهرية، ثم تركض خارج الباب."

مولدات الفيديو الحالية بالذكاء الاصطناعي تشبه ممثلين موهوبين ولكنهم مشتتون قليلاً. إذا أعطيتهم هذا السيناريو كاملاً دفعة واحدة، فقد يشعرون بالإرهاق. قد يظهرون القطة وهي تركض خارج الباب قبل حتى أن تقفز على الطاولة، أو قد ينسون المزهرية تماماً. إنهم يحاولون القيام بكل شيء في وقت واحد، والنتيجة هي فوضى عارمة لا منطق فيها للجدول الزمني.

بدلاً من ذلك، إذا حاولت تصوير هذا المشهد عبر تصوير كل حركة على حدة ثم دمج المقاطع معاً، فقد تبدو القطة مختلفة في كل مقطع، أو قد يتغير الخلفية بشكل مفاجئ. الأمر يشبه محاولة بناء منزل عن طريق لصق طوب من منازل مختلفة؛ حيث ينهار الهيكل في النهاقة.

إليك TS-Attn (الانتباه المنفصل زمنياً - Temporal-wise Separable Attention).

فكر في TS-Attn كـ محرر أفلام و مشرف سيناريو ذكي جداً يجلس داخل عقل الذكاء الاصطناعي. مهمته هي التأكد من أن الذكاء الاصطناعي ينتبه للجزء الصحيح من السيناريو في الوقت الصحيح.

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. المشكلة: "ضجيج الكافيتيريا"

تخيل أن الذكاء الاصطناعي موجود في كافيتيريا صاخبة. السيناريو (النص الوصفي) هو قائمة طويلة من التعليمات من أشخاص مختلفين.

  • الشخص (أ) يقول: "امشِ!"
  • الشخص (ب) يقول: "اقفز!"
  • الشخص (ج) يقول: "اصدم!"

بدون TS-Attn، يسمع الذكاء الاصطناعي كل هذه الأصوات في وقت واحد. يحاول المشي، والقفز، والصدم جميعاً في نفس اللحظة، أو يصاب بالارتباك ويتجاهل بعض الأصوات. النتيجة هي فيديو تظهر فيه القطة وهي تفعل كل شيء في آن واحد أو لا تفعل شيئاً على الإطلاق.

2. الحل: "تسليط الضوء عبر الزمن"

يعمل TS-Attn مثل كشاف ضوئي يتحرك عبر المسرح. هو يخبر الذكاء الاصطناعي:

  • الزمن 1: "مهلاً أيها الذكاء الاصطناعي، تجاهل الجميع الآن. استمع فقط للشخص الذي يقول 'امشِ'. ركز طاقتك على جعل القطة تمشي."
  • الزمن 2: "حسناً، انتهت عملية المشي. أطفئ ضوء 'المشي'. الآن، ركز فقط على الشخص الذي يقول 'اقفز'."
  • الزمن 3: "الآن، ركز على 'الصدم'."

إنه يقوم أساساً بـ فك عقدة التعليمات. فهو يضمن أن الحركة البصرية (حركة القطة) متزامنة تماماً مع الكلمة المحددة في السيناريو التي تسببت فيها.

3. "محقق الحركة"

كيف يعرف الذكاء الاصطناعي أين ينظر؟
يحتوي TS-Attn على محقق صغير بداخله. ينظر إلى الفيديو ويقول: "حسناً، القطة هي الشيء الذي يتحرك الآن". فيضع ملصقاً رقمياً على القطة. ثم يخبر الذكنا الاصطناعي: "اجعل تعليمات 'القفز' تتحدث مع القطة فقط. لا تدع تعليمات 'القفز' تحاول تحريك الخلفية أو الطاولة".

هذا يمنع الذكاء الاصطناعي من الارتباك بشأن أي جزء من الصورة يجب أن يتغير.

لماذا يعد هذا أمراً بالغ الأهمية؟

  • لا حاجة لإعادة التدريب: عادةً، لإصلاح ذكاء اصطناعي معطل، يتعين عليك إعادة تعليمه من الصفر (مثل إرسال طالب للعودة إلى المدرسة لأربع سنوات). TS-AttN يشبه إعطاء ذلك الطالب ورقة غش أو نظارة جديدة. يمكنك دمجه في نماذج الذكاء الاصطناعي الموجودة (مثل Wan أو CogVideoX) وسوف تصبح أذكى فوراً.
  • السرعة: هو لا يبطئ العملية كثيراً. الأمر يشبه إضافة نظام GPS لسيارة؛ السيارة تقود بنفس السرعة، لكنها لا تضل الطريق.
  • الاستمرارية: تبدو القطة هي نفس القطة من البداية إلى النهاية، وتتدفق القصة بشكل منطقي.

النتيجة

مع TS-Attn، يمكن للذكاء الاصطناعي أخيراً التعامل مع القصص المعقدة. يمكنه إنشاء فيديو حيث تلتقط ذراع روبوت كوباً، وتسكب الماء، وتضعه مكانه، كل ذلك في لقطة واحدة سلسة ومستمرة دون أن يختفي الكوب أو يتحول الماء إلى نار.

باختاً، يعلم TS-Attn الذكاء الاصطناعي كيف يستمع للقصة بالترتيب، بدلاً من محاولة سماع القصة بأكملها في وقت واحد. إنه يحول مجموعة فوضوية من التعليمات إلى فيلم واضح وخطوة بخطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →