← أحدث الأبحاث
💻 computer science

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

تُعد Tele-Omni إطار عمل موحداً متعدد الوسائط يستفيد من النماذج اللغوية الكبيرة سابقة التدريب لتحليل تعليمات متنوعة للنصوص والصور والفيديو من أجل نموذج واحد قائم على الانتشار، مما يتيح توليد وتحرير الفيديو بمرونة وجودة عالية عبر مهام متعددة ضمن نظام متماسك.

المؤلفون الأصليون: Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qi
نُشر 2026-02-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك استوديو أفلام سحري في غرفة معيشتك. في الوقت الحالي، معظم أدوات الفيديو بالذكاء الاصطناعي تشبه عمالاً متخصصين: هناك عامل بارع في صنع الأفلام من نص (نص)، وآخر بارع في تحريك رسم تخطيطي (صورة)، وثالث بارع في إزالة الخلفية. ولكن إذا أردت القيام بشيء معقد — مثل "خذ هذه الصورة لقطة، وضعها في مدينة سايبربانك، واجعل السماء تمطر، ثم عدل الفيديو لتجعل القطة ترتدي نظارات شمسية" — فعادة ما يتعين عليك استئجار ثلاثة عمال مختلفين وتأمل أن يتواصلوا مع بعضهم البعض. وغالباً لا يفعلون ذلك.

Tele-Omni هو الحل لهذه المشكلة. فكر فيه كأنه منتج فائق يمكنه القيام بكل شيء في خطوة واحدة.

إليك شرح بسيط لكيفية عمل Tele-Omni، باستخدام تشبيهات من الحياة اليومية:

1. نظام "العقلين"

Tele-Omni ليس مجرد عقل واحد كبير؛ بل هو فريق من متخصصين اثنين يعملان في تناغم تام:

  • "المخرج" (النموذج اللغوي البصري الكبير - MLLM): هذا هو العقل الذي يفهم اللغة، الصور، والفيديوهات. إنه يشبه مخرج أفلام متمرس يقرأ ملاحظاتك الفوضوية ("اجعل السيارة حمراء، لكن حافظ على تساقط المطر") وينظر إلى صورك المرجعية. المخرج لا يرسم الإطارات؛ بل يكتب بدلاً من ذلك قائمة لقطات ولوحة قصة (ستوري بورد) دقيقة للغاية. إنه يحدد ماذا تريد وكيف يتم تنفيذه.
  • "مدير التصوير" (نموذج الانتشار - Diffusion Model): هذا هو الفنان الذي يقوم برسم الفيلم بالفعل. يأخذ قائمة لقطات المخرج وصوره المرجعية ويبدأ في إنشاء الفيديو إطاراً تلو الآخر. إنه بارع للغاية في جعل الأشياء تبدو واقعية والحفاظ على سلاسة الحركة.

السحر: في الأنظمة القديمة، كان المخرج ومدير التصوير يتحدثان لغات مختلفة. أما في Tele-Omni، فهما يتحدثان نفس اللغة. يقوم المخرج بترجمة تعليماتك المعقدة والمختلطة (نص + صور + مقاطع فيديو) إلى خطة واضحة يمكن لمدير التصوير تنفيذها بإتقان.

2. "السكين السويسري" لمهام الفيديو

معظم أدوات الفيديو بالذكاء الاصطناعي هي مثل مفك براغي ذو غرض واحد. أما Tele-Omni فهو سكين سويسري. ولأن المخرج يفهم القصد من طلبك، يمكن لـ Tele-Omni التعامل مع مجموعة هائلة من الوظائف دون الحاجة لإعادة تدريبه لكل مهمة:

  • تحويل النص إلى فيديو (Text-to-Video): تقول له "تنين يطير فوق قلعة"، فيقوم بصنعها.
  • تحويل الصورة إلى فيديو (Image-to-Video): ترفع صورة لقطة نائمة، فيجعل القطة تستيقظ وتتمطى.
  • الإطار الأول والأخير (First-and-Last-Frame): تعطيه صورة لشخص جالس وصورة له وهو واقف. يستنتج المخرج "المنتصف" للقصة ويملأ الحركة بسلاسة.
  • تحرير الفيديو (Video Editing): يمكنك أن تقول "أزل تلك السلة القبيحة من الخلفية"، أو "غير ملابس الصيف إلى معاطف شتوية"، وهو يعدل الفيديو مع الحفاظ على مثالية بقية المشهد.
  • التوليد في السياق (In-Context Generation): يمكنك أن تريه فيديو مرجعياً لرقصة ما وتقول "قم بهذا الرقص، ولكن باستخدام روبوت"، وسيقوم بنسخ الحركة مع تغيير الشخصية.

3. السر الكامن: "التدريب المدرك للمهام"

قد تتساءل: "كيف يعرف الذكاء الاصطناعي الفرق بين 'صنع فيديو جديد' وبين 'تعديل فيديو قديم'؟"

عادةً، إذا خلطت أنواعاً مختلفة من بيانات التدريب (مثل خلط عجينة الكيك بزيت محرك السيارة)، فإن الذكال الاصطناعي يصاب بالارتباك. يستخدم Tele-Omni خط إنتاج بيانات خاص (وصفة للتدريب) ينظم كل شيء بدقة.

فكر في الأمر كأنه جهاز تحكم عن بعد شامل. بدلاً من امتلاك أجهزة تحكم منفصلة للتلفاز، والمسجل، والمكيف، يعلم Tele-Omni الذكاء الاصطناعي التعرف على الأزرار التي تضغطها.

  • إذا ضغطت "صنع جديد"، فهو يعرف أنه يجب أن يبدأ من الصفر.
  • إذا ضغطت "تعديل"، فهو يعرف أن عليه الحفاظ على الخلفية وتغيير الموضوع.
  • إذا ضغطت "مرجع"، فهو يعرف أن عليه نسخ الأسلوب أو الحركة من مقطع مقدم.

يتم تدريب النظام على مكتبة ضخمة ومنظمة من الأمثلة حتى يتعلم التمييز بين هذه المهام فوراً، بمجرد النظر إلى تعليماتك.

4. لماذا هذا مهم؟

قبل Tele-Omni، إذا أردت صنع فيديو معقد، كان عليك التنقل بين أدوات مختلفة، مما يؤدي لفقدان الجودة والاتساق في الطريق. كان الأمر يشبه محاولة بناء منزل عبر التبديل بين المطرقة، والمنشار، والمسطرين كل خمس دقائق.

يسمح لك Tele-Omni بالبقاء في غرفة واحدة. تعطي له مزيجاً من التعليمات — نصوص، صور، ومقاطع فيديو — ويعمل كفريق إنتاج موحد. إنه يفهم أن "اجعل السماء زرقاء" تنطبق على الفيديو بأكمله، بينما "اجعل السيارة حمراء" تنطبق فقط على السيارة، كل ذلك مع الحفاظ على حركة سلسة وإضاءة واقعية.

باختصار: Tele-Omni هو أول أداة فيديو بالذكاء الاصطناعي تعمل كشريك إبداعي حقيقي، قادرة على فهم أفكارك الفوضوية والمتعددة الأجزاء وتحويلها إلى فيلم واحد عالي الجودة دون الحاجة لأداة مختلفة لكل خطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →