← أحدث الأبحاث
💻 computer science

AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

يُعد AnyID إطار عمل مبتكر لتوليد الفيديو فائق الدقة مع الحفاظ على الهوية، حيث يتغلب على قيود أساليب المرجع الواحد من خلال توحيد المدخلات البصرية غير المتجانسة عبر بنية مرجعية شاملة قابلة للتوسع، وتوظيف نموذج توليد يعتمد على مرجع أساسي مع تلميحات تفاضلية لتحقيق قدرة تحكم دقيقة على مستوى السمات.

المؤلفون الأصليون: Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

نُشر 2026-03-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد إنشاء فيلم قصير ببطولة ممثلك المفضل، ولكن ليس لديك سوى بضع صور متفرقة ومقطع فيديو منزلي قديم له. تريد أن يبدو تماماً مثل نفسه، لكنك تريده أن يفعل أشياء جديدة، ويرتدي ملابس مختلفة، ويقف في أماكن مختلفة.

المشكلة في الأساليب القديمة:
كانت أدوات الذكاء الاصطناعي السابقة تشبه مخرجاً صارماً ذا مسار واحد. كانت تقول: "حسناً، لدي فقط هذه الصورة الواحدة لممثلك. سأخمن كيف يبدو من الجانب، وكيف يبدو صوته، وكيف يتحرك". ولأنها كانت تملك دليلاً واحداً فقط، فغالباً ما كانت تخطئ التقدير. قد ينتهي الأمر بالممثل ليبدو كشخص غريب، أو قد يتشوه وجهه عندما يحرك رأسه. لقد كان مجرد "أفضل تخمين" وغالباً ما يفشل.

الحل: AnyID
يقدم البحث نظام AnyID، وهو نظام ذكاء اصطناعي جديد يعمل كمخرج شديد الملاحظة يجمع كل أدلتك قبل التصوير. إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. نهج "ألبوم الصور" (المرجع الشامل - Omni-Referenced)

بدلاً من إجبار الذكاء الاصطناعي على التخمين بناءً على صورة واحدة فقط، يسمح لك AnyID بإدخال أي شيء: صورة سيلفي، أو صورة شخصية (بورتريه)، أو مقطع فيديو، أو حتى مزيجاً من الثلاثة معاً.

  • التشبيه: تخيل أنك تحاول وصف صديق لرسام. إذا أريت الرسام صورة واحدة فقط لوجه صديقك، فقد يضبط شكل الأنف ولكنه قد يخطئ في شكل الأذنين. ولكن إذا أريته ألبوماً يحتوي على صور لصديقك وهو يبتسم، عابساً، ينظر لليسار، وينظر لليمين، فبإمكانه بناء نموذج ذهني ثلاثي الأبعاد مثالي لصديقك. يقوم AnyID بذلك رقمياً، حيث يدمج جميع مراجعك لإنشاء "ذاكرة ثلاثية الأبعاد مثالية" لهوية الشخص.

2. استراتيجية "المرساة والتعديل" (المرجع الأساسي والمطالبات التفاضلية)

هذا هو الجزء الأذكى في النظام. عندما تريد تغيير شيء ما (مثل الخلفية أو الملابس)، فإن أدوات الذكاء الاصطعي القديمة غالباً ما تغير وجه الشخص أو شعره بالخطأ أيضاً.

  • التشبيه: فكر في المرجع الأساسي (Primary Reference) كـ "المرساة". إنها الصورة التي تقول فيها: "هذا هو بالضبط كيف يجب أن يبدو شعره ووجهه".
  • المطالبة التفاضلية (Differential Prompt): بدلاً من كتابة وصف كامل جديد للمشهد (مما يربك الذكاء الاصطناعي)، أنت تخبر الذكاء الاصطناعي فقط بما يجب تغييره.
    • الطريقة القديمة: "رجل بشعر أس short قصير يرتدي سترة حمراء يقف على الشاطئ". (قد يجعل الذكاء الاصطناعي شعره أحمر اللون أو يغير وجهه بالخطأ).
    • طريقة AnyID: "غير السترة إلى اللون الأحمر وانقل الخلفية إلى الشاطئ". (يعرف AnyID أنه يجب الحفاظ على الشعر والوجه تماماً كما يظهر في صورة "المرساة"، وتغيير الأشياء المحددة التي طلبتها فقط).

3. "الناقد البشري" (التعلم التعزيزي - Reinforcement Learning)

تدريب الذكاء الاصطناعي على صنع الفيديوهات يشبه تعليم كلب. يمكنك أن تريه آلاف الأمثلة، لكنه قد يظل يخطئ في بعض التفاصيل (مثل جعل الشعر يبدو بلاستيكياً أو الحركة متقطعة).

  • التشبيه: بعد أن يتعلم الذكاء الاصطناعي الأساسيات، يدعوه الباحثون للعب دور "القاضي". يعرضون على الذكاء الاصطناعي فيديوهين: أحدهما يبدو جيداً والآخر يبدو غير دقيق قليلاً. يختار البشر الفائز. ثم يتعلم الذكاء الاصطناعي: "أوه، البشر يفضلون الفيديو الذي يظهر لمعان الشعر فيه بشكل أكثر سلاسة". ويكرر ذلك آلاف المرات، مما يجعله "يدرس للاختبار" حتى يطابق الذوق البشري تماماً.

لماذا هذا مهم؟

  • للمبدعين: يمكنك أخيراً صنع شخصيات ثابتة للقصص، أو الألعاب، أو وسائل التواصل الاجتماعي دون الحاجة إلى ميزانية هوليوود أو فريق من رسامي الرسوم المتحركة.
  • للجميع: إنه يحل مشكلة "الوادي غير المألوف" (Uncanny Valley). الشخصيات لا تبدو كآلات روبوتية غريبة أو مشوهة؛ بل تبدو كبشر حقيقيين يتحركون بشكل طبيعي.

باختيرة:
AnyID يشبه استوديو أفلام سحري يأخذ مجموعتك الفوضوية من الصور والفيديوهات، ويبني نموذجاً ثلاثي الأبعاد مثالياً للشخص، ثم يسمح لك بإخراجه ليفعل أي شيء تريده، مع ضمان بقائه تماماً كما هو في الحقيقة. إنه الفرق بين التخمين الضبابي والواقع عالي الدقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →