← أحدث الأبحاث
💻 computer science

SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild

تقترح الورقة البحثية SyncAnyone، وهو إطار عمل مبتكر يتكون من مرحلتين يجمع بين نموذج ملء الفراغات (inpainting) القائم على الانتشار (diffusion) وبين عملية ضبط لاحقة للتصحيح الذاتي خالية من الأقنعة، وذلك لتحقيق مزامنة شفاه عالية الدقة مدفوعة بالصوت مع الحفاظ على هوية الشخص واتساق الخلفية في السيناريوهات الواقعية.

المؤلفون الأصليون: Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مقطع فيديو لشخص يتحدث، ولكنك تريد تغيير ما يقوله ليتناسب مع مسار صوتي جديد (مثل دبلجة فيلم إلى لغة أخرى). الهدف هو جعل شفتيه تتحركان بدقة لتطابق الكلمات الجديدة دون تغيير وجهه، أو خلفيته، أو جعل الفيديو يبدو غريباً.

لفترة طويلة، حاول الباحثون في مجال الذكاء الاصطناعي حل هذه المشكلة باستخدام "استنسل رقمي" (قالب جاهز). إليك كيف كانت تعمل الطريقة القديمة، ولماذا تعتبر الطريقة الجديدة في هذه الورقة البحثية، والتي تسمى SyncAnyone، نقطة تحول جذري.

الطريقة القديمة: مشكلة "الاستنسل الضبابي"

تخيل أنك تحاول رسم فم جديد على صورة. كانت طرق الذكاء الاصطناعي القديمة تأخذ قطعة من الشريط اللاصق (القناع - Mask) وتغطي بها فم الشخص والمنطقة المحيطة به مباشرة. ثم يحاول الذكاء الاصطناعي تخمين كيف يجب أن يبدو الفم بناءً على الصوت، مع محاولة الحفاظ على بقية الوجه مرئياً.

توضح الورقة البحثية أن هذا النهج يعاني من عيب كبير:

  • إذا كان الشريط صغيراً جداً: يغش الذكاء الاصطناعي؛ حيث ينظر إلى الذقن أو الخدين لتخمين حركة الفم بدلاً من الاستماع إلى الصوت.
  • إذا كان الشريط كبيراً جداً: يصاب الذكاء الاصطناعي بالارتباك؛ حيث يقوم بالرسم فوق هوية الشخص أو معالم الخلفية عن طريق الخطأ، مما يجعل الفيديو يبدو ضبابياً أو مشوهاً، خاصة إذا أدار الشخص رأسه أو إذا تغير المشهد بسرعة.

الأمر يشبه محاولة إصلاح ثقب في جدار عن طريق الطلاء فوق قسم كبير من الغرفة؛ قد تصلح الثقب، لكنك ستفسد ورق الجدران والأثاث القريب.

الطريقة الجديدة: "التصحيح الذاتي في خطوتين" لـ SyncAnyone

يقترح مؤلفو هذه الورقة إطار عمل جديد يسمى SyncAnyone. بدلاً من الاعتماد على محاولة واحدة غير مكتملة، يستخدمون عملية "تصحيح ذاتي تدريجي" مكونة من مرحلتين. فكر في الأمر كفنان يرسم مسودة أولية أولاً، ثم يصقلها لتصبح لوحة فنية رائعة.

المرحلة الأولى: فنان "المسودة الأولية"

في المرحلة الأولى، يعمل الذكاء الاصطناعي كرسام ماهر ولكنه فوضوي قليلاً.

  • يستخدم طريقة "الاستنسل" القديمة (قناع الفم) ليتعلم كيفية تحريك الشفاه بدقة بناءً على الصوت.
  • ولأنها تستخدم الاستنسل، فإنها تضبط حركات الشفاه بشكل صحيح، ولكنها قد تترك بعض "البقع" أو العيوب الغريبة حول حواف الفم أو في الخلفية.
  • الخدعة السحرية: يقوم الباحثون بعد ذلك بتعليم ذكاء اصطناعي "المسودة الأولية" هذا كيفية إنشاء آلاف الفيديوهات التدريبية بمفرده. يأخذ فيديو، ويغير الصوت، وينشئ نسخة جديدة حيث تتحرك الشفاه بشكل مختلف، بينما يظل بقية الفيديو كما هو.

المرحلة الثانية: المحرر "المثالي"

الآن يأتي الجزء الذكي. يأخذ الباحثون ذكاء اصطناعي "المسودة الأولية" وفيديوهات التدريب التي صنعها، ويقومون بتدريب ذكاء اصطناعي ثانٍ (المرحلة الثانية) لإصلاح الأخطاء.

  • الإعداد: يعرضون للذكاء الاصطناعي الثاني فيديو "تالفاً" (الذي يحتوي على البقع من المرحلة الأولى) والفيديو الأصلي "المثالي".
  • الدرس: يخبرون الذكاء الاصطناعي الثاني: "مهمتك هي النظر إلى هذا الفيديو الفوضوي، والاستماع إلى الصوت الجديد، وإصلاح الفم فقط. يجب أن تحافظ على الخلفية ووجه الشخص تماماً كما كانا في الأصل."
  • النتيجة: لأن الذكاء الاصطناعي مطالب بـ "تنظيف" الفوضى، فإنه يتعلم تجاهل الخلفية والتركيز حصرياً على الشفاه. إنه يتعلم فصل (أو "فك تشابك") الفم المتحرك عن الوجه الثابت.

بحلول نهاية هذه العملية، لا يحتاج الذكاء الاصطناعي الثاني إلى "الاستنسل" (القناع)؛ فهو يعرف بالضبط أي البكسلات تنتمي للشفاه وأيها تنتمي للخلفية، مما يسم يسمح له بإجراء التغييرات دون تشويه بقية المشهد.

لماذا هذا مهم (وفقاً للورقة البحثية)

تزعم الورقة أن هذه الطريقة الجديدة أفضل بكثير في التعامل مع الفوضى في العالم الحقيقي مقارنة بالطرق السابقة. وتحديداً:

  • دورات الرأس الكبيرة: تعمل الطريقة حتى لو أدار الشخص رأسه إلى الجانب (حيث تفشل الطرق القديمة غالباً).
  • العوائق: إذا وضع شخص يده أمام وجهه، يحافظ الذكاء الاصطناعي على اليد هناك ويحرك الشفاه خلفها فقط.
  • تغير المشاهد: إذا انتقل الفيديو إلى خلفية مختلفة، فلا يرتبك الذكاء الاصطناعي؛ بل يحافظ على حدة الخلفية الجديدة.
  • الهوية: يظل الشخص في الفيديو يبدو نفسه، وليس نسخة ضبابية منه.

الخلاصة

إن SyncAnyone يشبه عملية تحرير من خطوتين:

  1. الخطوة 1: تعليم الذكاء الاصطناعي كيفية تحريك الشفاه باستخدام "عجلات تدريب" (القناع)، حتى لو ارتكب بعض الأخطاء حول الحواف.
  2. الخطوة 2: جعل الذكاء الاصطناعي يتدرب على إصلاح أخطائه الخاصة حتى يتعلم تعديل الشفاه بشكل مثالي دون الحاجة إلى عجلات التدريب أو إفساد الخلفية.

النتيجة هي أداة دبلجة فيديو أسرع، وأكثر حدة، وتعمل في مواقف كانت فيها أدوات الذكاء الاصطناعي السابقة ستفشل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →