← أحدث الأبحاث
💻 computer science

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

يُعد CoInteract إطار عمل متكاملًا يقوم بتخليق مقاطع فيديو لتفاعل الإنسان مع الأشياء تتسم بالاتساق الفيزيائي، وذلك عبر دمج "خليط خبراء مدرك للبشر" لضمان الدقة الهيكلية، و"نموذج توليد مشترك ذي بنية مكانية" لفرض أولويات هندسة التفاعل، مما يتغلب على قيود الاستقرار وواقعية التلامس التي تعاني منها النماذج الانتشارية الحالية.

المؤلفون الأصليون: Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

نُشر 2026-04-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد إنشاء فيديو لشخص يمسك بمنتج معين (مثل كوب قهوة جديد أو حقيبة يد) ويتحدث عنه. لديك صورة الشخص، وصورة المنتج، ونص الكلام، وتسجيل صوتي لصوته. تريد من الذكاء الاصطناعي أن ينشئ فيديو واقعيًا حيث يمسك الشخص بالفعل بالشيء، ويحركه، ويتحدث بشكل طبيعي.

يبدو هذا سهلاً، لكن بالنسبة للذكاء الاصطناوي، الأمر يشبه محاولة التلاعب بالكرات أثناء ركوب دراجة أحادية العجلة على حبل مشدود. نماذج الذكاء الاصطناعي الحالية بارعة في جعل الأشياء تبدو جميلة، لكنها غالبًا ما تفشل في تطبيق قوانين الفيزياء. قد تجعل يد الشخص تمر عبر الكوب كأنه شبح، أو قد تندمج أصابعه معًا لتصبح كتلة واحدة مشوهة.

CoInteract هو نظام ذكاء اصطناعي جديد صُمم لحل هذه المشكلة تمامًا. فكر فيه كـ "مخرج ذكي" لا يكتفي بإخبار الذكاء الاصطناعي بما يجب رسمه فحسب، بل يعلمه أيضًا قواعد الفيزياء والتشريح.

إليك كيف يعمل، مقسمًا إلى مفاهيم بسيطة:

1. تدريب "الشبح مقابل الجسم الصلب" (التوليد المشترك ذو البنية المكانية)

تتعلم معظم نماذج الذكاء الاصطناعي من خلال النظر إلى ملايين الصور الملونة. هي تتعلم أن "الأيدي تبدو كجلد" وأن "الأكواب تبدو كخزف". لكنها لا تفهم حقًا أن اليد لا يمكن أن تدخل داخل الكوب.

يستخدم CoInteract خدعة ذكية تسمى التدريب ثنائي المسار (Dual-Stream Training). تخيل أن لدى الذكاء الاصطناعي زوجين من العيون يعملان في نفس الوقت:

  • عيون الألوان (مسار RGB): تنظر إلى الفيديو الطبيعي الملون. تتعلم الجمال، والإضاءة، والألوان.
  • عيون الأشعة السينية (مسار HOI): تنظر إلى نسخة "شبحية" من الفيديو. في هذه النسخة، تُجرد الألوان وتُترك فقط الخطوط الخارجية والأشكال (الظلال). ترى اليد كشكل صلب والمج كشكل صلب، ولكن بدون ألوان.

من خلال التدريب على كليهما في وقت واحد، يتعلم الذكاء الاصطناعي: "حسنًا، عيون الألوان ترى يدًا جميلة، لكن عيون الأشعة السينية تخبرني أن شكل اليد يجب أن يتوقف تمامًا حيث يبدأ شكل الكوب."

الخدعة السحرية: أثناء عملية إنشاء الفيديو الفعلية (الاستنتاج)، يستخدم الذكاء الاصطناعي "عيون الألوان" فقط. يتم إيقاف تشغيل "عيون الأشعة السينية". ولكن لأن الذكاء الاصطناعي تعلم قواعد الفيزياء أثناء التدريب باستخدامها، فإن الفيديو النهائي يكون صلبًا وواقعيًا تمامًا، دون الحاجة إلى قدرة حاسوبية إضافية لحساب الفيزياء في الوقت الفعلي.

2. "فريق المتخصصين" (خليط الخبراء المدرك للبشر)

عادة ما تكون نماذج الذكاء الاصطناعي مثل العاميين؛ فهي تحاول القيام بكل شيء بنفس القدر من القوة الذهنية. لكن الأيدي والوجوه أمور معقدة. فهي تحتوي على تفاصيل دقيقة (الأصابع، الرموش) التي يسهل إفسادها. إذا عامل الذكاء الاصطناعي اليد بنفس الطريقة التي يعامل بها خلفية الجدار، فقد تبدو الأصابع مثل السجق.

يقدم CoInteract مفهوم خليط الخبراء (Mixture-of-Experts - MoE). تخيل مكتبًا كبيرًا حيث معظم الموظفين عامون، ولكن هناك "غرفتين لكبار الشخصيات (VIP)":

  • متخصص الوجه: خبير صغير وسريع للغاية مخصص فقط للتأكد من أن العيون والأفواه تبدو حقيقية.
  • متخصص اليد: خبير صغير آخر مخصص فقط للتأكد من أن الأصابع لا تندمج أو تختفي.

هناك "مدير" ذكي (الموجه/Router) ينظر إلى كل جزء من الصورة. إذا رأى يدًا، فإنه يرسل ذلك الجزء فورًا إلى "متخصص اليد". وإذا رأى وجهًا، فإنه يرسله إلى "متخصص الوجه". أما بقية الأجزاء، فتذهب إلى العمال العامين.

هذا يعني أن الذكاء الاصطناعي يحصل على اهتمام متخصص للغاية للأجزاء الأكثر صعوبة من الجسم، دون الحاجة لجعل نظام الكمبيوتر بأكمله ضخمًا وبطيئًا.

3. "شرطي المرور" (الانتباه غير المتماثل)

للتأكد من أن "عيون الألوان" و"عيون الأشعة السينية" يتواصلان بشكل صحيح أثناء التدريب، يستخدم CoInteract قاعدة محددة تسمى الانتباه غير المتماثل (Asymmetric Attention).

فكر في الأمر كفصل دراسي:

  • طلاب الأشعة السينية (الهيكل) مسموح لهم بالنظر إلى طلاب الألوان (المظهر) لتعلم كيف يجب أن يكون المنتج النهائي.
  • لكن طلاب الألوان غير مسموح لهم بالنظر إلى طلاب الأشعة السينية. عليهم التركة في عملهم الخاص.

هذا يضمن أن الذكاء الاصطناعي يتعلم الهيكل من مسار الأشعة السينية ويطبقه على مسار الألوان، ولكن عندما يحين وقت توليد الفيديو النهائي، يكون مسار الألوان مستقلًا وسريعًا. إنه يشبه معلمًا يعطي الطالب ورقة غش أثناء التدريب، ولكنه يسحب ورقة الغش منه أثناء الامتحان النهائي. الطالب لا يزال يتذكر الإجابات لأنه تدرب باستخدام الورقة!

لماذا يهم هذا؟

قبل CoInteract، إذا طلبت من الذكاء الاصطناعي صنع فيديو لشخص يمسك بمنتج، كنت تحصل غالبًا على نتائج غريبة: أيدٍ تخترق الأشياء، أو أصابع تبدو كالشمع المذاب، أو منتج يتغير شكله.

يعالج CoInteract هذا من خلال:

  1. تعليم الذكاء الاصطناعي فيزياء الإمساك بالأشياء (حتى لا تخترق الأيدي الأكواب).
  2. منح الذكاء الاصطناعي متخصصين للأيدي والوجوه (لتبقى الأصابع متميزة).
  3. القيام بكل هذا بكفاءة، بحيث لا يكون توليد الفيديو بطيئًا أو مكلفًا.

باخت short، Co-Interact هو الفرق بين ذكاء اصطناعي يخمن فقط كيف يبدو الفيديو، وذكاء اصطناعي يفهم كيف يتفاعل البشر فعليًا مع العالم. إنه الجسر بين "الصور الجميلة" و"الفيزياء الواقعية".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →