← أحدث الأبحاث
💻 computer science

Diffusion Forcing for Multi-Agent Interaction Sequence Modeling

تقدم هذه الورقة MAGNet، وهو إطار عمل انتشار ذاتي الانحدار موحد يعمل بفعالية على نمذجة وتوليد تسلسلات تفاعل متعددة الوكلاء فائقة الطول ومتماسكة من خلال التقاط التبعيات بين الوكلاء بشكل صريح للتعامل مع كل من السيناريوهات الاجتماعية المتزامنة بدقة والسيناريوهات ذات البنية المفككة عبر أحجام مجموعات متفاوتة.

المؤلفون الأصليون: Vongani H. Maluleke, Kie Horiuchi, Lea Wilken, Evonne Ng, Jitendra Malik, Angjoo Kanazawa

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Vongani H. Maluleke, Kie Horiuchi, Lea Wilken, Evonne Ng, Jitendra Malik, Angjoo Kanazawa

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يرقص، أو يلعب كرة القدم، أو مجرد الجلوس والاستمتاً مع مجموعة من الأصدقاء. الجزء الأصعب ليس فقط تعليم الروبوت كيفية تحريك أرجله؛ بل هو تعليمه كيفية التفاعل مع كل شخص في الغرفة في نفس الوقت.

إذا طلبت من روبوت أن يرقص مع شريك واحد، فالأمر يشبه محادثة بسية بين شخصين. ولكن إذا طلبت منه أن يرقص مع ثلاثة أو أربعة أو خمسة أشخاص، تصبح المحادثة فوضوية. من ينظر إلى من؟ متى يجب أن أخطو لليسار حتى لا أصطدم بالشخص الذي على يميني؟

تقدم هذه الورقة البحثية MAGNet، وهو عقل اصطناعي جديد مصمم لحل هذه الفوضى. فكر في MAGNet ليس كروبوت، بل كـ مخرج منظم للغاية لفيلم حيث يمكن للممثلين الارتجال بلا نهاية.

إليك كيف يعمل، مقسماً إلى مفاهف بسيطة:

1. "نظام تحديد المواقع النسبي" (السر الخفي)

تحاول معظم نماذج الذكاء الاصطناعي القديمة تذكر مكان الجميع في العالم باستخدام إحداثيات مطلقة (مثل "أنا عند X=10, Y=20"). هذا يشبه محاولة إعطاء اتجاهات بقولك: "امشِ 5 أميال شمالاً". إذا تحركت المجموعة بأكملها، تصبح الاتجاهات مربكة.

يستخدم MAGNet نظام تحديد مواقع نسبي (Relative GPS). فبدلاً من معرفة مكانك في العالم، فإنه يهتم فقط بـ أين أنت بالنسبة للشخص الذي بجانبك.

  • التشبيه: تخيل أنك في دائرة رقص مزدحمة. لست بحاجة لمعرفة عنوان قاعة الرقص؛ أنت فقط بحاجة لمعرفة أن "يدي اليسرى تبعد قدمين عن يد سارة اليمنى".
  • لماذا هذا مهم: هذا يسمح للذكاء الاصطناعي بالتعامل مع شخصين، أو 10 أشخاص، أو 100 شخص دون الحاجة لإعادة تدريبه. إنه مثل لغة تعمل سواء كنت تتحدث مع صديق واحد أو مع حشد كامل.

2. "الممحاة السحرية" (فرض الانتشار - Diffusion Forcing)

تستخدم الورقة تقنية تسمى Diffusion Forcing. تخيل أن لديك مجموعة من الممثلين على خشبة المسرح، لكن نصوصهم مغطاة بضجيج ساكن (مثل إشارة تلفزيون سيئة).

  • الطريقة القديمة: كان عليك تنظيف النص للممثل (أ)، ثم الممثل (ب)، ثم الممثل (ج)، واحداً تلو الآخر، بترتيب صارم.
  • طريقة MAGNet: يمكن للمخرج (MAGNet) النظر إلى المسرح بأكمله دفعة واحدة. يمكنه أن يقول: "حسناً، نص الممثل (أ) واضح، لكن نص الممثل (ب) مشوش. لنقم بتنظيف نص الممثل (ب) مع الحفاظ على نص الممثل (أ) كما هو تماماً".
  • النتيجة: هذا يسمح للذكاء الاصطناعي بالقيام بمهام مختلفة عديدة بـ نفس العقل:
    • الترميم (Inpainting): "إليك الرقصة الكاملة للشخص (أ)؛ يرجى ملء حركات الرقص المفقودة للشخص (ب)".
    • التنبؤ بالمستقبل (Future Prediction): "إليك كيف بدأوا الرقص؛ أرني كيف سيرقصون خلال الـ 10 دقائق القادمة".
    • تبادل الأدوار (Turn-Taking): "الشخص (أ) يتحرك أولاً، ثم يتفاعل الشخص (ب)، ثم يتفاعل الشخص (أ) مع ذلك".

3. "الماراثون اللانهائي" (التتابعات الطويلة جداً)

معظم نماذج الذكاء الاصطناعي تتعب بعد ثوانٍ قليهما. تبدأ في الهلوسة، مما يتسبب في انزلاق الأقدام عبر الأرضية أو مرور الأشخاص عبر الجدران.

  • التشبيه: تخيل عداءً يبدأ بقوة، ولكن بعد 100 متر، ينسى كيف يركض ويبدأ في المشي للخلف.
  • خدعة MAGNet: يقوم بتقسيم الجري الطويل إلى خطوات صغيرة ومتداخلة. إنه يتحقق باستمرار من عمله لضمان بقاء الأقدد على الأرض وعدم ابتعاد الناس عن بعضهم البعض.
  • الدليل: تظهر الورقة قدرة MAGNet على توليد مباراة ملاكمة تستمر لـ 1,800 إطار (حوالي دقيقة من الفيديو). بينما بدأت النماذج الأخرى في التباعد والتعثر، حافظ MAGNet على الملاكمين وهم يتبادلون اللكمات والمراوغة بتناغم تام طوال الوقت.

4. لماذا يعد هذا أمراً مهماً؟

قبل MAGNet، إذا أردت من روبوت أن:

  1. يتفاعل مع إنسان (تنبؤ الشريك)...
  2. يملأ فيديو مفقوداً (الترميم)...
  3. يحاكي رقص مجموعة من 4 أشخاص (التفاعل الجماعي)...

كنت بحاجة إلى ثلاثة روبوتات مختلفة، كل منها مدرب خصيصاً لمهمة واحدة. وإذا أردت تغيير المهمة، كان عليك بناء روبوت جديد.

MAGNet هو سكين سويسري متعدد الاستخدامات. إنه نموذج واحد يمكنه القيام بكل هذه الأشياء فوراً.

  • الأثر في العالم الحقيقي: هذا أمر ضخم لألعاب الفيديو (شخصيات غير لاعبة تتفاعل فعلياً مع الحشد)، والروبوتات (روبوتات يمكنها التنقل بأمان في مكتب مزدحم)، والواقع الافتراضي (صور رمزية تبدو حقيقية).

الملخص

فكر في MAGNet كمدرب ارتجال مثالي. هو لا يهتم بعدد الأشخاص في المشهد. ولا يهتم إذا كنت تريد التنبؤ بالمستقبل أو ملء الماضي. هو فقط يعرف كيف يجعل الجميع في المجموعة يتحركون معاً، ويظلون متناغمين، ولا يصطدمون ببعضهم البعض، بغض النظر عن طول المشهد.

إنه يحول الرياضيات الفوضوية لـ "من يلمس من" إلى محادثة سلسة وبسيطة يمكن للحاسوب فهمها وتوليدها بشكل مثالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →