← أحدث الأبحاث
🤖 AI

Interpreting Physics in Video World Models

تتقصى هذه الورقة كيفية تمثيل نماذج عالم الفيديو للخصائص الفيزيائية، حيث اكتشفت أنها لا تستخدم متغيرات عاملية مثل المحركات الكلاسيكية، بل تعتمد بدلاً من ذلك على تمثيل عالي الأبعاد وموزع ينبثق عند عمق وسيط محدد داخل بنية النموذج.

المؤلفون الأصليون: Sonia Joseph, Quentin Garrido, Randall Balestriero, Matthew Kowal, Thomas Fel, Shahab Bakhtiari, Blake Richards, Mike Rabbat

نُشر 2026-02-10
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sonia Joseph, Quentin Garrido, Randall Balestriero, Matthew Kowal, Thomas Fel, Shahab Bakhtiari, Blake Richards, Mike Rabbat

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد فيلماً لكرّة تتدحرج عبر أرضية. حتى لو لم تكن قد رأيت كرة من قبل، فأنت تعرف بالفطرة أنها إذا اصطدمت بجدار، فمن المفترض أن ترتد، وإذا كانت تتحرك بسرعة، فلن تتوقف فوراً. لديك "محرك فيزياء مدمج" في دماغك.

لفترة طويلة، تساءل علماء الكمبيوتر: هل تمتلك نماذج الذكاء الاصطناعي (مثل تلك التي تولد الفيديوهات) "محرك فيزياء مدمج"، أم أنها مجرد بارعة جداً في تخمين شكل البكسل التالي بناءً على الأنماط؟

هذه الورقة البحثية، "تفسير الفيزياء في نماذج عالم الفيديو"، تذهب إلى "ما وراء الكواليس" لهذه النماذج لتكتشف ذلك. إليك تفصيل لما وجدوه، باستخدام بعض التشبيهات اليومية.


1. "منطقة ظهور الفيزياء" (سن المراهقة)

وجد الباحثون أن نماذج الذكاء الاصطناعي لا تفهم الفيزياء على الفور.

فكر في نموذج الذكاء الاصطناعي كطالب يمر بمراحل الدراسة. في "الصفوف الأولى" (الطبقات الأولى للذكاء الاصطناعي)، لا يرى النموذج سوى أشياء أساسية — مثل الألوان والأشكال. إنه يشبه طفلاً صغيراً يرى كرة ولكنه لا يفهم معنى "السرعة".

ولكن بعد ذلك، عند نقطة محددة للغاية — حوالي ثلث الطريق عبر "دماغه" — يحدث شيء سحري. يطلق الباحثون على هذه النقطة اسم منطقة ظهور الفيزياء. إنها تشبه "سن المراهقة" حيث ينتقل النموذج فجأة من رؤية صور ثابتة إلى فهم الحركة والقواعد. فجأة، يمكنه تحديد ما إذا كان الفيديو "مستحيلاً" (مثل مرور كرة عبر جدار) أو "ممكناً".

2. السرعة مقابل الاتجاه ("كيف سريع" مقابل "إلى أين")

قام الباحثون بتفكيك الحركة إلى جزأين: السرعة (مدى سرعة الشيء) والاتجاه (إلى أين يتجه).

اكتشفوا أن الذكاء الاصطناعي متخصص نوعاً ما:

  • السرعة سهلة: يتعلم الذكاء الاصطناعي مدى سرعة تحرك الأشياء بشكل فوري تقريباً. إنه يشبه السائق الذي يعرف أنه يضغط على دواسة الوقود، حتى لو لم يكن يعرف أي طريق سيسلك.
  • الاتجاه صعب: لا "يفهم" الذكاء الاصطناعي الاتجاه فعلياً حتى يصل إلى "منطقة ظهور الفيزياء" المذكورة أعلاه. يجب عليه ربط أجزاء مختلفة من الفيديو معاً ليدرك: "أوه، هذا الجسم يتحرك في ذلك الاتجاه".

3. الدماغ "الموزع" (الأوركسترا مقابل العازف المنفرد)

هذا هو الاكتشاف الأكثر أهمية. هناك طريقتان يمكن للذكاء الاصطناعي من خلالهما تمثيل الفيزياء:

  1. طريقة محرك الفيزياء (العازف المنفرد): يمتلك الذكاء الاصطناعي "مجلداً" محدداً في دماغه بعنوان "السرعة المتجهة" وآخر بعنوان "التسارع". إنه منظم ومرتب وسهل القراءة.
  2. الطريقة الموزعة (الأوركسترا): لا يوجد "مجلد" واحد. بدلاً من ذلك، يتوزع مفهوم "الاتجاه" عبر مئات الإشارات الصغيرة المختلفة، والتي تعزف جميعها معاً مثل الأوركسترا. لتغيير اتجاه جسم ما في عقل الذكاء الاصطناعي، لا يمكنك مجرد تدوير مقبض واحد؛ بل يجب عليك ضبط عشرات "الآلات" المختلفة في وقت واحد.

وجد الباحثون أن الذكاء الاصطناعي يستخدم طريقة الأوركسترا. فهو لا يستخدم معادلات رياضية مرتبة ونظيفة كما يفعل الفيزيائي البشري، بل يستخدم شبكة ضخمة ومعقدة و"فوضوية" من الروابط. إنه ليس "محرك فيزياء" بالمعنى التقليدي، بل هو نسخة "موزعة" تعمل بنفس الكفاءة.

4. السر "الدائري" (البوصلة)

عندما نظر الباحثون في كيفية تخزين الذكاء الاصطناعي لـ "الاتجاه"، وجدوا شيئاً جميلاً. لا يخزن الذكاء الاصطناعي الاتجاه كرقم بسيط (مثل "الشمال = 1"). بدلاً من ذلك، يخزنه في نمط دائري، تماماً كما تعمل الأدمغة البيولوجية (بما في ذلك أدمغتنا!).

إنه يشبه البوصلة حيث يكون كل اتجاه جزءاً من حلقة مستمرة. وهذا يسمح للذكاء الاصطناعي بفهم أنه إذا استدرت 359 درجة، فأنت على وشك العودة إلى 0 درجة.


الملخص: الصورة الكبيرة

إذا سألت بشرياً، "كيف تتحرك تلك الكرة؟" سيقول، "لديها سرعة قدرها 5 أمتار في الثانية نحو اليسار".

أما إذا سألت هذا الذكاء الاصطناعي، فليس لديه إجابة بالكلمات. بدلاً من ذلك، لديه رقصة هائلة ومتمايلة من البيانات عالية الأبعاد تحدث في طبقاته الوسطى. هو لا "يحسب" الفيزياء؛ بل "يشعر" بإيقاع الحركة من خلال شبكة معقدة من الأنماط.

الخلاصة: الذكاء الاصطناعي لا يفكر كعالم يستخدم الآلة الحاسبة؛ بل يفكر كموسيقي ماهر يفهم "تدفق" العالم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →