MaD Physics: Evaluating information seeking under constraints in physical environments
تقدم الورقة البحثية MaD Physics، وهو معيار مرجعي مبتكر صُمم لتقييم قدرة الوكلاء الاصطناعيين على استنتاج القوانين الفيزيائية والتخطيط للقياسات في ظل قيود الموارد من خلال اختبارهم في بيئات ذات قوانين فيزيائية معدلة، مما يكشف عن حدود قدرات الاستدلال العلمي والاستكشاف المنظم في نماذج Gemini الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق تحاول حل لغز ما، ولكن لديك قاعدة صارمة للغاية: لديك قدر محدود من المال لإنفاقه على الأدلة.
هذه هي الفكرة الجوهرية وراء مشروع بحثي جديد يسمى MaD Physics (قياس واكتشاف الفيزياء). قام الباحثون في Google DeepMind وMila بإنشاء اختبار يشبه ألعاب الفيديو لمعرفة مدى قدرة "العلماء الآليين" (AI scientists) على فهم كيفية عمل العالم عندما لا يمكنهم ببساطة البحث عن الإجابات في كتاب مدرسي ولا يستطيعون تحمل تكلفة فحص كل شيء.
إليك تفصيل بسيط لكيفية عمل ذلك وما وجدوه:
1. اللعبة: "صندوق الغموض"
في هذا الاختبار، يتم وضع الذكاء الاصطناعي في عالم افتراضي حيث تتحرك الأجسام من حوله. ولكن هناك خدعة: قواعد الفيزياء في هذا العالم مكسورة أو "معدلة" قليلاً.
- ربما لا تجذب الجاذبية الأشياء للأسفل بالطريقة المعتادة.
- ربما تدور المياه بنمط يتحدى ديناميكا السوائل الطبيعية.
- ربما تتصرف الجسيمات كما لو كانت متصلة بخيوط غير مرئية لا وجود لها في عالمنا الحقيقي.
الذكاء الاصطناعي لا يعرف هذه القواعد. عليه أن يفهمها من خلال مراقبة حركة الأجسام.
2. التحدي: "ميزانية الأدلة"
هذا هو الجزء الذي يأتي منه اسم "MaD". لدى الذكاء الاصطناعي ميزانية (مثل محفظة بها عدد محدد من العملات المعدنية).
- النظر إلى جسم ما يكلف مالاً.
- النظر عن قرب (دقة عالية) يكلف الكثير.
- النظر من بعيد (دقة منخفضة) يكلف القليل.
- الانتظار لفترة أطول للنظر يكلف وقتاً أكثر.
يجب على الذكاء الاصطناعي اتخاذ خيارات ذكية: "هل يجب أن أنفق ميزانيتي بالكامل في فحص جسم واحد بدقة شديدة، أم يجب أن أنفق القليل في فحص عشرة أجسام مختلفة للحصول على فكرة عامة؟"
إذا أهدر الذكاء الاصطناعي ماله على تخمينات سيئة، فسينفد منه المال قبل أن يتمكن من حل اللغز. وبمجرد انتهاء المال، تتوقف اللعبة، ويجب على الذكاء الاصطناعي التنبؤ بمكان وجود الأجسام في المستقبل بناءً فقط على الأدلة التي تمكن من شرائها.
3. العوالم الثلاثة
للتأكد من أن الذكاء الاصطناعي لا يقوم فقط بحفظ الحقائق الموجودة في العالم الحقيقي، اختبروه في ثلاثة "أكوان" مختلفة:
- عالم الكرة المرتدة (الميكانيكا الكلاسيكية): أجسام ترتد وتتصادم، ولكن مع "ذاكرة" غريبة وغير مرئية تجعل من الصعب دفعها في اتجاهات معينة.
- عالم المياه الدوامة (ديناميكا السوائل): سائل يتدفق، ولكن مع "قوة فضائية" غير مرئية تدفعه في أنماط دوران غريبة.
- عالم الجسيمات الشبحية (ميكانيكا الكم): جسيمات صغيرة تتصرف كموجات، ولكن مع لمسة مختلفة: قواعد كيفية ظهورها عند النظر إليها تختلف عن الواقع.
4. المشاركون في الاختبار
اختبر الباحثون أربع نسخ مختلفة من نماذج Gemini AI التابعة لـ Google (من نموذج أصغر وأسرع إلى نموذج أكبر وأذكى) لمعرفة مدى براعتها في هذه اللعبة.
5. النتائج: ما أخطأ فيه الذكاء الاصطناعي
كانت النتائج متواضعة بعض الشيء بالنسبة للذكاء الاصطناعي:
- لقد عانوا في أن يكونوا "استراتيجيين": غالباً ما كان الذكاء الاصطناعي ينفق ميزانيته بشكل غير فعال. فقد كان أحياناً ينظر إلى الأشياء الخاطئة أو ينظر بدقة شديدة إلى أشياء لا تهم، مما يؤدي لنفاد المال قبل فهم النمط.
- لم يستطيعوا "ابتكار" قوانين جديدة: عندما كانت الفيزياء معدلة، كان الذكاء الاصطناعي غالباً ما يحاول فرض قواعد العالم الحقيقي على العالم الجديد. كان الأمر يشبه محاولة حل لغز "سودوكو" باستخدام قواعد لعبة "الشطرنج".
- النماذج الأفضل كانت أفضل، لكن ليس بشكل مثالي: النماذج الأذكى (مثل Gemini 3) ارتكبت أخطاء أقل وكانت أفضل في التنبؤ بالمستقبل، لكنها لم تستطع أيضاً فهم "الشيفرة السرية" للفيزياء المعدلة بشكل مثالي.
- المرئيات جعلت الأمر أصعب: عندما كان على الذكاء الاصطناعي النظر إلى صور للأجسام المتحركة بدلاً من مجرد الأرقام، أصبح أكثر ارتباكاً.
الخلاصة
تخلص الورقة البحثية إلى أنه بينما يصبح الذكاء الاصطناعي جيداً جداً في الإجابة على الأسئلة التي يعرف إجاباتها بالفعل، فإنه لا يزال يعاني في الاكتشاف العلمي الحقيقي: القدرة على الخروج، وإنفاق الموارد المحدودة بحكمة، وجمع بيانات جديدة، وفهم قواعد لم توجد بعد.
فكر في الأمر بهذه الطريقة: الذكاء الاصطناعي بارع في كونه أميناً للمكتبة (يجد الكتب الموجودة)، لكنه لا يزال يتعلم كيف يكون مستكشفاً (يرسم خريطة لمنطقة لم يسبق لأحد رؤيتها من قبل). MaD Physics هي خريطة جديدة للباحثين ليروا بالضبط أين يضل الذكاء الاصطناعي طريقه حتى يتمكنوا من مساعدته على التعلم كيف يستكشف بشكل أفضل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.