Learning to See the Elephant in the Room: Self-Supervised Context Reasoning in Humans and AI
تُثبت هذه الورقة أن كلاً من البشر ونموذج "SeCo" الجديد المستوحى بيولوجياً يمكنهما تعلم وتعميم الاستدلال السياقي بسرعة لاستنتاج الأجسام الخفية من المشاهد المحيطة دون إشراف صريح، مما يسلط الضوء على الدور الحاسم للارتباطات السياقية في فهم المشهد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "تعلم رؤية الفيل في الغرفة"، باستخدام لغة بسيطة وتشبيهات إبداعية.
الفكرة الكبرى: الأمر لا يتعلق بالشيء فحسب، بل بالغرفة نفسها
تخيل أنك دخلت غرفة ورأيت جسماً صغيراً لامعاً على الطاولة. سيعرف دماغك فوراً: "من المرجح أن هذه شوكة". لن يخمن أنها فيل، أو محمصة خبز، أو سحابة. لماذا؟ لأنك لا تنظر إلى الشيء بمعزل عن غيره؛ بل تنظر إلى السياق. أنت ترى الطاولة، والطبق، والمنديل، وبيئة المطبخ. يستخدم دماغك هذه الأدلة ليعرف ماهية هذا الشيء.
تطرح هذه الورقة سؤالاً بسيطاً ولكنه عميق: كيف يتعلم البشر هذه "الأدلة" دون أن يخبرهم معلم بالقواعد؟ وهل يمكننا تعليم الكمبيوتر القيام بنفس الشيء؟
وجد المؤلفون أن البشر بارعون في تعلم هذه القواعد بمجرد مشاهدة المشاهد، حتى دون أن يقال لهم "هذه شوكة". كما قاموا ببناء نموذج ذكاء اصطناعي جديد يسمى SeCo (التعلم ذاتي الإشراف للاستنتاج السياقي - Self-supervised learning for Context reasoning)، وهو يتعلم بنفس الطريقة ويتفوق في الواقع على معظم نماذج الذكاء الاصطناعي الحالية.
الجزء الأول: التجربة البشرية (لعبة "الفريبل" - Fribble)
لاختبار كيفية تعلم البشر، كان على الباحثين خداع أدمغتنا. إذا عرضوا علينا مطبخاً حقيقياً، فسنقول ببساطة "هذه شوكة" لأننا رأينا ملايين الشوك من قبل. لن نكون بصدد تعلم قواعد جديدة؛ بل سنكون بصدد تذكر قواعد قديمة.
لذا، اخترعوا لعبة باستخدام كائنات "الفريبلز" (Fribbles).
- الإعداد: أخذوا منزلاً افتراضياً (مثل ألعاب الفيديو) واستبدلوا الأشياء العادية (مثل الميكروويف أو فرشاة الأسنان) بكائنات غريبة تشبه الكائنات الفضائية تسمى "فريبلز".
- القواعد: وضعوا قواعد سرية لهذه الـ "فريبلز".
- القاعدة العامة: "فريبل أ" يعيش دائماً في الحمام.
- القاعدة المحلية: "فريبل ب" يجلس دائماً بجانب نوع معين من الكراسي.
- قاعدة الازدحام: "فريبل ج" يتواجد دائماً في مجموعات مكونة من ثلاثة.
- التدريب: شاهد البشر فيديوهات قصيرة لهذه الـ "فريبلز" في منازلها الافتراضية. لم يتم إخبارهم بالقواعد، بل اكتفوا بالمشاهدة فقط.
- الاختبار (لعبة ارفع الغطاء): بعد المشاهدة، لعبوا لعبة. تم إخفاء "فريبل" خلف صندوق أسود، وكان على الإنسان تخمين ما خلف الصندوق بمجرد النظر إلى المحيط في الغرفة.
النتيجة: كان البشر جيدين بشكل مدهش! حتى دون وجود معلم يقول لهم "نعم، هذا صحيح"، تعلموا القواعد بمجرد المشاهدة. استطاعوا النظر إلى الحمام وتخمين: "من المرجح أنه فريبل الحمام"، حتى لو لم يروا هذا الكائن الفضائي المحدد من قبل.
الجزء الثاني: نموذج الذكاء الاصطناعي (SeCo)
أراد الباحثون بناء ذكاء اصطناعي يتعلم مثل البشر، وليس مثل روبوت يحفظ كتاباً مدرسياً.
معظم نماذج الذكاء الاصطناعي اليوم تتدرب على ملايين الصور المصنفة (مثلاً: "هذه قطة"، "هذا كلب"). هي بارعة في التعرف على الشيء نفسه، لكنها غالباً ما تفشل في فهم كيفية ارتباط الأشياء ببعضها البعض في المشهد.
بنى الفريق نموذج SeCo. وإليك كيف يعمل، باستخدام استعارة:
الدماغ ذو المسارين
تخيل أن عينيك لديهما طريقتان للرؤية:
- الرؤية المركزية (عالية الدقة): تنظر مباشرة إلى جسم ما لرؤية تفاصيله (مثل قراءة ملصق).
- الرؤية المحيطية (منخفضة الدقة): ترى المحيط الضبابي لتفهم "جوهر" الغرفة (هل هي مطبخ أم مرآب؟).
يحاكي SeCo هذا النظام. لديه "عينان":
- واحدة تنظر إلى الهدف (الجسم المخفي) بتفاصيل دقيقة.
- والأخرى تنظر إلى السياق (الغرفة الضبابية) لأخذ الانطباع العام.
"الذاكرة الخارجية" (خزانة ملفات الدماغ)
هذا هو الجزء الأروع. يمتلك SeCo وحدة "ذاكرة خارجية" خاصة. فكر في هذا الأمر كخزانة ملفات في دماغك.
- بينما يشاهد SeCo الفيديوهات، فإنه لا يحفظ الصور فحسب، بل يكتب ملاحظات في خزانة ملفاته.
- ملاحظة 1: "إذا رأيت مغسلة ومرآة، فيجب أن أتوقع وجود فرشاة أسنان".
- ملاحظة 2: "إذا رأيت سريراً وطاولة جانبية، فيجب أن أتوقع وجود مصباح".
عندما يرى SeCo جسماً مخفياً، فإنه ينظر إلى الغرفة، ويذهب إلى خزانة ملفاته، ويستخرج التخمين الأكثر احتمالاً بناءً على الأدلة. إنه يشبه المحقق الذي يستخدم قاعدة بيانات من الأدلة لحل لغز ما.
الجزء الثالث: من الفائز؟
وضع الباحثون البشر ونماذج الذكاء الاصطناعي في مواجهة مباشرة في لعبة "ارفع الغطاء".
- البشر ضد الذكاء الاصطناعي: حقق البشر أداءً رائعاً، لكن SeCo كان أفضل منهم. كان SeCo هو الذكاء الاصطناعي الوحيد الذي استطاع تخمين الجسم المخفي بشكل صحيح باستمرار، متفوقاً حتى على النماذج "الخاضعة للإشراف" (التي تتدرب مع معلمين/ملصقات).
- اختبار "الضبابية": قاموا بتضبيب الخلفية بحيث لا يستطيع الذكاء الاصطناعي رؤية التفاصيل الدقيقة. ظل البشر وSeCo قادرين على التخمين بشكل صحيح لأنهم اعتمدوا على شكل الغرفة، وليس على التفاصيل الصغيرة. أما نماذج الذكاء الاصطناعي الأخرى فقد ارتبكت.
- اختبار "الأحجية": قاموا ببعثرة الغرفة مثل قطع الأحجية. ظل البشر وSeCo في حالة جيدة، ولكن إذا كانت الأحجية مبعثرة جداً، حتى هم واجهوا صعوبة. وهذا يوضح أنهم يعتمدون على تخطيط الغرفة.
اختبار "التمهيد للجسم":
أخيراً، سألوا: "إذا كان لديك محمصة خبث، فأين ستضعها في هذه الصورة؟"
- نقر البشر على سطح المطبخ.
- نقرت نماذج الذكاء الاصطناعي القديمة في أماكن عشوائية أو غريبة.
- نقر SeCo في نفس المكان الذي نقر فيه البشر تماماً. لقد فهم أن محمصة الخبز تنتمي إلى أسطح العمل، وليس على الأرض أو في حوض الاستحمام.
الخلاصة:
عنوان البحث هو تلاعب بالعبارة الشه la (الفيل في الغرفة - الشيء الواضح الذي يتجاهله الجميع).
- الذكاء الاصطناعي القديم: يحاول تحديد "الفيل" من خلال النظر فقط إلى جلده وخرطومه.
- البشر وSeCo: يفهمون أنه إذا كان هناك شكل رمادي ضخم في غرفة المعيشة، فمن المرجح أن يكون فيلاً (أو تمثالاً ضخماً جداً)، ولكن إذا كان نفس الشكل في المطبخ، فهو بالتأكيد ليس فيلاً.
ببساطة:
تثبت هذه الورقة أنه لفهم العالم حقاً، لا يمكنك مجرد النظر إلى الأشياء. يجب أن تفهم العلاقات بينها. يتعلم البشر هذا بشكل طبيعي من خلال مشاهدة العالم. تعلم نموذج الذكاء الاصطناعي الجديد، SeCo، هذا من خلال مشاهدة الفيديوهات وبناء "ذاكرة" لكيفية تناغم الأشياء مع بعضها، دون الحاجة إلى معلم ليصحح واجباته المدرسية.
إنها خطوة كبيرة نحو جعل الذكاء الاصطناعي لا يكتفي فقط بـ "رؤية" الصور، بل "يفهم" المشاهد، تماماً كما نفعل نحن.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.