COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization
تقدم الورقة البحثية COGITAO، وهو إطار عمل ومعيار مفتوح المصدر ونمطي يقوم بتوليد الملايين من المهام البصرية الفريدة القائمة على القواعد لدراسة وتوضيح أوجه القصور في النماذج الحالية المتطورة في تركيب المفاهيم المتعلمة والتعميم على الإعدادات الجديدة بشكل منهجي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيفية تنظيف غرفتك. أنت تريه كيف يلتقط جوربًا ويضعه في سلة الغسيل. ثم تريه كيف يلتقط كتابًا ويضعه على الرف.
إذا كان الروبوت ذكيًا حقًا، فيجب أن يكون قادرًا على استنتاج كيفية التقاط جورب ثم وضعه على الرف، أو التقاط كتاب ثم وضعه في سلة الغسيل، حتى لو لم تكن قد أريته تحديدًا تلك التوليفات بعينها. هذه القدرة على خلط ودمج المهارات المتعلمة لحل مشكلات جديدة تسمى التعميم التركيبي (Compositional Generalization). إنها قوة خارقة للذكاء البشري، لكن بالنسبة للذكاء الاصطناعي، فهي تشبه محاولة تعليم كلب حساب التفاضل والتكامل.
تقدم هذه الورقة أداة جديدة تسمى COGITAO (اسم طويل النطق، لذا دعونا نسميها "مختبر الليغو") مصممة لاختبار مدى براعة الذكاء الاصطناعي في هذا النوع من الخلط والدمج.
المشكلة: الذكاء الاصطناعي هو "مطابق للأنماط"، وليس "مفكرًا"
نماذج الذكاء الاصطناعي الحالية (مثل تلك التي تشغل برامج الدردشة الآلية أو مولدات الصور) بارعة للغاية في حفظ الأنماط. إذا أريتها مليون صورة لقطة، يمكنها تمييز القطة. ولكن إذا طلبت منها القيام بشيء جديد قليلًا — مثل "تدوير القطة ثم جعل لونها أزرق" — فغالبًا ما ترتبك. فهي تميل إلى التخمين بناءًا على ما رأته من قبل، بدلًا من فهم القواعد الفعلية لكيفية دمج الإجراءات.
أراد الباحثون طريقة لاختبار ذلك دون فوضى العالم الحقيقي (مثل الإضاءة السيئة أو الغرف الفوضوية). كانوا بحاجة إلى بيئة نظيفة ومنضبطة.
الحل: "مختبر الليغو" (COGITAO)
فكر في COGITAO كصندوق رمال رقمي ضخم ولانهائي مكون من شبكات (مثل ورق الرسم البياني).
- الأجسام: بدلًا من القطط أو السيارات الحقيقية، يرى الذكاء الاصطناعي أشكالًا بسيطة (مربعات، دوائر، كتل غريبة) مصنوعة من بكسلات ملونة.
- الإجراءات: أنشأ الباحثون "صندوق أدوات" يحتوي على 28 حركة بسيطة. يمكنك تدوير شكل، أو تحريكه للأعلى، أو قلبه، أو تغيير لونه، أو قطع جزء منه.
- اللعبة: يُعطى الذكاء الاصطناعي "شبكة مدخلات" (صورة لأشكال) و"قاعدة" (قائمة من الحركات، مثل "دوران 90 درجة، ثم تحرك للأعلى"). وعليه أن يرسم "شبكة المخرجات" (كيف سيبدو الشكل بعد تنفيذ الحركات).
تكمن روعة COGITAO في قدرته على توليد الملايين من الألغاز الفريدة. يمكنه صنع قواعد سهلة (تحريك شكل واحد فقط) أو صعبة للغاية (تدوير ثلاثة أشكال، قلب اثنين، وتغيير ألوان جميعها بترتيب معين).
التجربة: اختبار عقل الذكاء الاصطناعي
أخذ الباحثون عدة نماذج متطورة من الذكاء الاصطناعي (بعضها مصمم للرؤية، وبعضها للغة، وبعضها مصمم "للتفكير" خطوة بخطوة) وأدخلوا عليها مختبر COGITAO.
أجروا نوعين رئيسيين من الاختبارات:
اختبار "الخلط والدمج" (التعميم التركيبي):
- التدريب: يتعلم الذكاء الاصطناعي "التدوير" و"التحرك للأعلى" بشكل منفصل. كما يتعلم القيام بـ "التدوير ثم التحرك للأعلى".
- الاختبار: يُطلب من الذكاء الاصطناعي القيام بـ "التحرك للأعلى ثم التدوير".
- النتيجة: على الرغم من أن الذكاء الاصطناعي عرف كلا الحركتين تمامًا، إلا أنه فشل فشلًا ذريعًا عندما طُلب منه تبديل الترتيب. كان الأمر أشبه بطاهٍ يعرف كيفية تقطيع البصل وكيفية قلي البيض، ولكن عندما طُلب منه قلي بيضة ثم تقطيع البصل، قام بقلي البصلة وتقطيع البيضة فقط.
اختبار "البيئة الجديدة" (التعميم المنهجي):
- التدريب: يتعلم الذكاء الاصطناعي تحريك الأشكال على شبكة صغيرة 10×10 مع شكلين.
- الاختبار: يُطلب من الذكاء الاصطناعي تحريك الأشكال على شبكة ضخمة 20×20 مع 10 أشكال.
- النتيجة: ارتبك الذكاء الاصطناعي. لم يستطع رفع مستوى منطقه. كان الأمر كتعليم شخص القيادة في موقف سيارات، ثم توقع قيادته لسيارة فورمولا 1 على طريق سريع فورًا.
المفاجأة الكبرى: "العناد"
وجدت الورقة شيئًا مذهلاً حول كيفية فشل الذكاء الاصطناعي. أطلقوا عليه اسم "العناد" (Stubbornness).
عندما واجه الذكاء الاصطناعي لغزًا جديدًا وصعبًا، لم يحاول اكتشاف القواعد الجديدة. بدلاً من ذلك، تجاهل التعليمات الجديدة وفعل ما تدرب على فعله في أغلب الأحيان.
- مثال: إذا تم تدريب الذكاء الاصطناعي غالبًا على "التحرك لليمين"، وطلبت منه "التحرك لليسار"، فإنه غالبًا ما سيقوم بـ "التحرك لليمين" على أي حال. لقد كان "كسولًا" جدًا لتعلم القاعدة الجديدة واكتفى بالعودة إلى عادته القديمة.
لماذا يهم هذا؟
قد تفكر: "وماذا في ذلك؟ إنها مجرد لعبة شبكات."
لكن هذا أمر بالغ الأهمية لمستقبل الذكاء الاصطناعي.
- الروبوتات في العالم الحقيقي: إذا لم يستطع الروبوت تعلم "فتح الثلاجة" و"إحضار الحليب" بشكل منفصل ثم دمجهما لـ "إحضار الحليب من الثلاجة"، فلن يكون مفيدًا أبدًا في منزل حقيقي.
- الذكاء الحقيقي: يمكن للبشر تعلم بعض المفاهيم الأساسية ودمجها بطرق لا نهائية. أما الذكاء الاصطناعي الحالي فهو عالق في حلقة مفرغة من الحفظ. يثبت COGITAO أن مجرد جعل الذكاء الاصطناعي أكبر أو تدريبه على المزيد من البيانات ليس هو الحل. نحن بحاجة إلى بناء ذكاء اصطناعي يفهم حقًا كيفية دمج الأفكار، وليس فقط كيفية نسخها.
الخلاصة
COGITAO هو بمثابة اختبار جهد لقدرة الذكاء الاصطناعي على التفكير الشبيه بالبشر. إنه يوضح لنا أنه بينما يعد الذكاء الاصطناعي الحالي حافظًا بارعًا، فإنه لا يزال "مدمجًا" سيئًا للغاية. لا يمكنه بسهولة خلط ودمج مهاراته لحل مشكلات جديدة.
تخلص الورقة إلى أنه ما لم نتمكن من بناء ذكاء اصطناعي يجتاز اختبار COGITAO، فنحن لا نزال بعيدين عن إنشاء آلات تفكر حقًا مثل البشر. نحن نبني ببغاوات ذكية يمكنها تكرار ما سمعته، لكننا لم نبنِ بعد المفكرين الذين يمكنهم تأليف ألحانهم الخاصة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.