← أحدث الأبحاث
🤖 AI

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

تقدم هذه الورقة نهجاً عصبياً رمزياً يجمع بين النماذج اللغوية الكبيرة لتوليد البرامج ذات المعلمات وبين التحسين البايزي لضبط المعلمات لحل مشكلات بونغارد، مما يسد الفجوة بين الإدراك البصري والاستدلال التجريدي.

المؤلفون الأصليون: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

نُشر 2026-02-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "مسائل بونغارد عند حدود الإدراك والاستنتاج"، باستخدام لغة بسيطة وتشبيهات إبداعية.

الصورة الكبيرة: تحدي "اللغز البصري"

تخيل أنك أمام مجموعة من 12 رسمة. ست منها "جيدة" (إيجابية) والست الأخرى "سيئة" (سلبية). مهمتك هي اكتشاف القاعدة السرية التي تفصل بين الجيدات والسيئات.

هذا ما يسمى "مسألة بونغارد" (Bongard Problem). هذه ليست مجرد ألعاب بسيطة مثل "أوجد الشكل المختلف". القواعد يمكن أن تكون معقدة للغاية.

  • مثال: ربما الصور "الجيدة" جميعها تحتوي على شكل له "عنق" أفقي، بينما العنق في الصور "السيئة" رأسي. أو ربما الأشكال في الصور "الجيدة" "متعرجة"، بينما الأشكال في "السيئة" "ملساء".

تسأل الورقة البحثية سؤالاً كبيراً: هل يمكن للذكاء الاصطناعي حل هذه الألغاز كما يفعل البشر؟ البشر بارعون في النظر إلى موقف جديد تماماً، وابتكار مفهوم جديد في اللحظة ذاتها (مثل "عنق أفقي") وتطبيقه. أما الذكاء الاصطناعي الحالي فهو بارع في التعرف على الأشياء التي رآها من قبل (مثل "هذه قطة")، لكنه غالباً ما يعاني عندما يتعين عليه ابتكار مفهوم جديد من الصفر.

المشكلة: الذكاء الاصطناعي إما جامد جداً أو غامض جداً

وجد الباحثون أن للذكاء الاصطناعي طريقتين رئيسيتين في التفكير، وكلتاهما تعانيان من عيوب عند حل هذه الألغاز:

  1. نهج "المحادثة" (اللغة الطبيعية):

    • كيف يعمل: ينظر الذكاء الاصطناعي إلى الصور ويحاول وصف القاعدة بالكلمات، مثل محقق يكتب تقريراً.
    • العيب: هو جيد في الأفكار الكبيرة لكنه سيء في الدقة. قد يقول: "الأشكال الجيدة مدببة نوعاً ما"، لكنه لا يستطيع التمييز بين شكل "مدبب قليلاً" وشكل "مدبب جداً". الأمر يشبه طباخاً يعرف أن الوصفة تتطلب "رشة ملح" لكنه لا يعرف بالضبط كم مقدار تلك الرشة.
  2. نهج "المبرمج" (الكود البرمجي):

    • كيف يعمل: يكتب الذكاء الاصطناعي برنامجاً حاسوبياً لفحص الصور. يمكنه قياس المسافات والزوايا والأعداد بدقة متناهية.
    • العيب: هو ممتاز في الدقة لكنه سيء في الإبداع. إذا كانت القاعدة هي "الشكل يبدو كوجه حزين"، فإن البرنامج الحاسوبي يكافح لتعريف كلمة "حزن" رياضياً. إنه يشبه روبوتاً يمكنه قياس الغرفة بالمليمتر، لكنه لا يستطيع فهم مفهوم "الدفء والراحة" (Cozy).

الحل: فريق "المترجم"

بنى المؤلفون نظاماً جديداً يعمل كـ فريق من متخصصين يعملان معاً. يسمون هذا النهج "النهج العصبي الرمزي" (Neurosymbolic) (الذي يجمع بين الشبكات العصبية/الذكاء الاصطناعي وبين المنطق الرمزي/البرامج).

إليك كيف يعمل هذا الفريق، خطوة بخطوة:

الخطوة 1: مولد الأفكار (الـ "Chatbot")

أولاً، نطلب من نموذج ذكاء اصطناعي قوي (نموذج لغوي بصري) النظر إلى اللغز وتخمين بعض القواعد المحتملة بلغة إنجليزية بسيطة.

  • تشبيه: تخيل جلسة عصف ذهني حيث يقترح كاتب مبدع: "ربما القاعدة تتعلق بـ 'عنق' الشكل!"

الخطوة 2: المترجم (الـ "Programmer")

بعد ذلك، يأخذ النظام تلك التخمينات الإنجليزية ويحاول تحويلها إلى كود برمحي.

  • اللمسة المميزة: لا يكتب الذكاء الاصطناعي الكود فحسب، بل يترك "فراغات" للأرقام الصعبة. على سبيل المثال، إذا كانت القاعدة هي "الأشكال ذات عنق أطول من X"، فإن الذكاء الاصطناعي يكتب الكود ولكنه يترك (X) كمتغير مجهول.
  • تشبيه: الكاتب يقول: "العنق يجب أن يكون أطول من [فراغ]". المبرمج يجهز الآلة لقياس العنق لكنه ينتظر الرقم الدقيق.

الخطوة 3: الضبط (التحسين البايزي - Bayesian Optimization)

هذا هو "السر الخفي". يخضع النظام لعملية "تجربة وخطأ" لإيجاد الرقم المثالي لتلك الفراغات. يختبر أرقاماً مختلفة (مثل 5 بكسل، 10 بكسل، 15 بكسل) ليرى أي منها يفصل تماماً بين الصور "الجيدة" والصور "السيئة".

  • تشبيه: تخيل أنك تضبط جهاز الراديو. أنت تعلم أن المحطة موجودة في مكان ما بين 90 و100، لكنك لا تعرف التردد الدقيق. أنت تقوم بتدوير القرص ببطء حتى يختفي التشويش وتصبح الموسيقى مثالية. النظام يفعل هذا رياضياً لإيجاد "نقطة القطع" الدقيقة للقاعدة.

الخطوة 4: الحَكَم (المُحقِّق - The Verifier)

أخيراً، يتحقق النظام: "هل يعمل هذا الكود فعلياً على جميع صور التدريب؟"

  • إذا عمل الكود بشكل مثالي، يقبل النظام القاعدة.
  • إذا فشل الكود، يعود النظام إلى "الـ Chatbot" ويقول له: "هذه الفكرة لم تنجح، جرب مرة أخرى"، وتتكرر الدورة.

ماذا وجدوا؟

اختبر الباحثون هذا "النهج الجماعي" مقابل أفضل نماذج الذكاء الاصطناعي المتاحة (مثل GPT-4o و Claude 3.7) وحتى مقابل أداء البشر المتوسط.

  1. الفريق يفوز: من خلال الجمع بين إبداع "الـ Chatbot" ودقة "المبرمج"، حل نظامهم 51 من أصل 100 من مسائل بونغارد.
  2. التفوق على البشر: حل البشر المتوسط في الدراسات السابقة حوالي 47 مسألة. أما فريق الذكاء الاصطناعي الخاص بهم فقد حل 51 مسألة، مما يمثل المرة الأولى التي يتفوق فيها الذكاء الاصطناعي على متوسط الأداء البشري في هذا الاختبار المحدد.
  3. نقاط قوة مختلفة:
    • عندما كانت المسألة تتعلق بـ الهندسة والرياضيات (مثل "هل هذه الخطوط متوازية؟")، كان جزء "المبرمج" في الفريق هو البطل.
    • عندما كانت المسألة تتعلق بـ مفاهيم مجردة (مثل "هل هذا الشكل 'مفتوح' أم 'مغلق'؟")، كان جزء "الـ Chatbot" هو البطل.
    • عندما استخدموا "الـ Chatbot" فقط أو "المبرمج" فقط، كان أداؤهم أسوأ. لقد كانوا بحاجة إلى كليهما.

فحص "الحفظ" (الـ Memorization)

كان الباحثون قلقين من احتمال قيام الذكاء الاصطناعي بـ "الغش" عبر حفظ الإجابات من الإنترنت (بما أن هذه الألغاز قديمة وشائعة). لاختبار ذلك، قاموا بقلب القواعد: أخبروا الذكاء الاصطناعي أن الصور "السيئة" هي في الواقع الصور "الجيدة". ظل الذكاء الاصطناعي يعمل بشكل جيد، مما أثبت أنه لم يكن مجرد يسترجع إجابات محفوظة، بل كان يكتشف المنطق فعلياً.

الخلاصة

تظهر هذه الورقة البحثية أنه لحل الألغاز البصرية الصعبة، لا ينبغي للذكاء الاصطناعي أن يحاول فقط "التفكير" كإنسان أو "الحساب" ككمبيوتر. بل يجب عليه القيام بـ الأمرين معاً. من خلال السماح لذكاء اصطناعي مبدع باقتراح الأفك والأخر دقيق بالتحقق منها باستخدام الرياضيات الدقيقة، يمكننا بناء أنظمة تتعلم المفاهيم البصرية الجديدة بنفس كفاءة البشر، وأحياناً بشكل أفضل منهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →