← أحدث الأبحاث
💻 computer science

Neurosymbolic Object-Centric Learning with Distant Supervision

تقدم الورقة البحثية DeepObjectLog، وهو نموذج عصبي رمزي احتمالي يتعلم تمثيلات متمحورة حول الأشياء مباشرة من تسميات المهام العالمية عبر الإشراف البعيد، مما يتيح تعميماً فائقاً خارج نطاق التوزيع في مهام الاستدلال البصري دون الحاجة إلى تعليقات توضيحية لكل كائن على حدة.

المؤلفون الأصليون: Stefano Colamonaco, David Debot, Giuseppe Marra

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Stefano Colamonaco, David Debot, Giuseppe Marra

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت حل مسألة رياضية، لكنك لا تكتفي بإظهار النتيجة النهائية له فحسب، بل لا تظهر له الخطوات أو الأرقام الفردية أيضًا.

على سبيل المثال، تعرض على الروبوت صورة بها الرقم "3" والرقم "4" مكتوبان بخط يدوي، وتقول له: "الإجابة هي 7". أنت لا تخبر الروبوت أين يوجد الرقم 3، أو أين يوجد الرقم 4، أو حتى كم عدد الأرقام الموجودة في الصورة. أنت فقط تعطيه الصورة والمجموع النهائي.

هذا هو التحدي الذي تعالجه هذه الورقة البحثية. معظم نماذج الذكاء الاصطعي تشبه الطلاب الذين يحفظون نموذج الإجابة لكنهم لا يستطيعون إجراء العملية الحسابية فعليًا إذا تغيرت الأرقام. إنهم يواجهون صعوبة عندما تحتوي الصورة على عدد مختلف من العناصر أو مزيج جديد من الأشياء.

المشكلة: "الصندوق الأسود" مقابل "لغز المنطق"

ينقسم الذكاء الاصطناعي الحالي إلى معسكرين، كلاهما يعاني من عيوب:

  1. الشبكات العصبية البحتة (الصندوق الأسود): هي بارعة في التعرف على الأنماط ولكنها سيئة في التفكير المنطقي. إذا دربتها على جمع رقمين، فقد تتعلم التعرف على شكل المجموع "7" بدلاً من عملية الجمع الفعلية لـ 3 + 4. إذا أظهرت لها 4 + 3، فقد ترتبك لأن النمط يبدو مختلفًا قليلاً.

  2. الذكاء الاصطناعي العصبي الرمزي (لغز المنطق): تستخدم هذه النماذج قواعد منطقية صارمة (مثل "إذا كان أ + ب = ج"). هي بارعة في التفكير المنطقي، لكنها عادة ما تحتاج إلى إنسان ليخبرها أولاً بمكان الأشياء بالضبط. لا يمكنها النظر إلى صورة فوضوية والقول: "آه، هناك 3 هنا وهناك 4". إنها تحتاج إلى تقسيم الأشياء مسبقًا وتقديمها لها جاهزة.

الحل: DeepObjectLog (المحقق)

ابتكر المؤلفون نظامًا جديدًا يسمى DeepObjectLog. فكر فيه كمحقق يتعلم حل لغز من خلال النظر إلى مسرح الجريمة والنتيجة النهائية، دون أن يُخبر من هم المشتبه بهم.

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. نظام "الفتحات" (عدسة المحقق المكبرة)
تخيل أن لدى الذكاء الاصطناعي مجموعة من "الفتحات" غير المرئية أو العدسات المكبرة التي يمكنه وضعها في أي مكان على الصورة. هو لا يعرف عدد الأشياء الموجودة، لذا يوزع، لنقل، 5 عدسات مكبرة.

  • بعض العدسات تقع على الرقم "3".
  • بعضها يقع على الرقم "4".
  • بعضها يقع على مساحة فارغة من الخلفية.

2. سؤال "ماهية الشيء" (هل هو مشتبه به؟)
لكل عدسة مكبرة، يسأل الذكاء الاصطناعي: "هل هذا حقًا جسم (شيء)، أم مجرد ضجيج في الخلفية؟"

  • إذا كانت خلفية، يقول الذكاء الاصطناعي: "تجاهل هذه".
  • إذا كان جسمًا، يقول: "هذا مشتبه به!" ويحاول تخمين ماهيته (مثل: "هذا يبدو كأنه رقم 3").

3. "طبقة المنطق" (القاضي)
هذا هو الجزء السحري. يأخذ الذكاء الاصطناعي كل تخميناته ("المشتبه به أ هو 3، المشتبه به ب هو 4، المشتبه به ج ليس شيئًا") ويمررها عبر برنامج منطقي صارم (مثل كتاب قواعد الرياضيات).

  • يقول كتاب القواعد: "إذا جمعت أرقام المشتبه بهم الحقيقيين، يجب أن تتطابق النتيجة مع الإجابة النهائية التي أعطيناها لك (7)".
  • إذا أخطأ الذكاء الاصطناعي في تخمينه (على سبيل المثال، لو اعتقد أن الخلفية هي الرقم 5)، فلن يتطابق الحساب مع الرقم 7. طبقة المنطق تقول: "هذا غير منطقي"، وترسل إشارة عائدة إلى المحقق لتغيير رأيه.

4. التعلم من الخطأ
مرة تلو الأخرى، يعدل الذكاء الاصطناعي عدساته المكبرة. يتعلم أنه عندما تكون الإجابة النهائية هي 7، يجب عليه العث Ord 3 و 4. يتعلم تجاهل ضجيج الخلفية لأن تضمينه يكسر عملية الحساب.

لماذا يعد هذا أمرًا هامًا

تدعي الورقة البحثية أن هذا النهج متفوق لأنه يتعلم البنية وليس مجرد الحفظ.

  • التعميم (اختبار "اللغز الجديد"): إذا دربت الذكاء الاصطناعي على صور تحتوي على رقمين أو ثلاثة، ثم عرضت عليه صورة تحتوي على 5 أرقام، فلا يزال بإمكانه حلها. لماذا؟ لأنه تعلم قاعدة الجمع، وليس فقط نمط "رقمين". يمكنه تفعيل المزيد من "العدسات المكبرة" للتعامل مع الأرقام الإضافية.

  • لا حاجة للتسميات (Labels): لم يحتاج الذكاء الاصطناعي إلى إنسان ليرسم مربعات حول الأرقام. لقد اكتشف مكان الأشياء بمجرد محاولة استيفاء الإجابة النهائية.

  • أفضل من نماذج "العقل الكبير": اختبر المؤلفون نظامهم مقابل نماذج ذكاء اصطناعي ضخمة ومدربة مسبقًا (مثل تلك التي تدردش معك). حتى تلك النماذج الضخمة واجهت صعوبة في هذا اللغز المنطقي المحدد. أما DeepObjectLog، الأصغر حجمًا والمتخصص، فقد أصاب الإجابة بنسبة 90% من المرات.

الخلا الخلاصة

DeepObjectLog يشبه تعليم طفل الرياضيات من خلال إظهار نموذج الإجابة له وتركه يكتشف الأرقام بنفسه. من خلال الجمع بين القدرة على "رؤية" الأشياء (الإدراك) والقدرة على "التحقق من الحساب" (المنطق)، يتعلم الذكاء الاصطناعي فهم العالم بطريقة مرنة ومنطقية ولا تنهار عندما يتغير الموقف.

تظهر الورقة البحثية أن هذا يعمل في مهام مثل جمع الأرقام، والتعرف على أيدي اللعب في البوكر، وعد الأجسام في مشاهد معقدة، مما يثبت أن الذكاء الاصطناعي يمكنه تعلم "التفكير" في الأشياء حتى عندما لا يتم إخباره بالضبط ما هي تلك الأشياء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →