Seeing and Knowing in the Wild: Open-domain Visual Entity Recognition with Large-scale Knowledge Graphs via Contrastive Learning
تقترح هذه الورقة البحثية إطار عمل KnowCoL، وهو إطار للتعلم التبايني الموجه بالمعرفة يدمج المدخلات المرئية مع المعرفة النصية والهيكلية القائمة على ويكيداتا (Wikidata) لتحقيق أداء رائد في التعرف على الكيانات المرئية في النطاق المفتوح، لا سيالما بالنسبة للكيانات النادرة وغير المرئية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تسير في مكتبة ضخمة ولا متناهية حيث لا توجد الكتب على الرفوف فحسب، بل تطفو في الهواء. تحتوي هذه المكتبة على كل شيء في العالم: كل شجرة محددة، كل مبنى مشهور، كل حشرة نادرة، وكل شخصية مشهورة.
الآن، تخيل أنك أمين مكتبة لم يسبق له رؤية كتاب من قبل. سلم أحدهم إليك صورة لفراشة زرقاء غريبة وسألك: "ما هذا؟"
في الأيام الخوالي، كان أمناء المكتبة (نماذج الذكاء الاصطناعي) يتدربون فقط على قائمة ثابتة تضم 1,000 نوع من الحيوانات الشائعة. إذا عرضت عليهم فراشة زرقاء، فإما سيقولون: "لا أعرف"، أو سيخمنون أنها "فراشة" (وهو وصف عام جداً)، أو "عثة" (وهو أمر خاطئ). لم يكن بمقدورهم التعامل مع التنوع اللانهائي للعالم الحقيقي.
يقدم هذا البحث نوعاً جديداً من أمناء المكتبة يسمى KnowCoL. وإليك كيف يعمل، باستخدام تشبيهات بسيطة:
1. المشكلة: "لعبة الأسماء" مقابل "لعبة المعاني"
حاولت نماذج الذكاء الاصطناعي السابقة لعب لعبة "مطابقة الأسماء".
- الطريقة القديمة: ينظر الذكاء الاصطناعي إلى صورة لـ "عطارد" (كوكب) وصورة لـ "عطارد" (معدن سائل). كلاهما يحمل نفس الاسم. يصاب الذكاء الاصطناعي بالارتباك لأنه لا يرى سوى التسمية النصية. الأمر يشبه محاولة العثور على شخص يدعى "جون سميث" في حشد يضم 100 شخص يحملون نفس الاسم دون معرفة أي شيء آخر عنهم.
- الطريقة الجديدة (KnowCoL): بدلاً من مجرد مطابقة الأسماء، يلعب KnowCoL "لعبة المعاني". هو لا يسأل فقط: "ماذا يسمى هذا؟" بل يسأل: "ما هو هذا؟". إنه يفهم أن أحد "عطارد" هو كرة ضخمة من الصخور في الفضاء، والآخر هو معدن سائل لامع في ميزان الحرارة.
2. السلاح السري: "الخريطة فائقة الاتصال"
لعب لعبة المعاني، يستخدم KnowCoL خريطة رقمية ضخمة تسمى Wikidata.
- فكر في Wikidata كشبكة ضخمة ومترابطة من الحقائق. هي تعرف أن "بيج بن" هي جزء من "قصر وستمنستر"، الذي يقع في "لندن"، التي تقع في "إنجلترا".
- كانت نماذج الذكاء الاصطعي القديمة تنظر إلى صورة بيج بن بمعزل عن غيرها.
- أما KnowCoL، فينظر إلى الصورة ويربطها فوراً بهذا النسيج. يرى الأدلة البصرية ويقول: "آه، هذا البرج ذو الساعة مرتبط بمبنى محدد، المرتبط بدوره بمدينة محددة. لذلك، هذا ليس مجرد 'برج ساعة'؛ إنه Q41225 (بيج بن)".
3. التدريب: "التعلم عبر الارتباط" (التعلم التبايني)
كيف يتعلم الذكاء الاصطناعي القيام بذلك؟ يستخدم المؤلفون تقنية تسمى التعلم التبايني (Contrastive Learning).
تخيل أنك تعلم طفلاً التعرف على الكلاب.
- الطريقة القديمة: تعرض عليه صورة وتقول: "هذا كلب". تفعل ذلك لـ 1,000 كلب مختلف.
- طريقة KnowCoL: تعرض للطفل صورة لكلب من نوع "جولدن ريتريفر" وصورة لكلب من نوع "تشيواوا". تقول له: "كلاهما كلاب، لكنهما مختلفان". ثم تعرض صورة لقطة وتقول: "هذا ليس كلباً".
- يقوم الذكاء الاصطناعي بذلك مع الملايين من العناصر. إنه يتعلم تقريب الأشياء المتشابهة (مثل صورة لسيارة معينة ووصفها) من بعضها البعض في "عقله"، ودفع الأشياء المختلفة (مثل صورة لسيارة ووصف لموزة) بعيداً عن بعضها البعض.
4. سحر "الدمج" (Fusion)
يصف البحث وحدة "دمج" (Fuser). فكر في هذه الوحدة كأنها مترجم يتحدث لغتين في آن واحد:
- اللغة البصرية: ما تراه الكاميرا (الألوان، الأشكال، الملامس).
- اللغة المفاهيمية: ما تقول الموسوعة (الحقائق، العلاقات، التاريخ).
تقوم وحدة الدمج بأخذ صورة وسؤال (مثلاً: "ما هذه العجلة؟") وتترجمهما إلى "فكرة" واحدة في عقل الذكاء الاصطناعي. ثم تقارن هذه "الفكرة" مقابل خريطة Wikidata الضخمة للعثور على المطابقة المثالية.
5. النتيجة: "العبقري الصغير"
الجزء الأكثر إثارة للإعجاب في هذا البحث هو النتيجة.
- نماذج الذكاء الاصطناعي الأخرى التي تحاول حل هذه المشكلة تشبه العمالقة الضخمة: فهي ضخمة، ثقيلة، وتتطلب كميات هائلة من الطاقة (الحواسيب) للعمل.
- أما KnowCoL فهو يشبه المحقق الصغير والحاذق.
- هو أصغر بـ 35 مرة من أكبر منافسيه.
- ومع ذلك، فهو أفضل بنسبة 10.5% في تحديد الأشياء التي لم يسبق له رؤيتها من قبل (التعلم من عدم وجود بيانات مسبقة/Zero-Shot learning).
لماذا؟ لأنه لم يكتفِ بحفظ الصور؛ بل تعلم هيكل العالم. هو يعرف أنه إذا رأى "عجلة فيريس" (دولاب هواء)، فمن المرجح أنها "معلم سياحي"، مما يساعده على تخمين الإجابة الصحيحة حتى لو لم يسبق له رؤية تلك العجلة المحددة من قبل.
الملخص
KnowCoL هو ذكاء اصطناعي جديد لا يكتفي بـ "رؤية" الصور فحسب، بل "يفهمها" عبر ربطها بخريطة ضخمة ومنظمة من المعرفة البشرية. إنه يشبه منح الكمبيوتر عقلاً يمكنه قراءة الموسوعة أثناء النظر إلى صورة، مما يسمح له بتحديد الأشياء النادرة أو الغامضة أو غير المرئية بدقة مذهلة، كل ذلك بينما يظل صغيراً بما يكفي للعمل على حاسوب عادي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.