Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
تقدم هذه الورقة أول تطبيق لنماذج محولات الرؤية (ViT) في التحديد الآلي للعناصر الدلالية على العملات الرومانية القديمة باستخدام بيانات متعددة الوسائط، مما يثبت أن نماذج ViT تتفوق على الشبكات العصبية الالتفافية (CNNs) التقليدية في الدقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة ومغبرة من العملات الرومانية القديمة. بعضها لامع، وبعضها متآكل، والعديد منها مغطى بالأوساخ. لقرون، لم يكن بإمكان سوى عدد قليل من الخبراء الذين يتمتعون بعقود من التدريب النظر إلى عملة ما، وتدقيق النظر في الصور الصغيرة الموجودة عليها، ليقولوا: "آه، هذه تحتوي على حصان"، أو "هذه تصور درعاً".
هذه الورقة البحثية تتحدث عن تعليم الحواسيب القيام بنفس المهمة، ولكن مع لمسة مختلفة: أراد الباحثون معرفة ما إذا كان نوع جديد من "أدمغة الحواسيب" يسمى محول الرؤية (Vision Transformer - ViT) أفضل من الشبكة العصبية الالتفافية (CNN) التقليدية والمعيارية.
إليك قصة تجربتهم، مقسمة إلى مصطلحات بسيطة.
المشكلة: مكتبة من 100,000 عملة
بدأ الباحثون بمجموعة ضخمة تضم 100,000 صورة لعملات ووصفها، مأخوذة من موقع مزادات عبر الإنترنت. فكر في هذا ككومة عملاقة من قطع الأحجية.
- التحدي: العملات القديمة صعبة. فهي غالباً ما تكون مخدوشة، والصور عليها تكون بأسلوب فني (غير واقعي)، ونفس نوع العملة قد يبدو مختلفاً قليلاً اعتماداً على القالب (السكّة) الذي استُخدم لصنعها.
- الهدف: بدلاً من مجرد مطابقة عملة بأخرى (مثل لعبة "ابحث عن التوأم")، أرادوا من الحاسوب أن يفهم معنى الصور. هل يمكن للحاسوب رصد "قرن الوفرة" (cornucopia)؟ هل يمكنه تمييز ما إذا كان الشكل "واقفاً" أم "جالساً"؟
المتنافسون: الحرس القديم ضد الوافد الجديد
لحل هذه المشكلة، وضعوا نموذجين مختلفين من بنية الحواسيب في مواجهة بعضهما البعض:
الـ CNN (المحقق المحلي):
تخيل محققاً ينظر إلى صورة من خلال فحص أجزاء صغيرة واحداً تلو الآخر. ينظر إلى الزاوية العلوية اليسرى، ثم العلوية اليمنى، ثم المنتصف. إنه بارع جداً في رصد الأنماط المحلية، مثل منحنى أو خط معين. ومع ذلك، يمكنه أحياناً الإصابة بـ "رؤية نفقية"، حيث يركز كثيراً على بقعة صغيرة ويغفل عن الصورة الكبيرة.الـ ViT (المراقب العالمي):
"محول الرؤية" هو الوافد الجديد في الساحة. بدلاً من النظر إلى الأجزاء واحداً تلو الآخر، تخيل محققاً ينظر إلى الصورة بأكملها دفعة واحدة، ويفهم فوراً كيف ترتبط الزاوية العلوية اليسرى بالزاوية السفلية اليرة. إنه يعامل الصورة كأنها جملة، حيث كل جزء مرتبط بكل جزء آخر. هذا يسمح له برؤية الروابط "بعيدة المدى" التي قد يغفل عنها المحقق المحلي.
التجربة: تدريب الأدمغة
كان على الباحثين تنظيف بياناتهم أولاً. فالصور الأصلية غالباً ما كانت تظهر جانبي العملة (الوجه والظهر) أو عدة عملات في كومة واحدة. لذا، كتبوا برنامجاً لقص الجانب الخلفي فقط ("الظهر") من العملة، وهو الجانب الذي يحتوي عادةً على الصور الأكثر إثارة للاهتمام.
بعد ذلك، قاموا بتغذية هذه الصور المنظفة في كلا نوعي الحواسيب.
- تم تدريب الـ CNN على مفهوم واحد محدد في كل مرة (مثلاً: "ابحث عن كل النسور").
- أما الـ ViT فكان متعدد المهام؛ فقد تعلم كيفية إيجاد جميع المفاهيم (النسور، الدروع، الخيول، إلخ) في نموذج واحد في نفس الوقت.
النتائج: من الفائز؟
بعد انتهاء التدريب، اختبروا الحواسيب على عملات لم يسبق لهم رؤيتها من قبل.
- الفائز: انتصر محول الرؤية (ViT) بشكل عام. فقد كان أكثر دقة في تحديد العناصر الدلالية (الصور) مقارنة بالـ CNN.
- السرعة: كان الـ CNN أسرع بكثير في التدريب (مثل العداء السريع)، بينما استغرق الـ ViT وقتاً أطول بكثير (مثل عداء الماراثون)، لكنه حقق في النهاية زمناً أفضل من حيث الدقة.
- "لماذا": وجد الباحثون أن الـ ViT كان أفضل في التعامل مع الطبيعة الفوضوية والمتآكلة للعملات. لم يرتبك بسه_القدر عندما كانت الصورة مختلفة قليلاً عما كان يتوقعه.
"الرؤية بالأشعة السينية" (خرائط البروز - Saliency Maps)
لفهم كيف كانت الحواسيب تفكر، استخدم الباحثون أداة تسمى "رسم خرائط البروز" (saliency mapping). هذا يشبه تسليط الأشعة السينية على الصورة لرؤية الأجزاء التي كان الحاسوب ينظر إليها لاتخاذ قراره.
- الأشعة السينية للـ CNN: مال الـ CNN للتركيز على بقعة واحدة صغيرة ومحددة. على سبيل المثال، عند البحث عن نسر، كان ينظر دائماً تقريباً إلى الزاوية اليمنى السفلية من العملة، حيث تظهر أجنحة النسر غالباً. كان الأمر أشبه بطالب حفظ أن "النسور توجد دائماً في أسفل اليمين" بدلاً من التعرف فعلياً على الطائر.
- الأشعة السينية للـ ViT: كان تركيز الـ ViT أكثر تشتتاً وتنوعاً. أحياناً كان ينظر إلى ريش النسر، وأحياناً إلى الخلفية، وأحياناً إلى النص القريب منه. كان من الصعب التنبؤ بمكانه بالضبط، لكن هذا يشير إلى أنه كان "يفهم" المشهد بأكمله بدلاً من مجرد حفظ موقع ما.
العقبة: الملصقات المشوشة
تعترف الورقة البحثية بوجود خلل رئيسي في التجربة: "الإجابات" التي قدموها للحواسيب كانت فوضوية.
لقد تم تدريب الحواسيب باستخدام الأوصاف النصية من موقع المزادات. لكن هذه الأوصاف غالباً ما كانت تتحدث عن جانبي العملة معاً.
- مثال: قد يقول الوصف: "الوجه: رأس إمبراطور. الظهر: حصان واقف".
- الخطأ: الحاسوب عُرض عليه الجزء الخلفي فقط (الحصان)، لكن الملصق قال "واقف". ومع ذلك، أحياناً كان الوصف يقول "واقف" بسبب الوجه الأمامي للعملة، رغم أن الظهر لا يحتوي على شكل واقف.
- النتيجة: كانت الحواسيب أحياناً تتعلم من الإشارات الخاطئة. وأشار الباحثون إلى أن هذا "الضجيج" قد حدّ من أداء كلا النموذجين، خاصة بالنسبة لمفاهيم مثل "واقف" أو "جالس".
الخاتمة
تخلص الورقة إلى أن محولات الرؤية (Vision Transformers) هي أداة واعدة جديدة لدراسة العملات القديمة. فقد تفوقت على نماذج الـ CNN الأقدم في الدقة، مما يشير إلى أن نهج "المراقب العالمي" هو الأنسب لعالم التاريخ القديم المعقد والفوضوي.
ومع ذلك، يحذر الباحثون من أنه للحصول على نتائج أفضل، نحتاج إلى بيانات أكثر نقاءً. فإذا استطعنا تعليم الحاسوب تجاهل نص "وجه العملة" عند النظر إلى "ظهر العملة"، فقد تصبح هذه الحواسيب المؤرخة الرقمية أكثر قوة حتى أكثر مما هي عليه الآن.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.