Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
فاز فريق "ميا" (Mia) بتحدي TextVQA لعام 2021 من خلال الضبط الدقيق لنموذج توليدي مسبق التدريب من نوع T5-3B باستخدام مهام تدريب مسبق متخصصة — وهي نمذجة اللغة المقنعة وتنبؤ الموضع النسبي — لمحاذاة الميزات متعددة الوسائط بفعالية للقراءة والاستدلال حول النصوص في الصور.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تلعب لعبة "أنا أرى" (I Spy) عالية المخاطر، ولكن بدلاً من البحث عن الألوان أو الأشكال فقط، يتعين عليك قراءة لافتات وقوائم وملصقات صغيرة وضبابية في صورة مزدحمة للإجابة على أسئلة معقدة.
على سبيل المثال، إذا عرض عليك شخص ما صورة لمقهى مزدحم وسألك: "ما هو اسم المشروب الموجود على الطاولة الثالثة من اليسار؟"، لا يمكنك مجرد رؤية "كوب" — بل يجب عليك التكبير، وقراءة النص الموجود على الكوب، وربطه بالموقع.
هذا هو تحدي TextVQA، ويصف الورقة البحثية كيف بنى فريق ميا (Team Mia) "عقلاً خارقاً" للفوز بهذه اللعبة. إليك كيف فعلوا ذلك، مقسماً إلى أفكار بسيطة.
1. العقل: "المترجم البارع" (نموذج T5)
معظم نماذج الذكاء الاصطناعي جيدة إما في الرؤية (البصر) أو القراءة (اللغة)، لكنها غالباً ما تعاني للقيام بكليهما في آن واحد. استخدم فريق ميا نموذجاً يسمى T5، وهو يشبه مترجماً عالمي المستوى.
بدلاً من مجرد تصنيف صورة على أنها "مطبخ"، تم تصميم هذا النموذج ليأخذ مزيجاً فوضوياً من المعلومات — السؤال، والأشياء التي يراها، والكلمات التي يقرؤها — و"يترجم" هذه الفوضى إلى إجابة واضحة ومنطوقة.
2. التدريب: "جلسة دراسة في مكتبة ضخمة"
قبل أن يرى النموذج أي سؤال فعلي من المسابقة، أخضع الفريقُ النموذجَ لـ "جلسة دراسة" هائلة.
- المكتبة الضخمة: لم يعطوه بضعة كتب فحسب؛ بل أعطوه 9 ملايين صورة تحتوي على نصوص. الأمر يشبه إجبار طالب على قراءة 9 ملايين لافتة شارع وملصق وملصق إعلاني قبل بدء الامتحان.
- تدريبات خاصة نوعان: للتأكد من أن العقل كان حاداً، أعطوه نوعين محددين من الواجبات المنزلية:
- تمرين "ملء الفراغات" (MLM): كانوا يخفون كلمة في جملة ويجعلون النموذج يخمنها. هذا يعلم النموذج كيف تتدفق اللغة.
- تمرين "أين هو؟" (RPP): كانوا يظهرون للنموذج نصاً وجسماً ما ويسألونه: "كم يبعدان عن بعضهما؟" هذا يعلم النموذج ربط كلمة "كوكا كولا" بالعلبة الحمراء الفعلية الموجودة على الطاولة.
3. السر الخفي: "التدريب التنافسي"
تخيل أنك تتدرب على كرة السلة. إذا تدربت فقط على التصويب نحو سلة لا تتحرك أبداً، فستكون سيئاً في مباراة حقيقية حيث يقفز المدافعون في وجهك.
استخدم الفريق التدريب التنافسي (Adversarial Training). لقد قاموا أساساً بـ "وخز" و"دفع" المنطق الداخلي للنموذج أثناء التدريب، مما جعل من الصعب على النموذج الحصول على الإجابة الصحيحة بسهولة. هذا أجبر الذكاء الاصطناعي على أن يصبح "أقوى" وأكثر استقراراً، حتى لا يرتبك بسبب النصوص الضبابية أو الإضاءة الغريبة في المسابقة الحقيقية.
4. اللمسة النهائية: "مدقق الإملاء"
حتى الطالب الأكثر ذكاءً قد يرتكب خطأً مطبعياً صغيراً، مثل كتابة "Appel" بدلاً من "Apple". ولمنع حدوث ذلك، أضاف الفريق وحدة معالجة لاحقة (باستخدام أداة تسمى fuzzywuzzy).
فكر في هذا كأنه محرر ودود يجلس بجانب الذكاء الاصطناعي. إذا أنتج الذكاء الاصطناعي إجابة صحيحة تقريباً ولكن بها خطأ إملائي صغير، يتدخل المحرر ويقول: "أعتقد أنك تقصد 'Apple'، أليس كذلك؟" ويصححها قبل تقديم الإجابة.
ملخص: وصفة الفوز
للفوز، اتبع فريق ميا منطقاً بسيطاً:
- ابدأ بعبقري: استخدم نموذج لغة ضخم ومُدرب مسبقاً.
- غذّه بكل شيء: أعطه ملايين الصور ليعرف كيف يبدو العالم.
- علمه الروابط: تأكد من أنه يعرف أن الكلمة والجسم هما في الواقع الشيء نفسه.
- اجعله قوياً: دربه ضد "المشتتات" حتى لا يرتبك.
- راجع العمل مرتين: استخدم مدققاً إملائياً لتنقية الإجابة النهائية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.