Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts
تقترح هذه الورقة البحثية الضبط المرن البصري (VAPT)، وهي طريقة تعزز القدرة التعبيرية الوظيفية لخبراء المطالبات ضمن إطار عمل "خليط من الخبراء" لتحسين القدرة على التكيف والأداء في ضبط نماذج الرؤية بكفاءة في المعلمات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طباخاً محترفاً عالمياً (هذا هو نموذج الرؤية المدرب مسبقاً) يعرف كيف يطبخ أي شيء تقريباً.
الآن، تخيل أنك تريد من هذا الطباخ أن يتخصص في مطبخ محدد للغاية، لنقل مثلاً: "أكل الشوارع من قرية معينة في تايلاند".
الطريقة القديمة: الضبط الدقيق البصري للنماذج (VPT)
في الطريقة القديمة (VPT)، بدلاً من إعادة تدريب الطباخ، أنت فقط تعطيه بطاقة وصفة ثابتة ("المطالبة" أو الـ Prompt). تقول هذه البطاقة: "استخدم المزيد من الليمون، واستخدم المزيد من الفلفل الحار، واستخدم المزيد من صلصة السمك".
يقرأ الطباخ البطاقة ويحاول تطبيق تلك التعليمات على كل طبق يصنعه. ولكن هناك مشكلة: الحساء الحار يحتاج إلى كمية ليمون تختلف عن طبق "الستير فراي" الحار. ولأن بطاقة الوصفة ثابتة (لا تتغير أبداً)، لا يستطيع الطباخ التكيف. إنه عالق في اتباع نفس "القاعدة العامة" للتوابل لكل طبق، مما يؤدي إلى نتائج متوسطة الجودة.
الطريقة الجديدة: الضبط الدقيق البصري التكيفي (VAPT)
ابتكر الباحثون في هذه الورقة نظاماً أكثر ذكاءً يسمى VAPT.
بدلاً من بطاقة وصفة ثابتة، أعطوا الطباخ "مساعد طباخ ذكي" ("المطالبة التكيفية"). هذا المساعد لا يحمل مجرد بطاقة فحسب؛ بل إنه ينظر فعلياً إلى المكونات الموجودة على الطاولة قبل تحضير كل طبق.
إذا رأى مساعد الطهاة كومة من حليب جوز الهند الثقيل، فإنه يهمس للطباخ: "مهلاً، نحن بحاجة إلى ليمون إضافي هذه المرة لكسر حدة الدسم". وإذا رأى كومة من النودلز الجافة، يهمس: "أضف المزيد من صلصة السمك للحفاظ على رطوبتها".
ولأن التعليمات الآن تعتمد على المدخلات (تتغير بناءً على ما يراه الطباخ)، يمكن للطباخ أن يكون دقيقاً للغاية. هو لا يقوم فقط بـ "إضافة التوابل"؛ بل هو "يضيف الكمية الصحيحة تماماً من التوابل لهذا المكون المحدد".
كيف يعمل ذلك تقنياً؟ (آليات "مساعد الطباخ")
تستخدم الورقة ثلاث حيل ذكية لجعل "مساعد الطباخ" هذا يعمل دون جعل المطبخ مزدحماً أو مكلفاً:
- الرؤية الشاملة (أجهزة إسقاط الرموز - Token-wise Projectors): لا ينظر مساعد الطباخ إلى حبة أرز واحدة فحسب؛ بل ينظر إلى الطاولة بأكملها لفهم "طابع" المكونات.
- رقابة الحي (التلافيف عبر القنوات - Channel-wise Convolution): يلاحظ مساعد الطباخ كيف ترتبط المكونات بجيرانها (على سبيل المثال: "الفلفل الحار يقع بجانب الليمون مباشرة، لذا دعونا نوازن بينهما").
- خبير الكفاءة (جهاز إسقاط الميزات المشترك - Shared Feature Projector): للحفاظ على السرعة، يستخدم مساعد الطباخ "دماغًا" واحدًا لمعالجة جميع الأطباق المختلفة، بدلاً من الحاجة إلى دماغ كامل لكل وصفة على حدة. هذا يحافظ على "التكلفة الإضافية" (المعلمات وقوة الحوسبة) منخفضة للغاية، وكأنها غير مرئية تقريباً.
لماذا يهم هذا؟ (النتائج)
اختبر الباحثون "مساعد الطباخ الذكي" هذا في عدة "اختبارات طبخ" (مجموعات بيانات مثل VTAB-1K و FGVC). كانت النتائج مبهرة:
- نكهة أفضل: تفوق على الطريقة القديمة بشكل كبير، بل وتفوق على النماذج التي تم "إعادة تدريبها بالكامل" (والذي يشبه إعادة تدريب الطباخ بالكامل من الصفر).
- تعلم أسرع: في حالات "البيانات المنخفضة" (حيث لا تملك سوى عدد قليل من المكونات للتدريب عليها)، تعلمت طريقة VAPT بشكل أسرع بكثير. بينما كانت الطريقة القديمة لا تزال تكافح لفهم نوع المطبخ، كان نظام VAPT يطبخ بالفعل وجبات لذيذة.
- خفيف الوزن: لم يجعل النظام عملية الطبخ أبطأ أو أكثر تكلفة. لم يضف أي "عمل" إضافي (FLOPs) يُذكر إلى العملية.
الملخص
كانت VPT بمثابة إعطاء خبير مجموعة من التعليمات الثابتة.
أما VAPT فهي بمثابة إعطاء الخبير مجموعة من التعليمات الذكية والمتفاعلة التي تتغير بناءً على ما يراه. هذا يجعل الذكاء الاصطناعي أكثر مرونة، وأكثر ذكاءً، وأكثر كفاءة في تعلم مهام جديدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.