← أحدث الأبحاث
💻 computer science

Prompt-based Adaptation in Large-scale Vision Models: A Survey

تقدم هذه الدراسة المسحية إطار عمل موحد لـ "التكيف القائم على التلقين" يميز بشكل منهجي بين التلقين البصري على مستوى البكسل وضبط التلقين البصري على مستوى الرمز، مع تصنيفها حسب آليات التوليد ومراجعة تطبيقاتها عبر مجالات ومعايير قياس وتحديات مستقبلية متنوعة.

المؤلفون الأصليون: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

نُشر 2026-03-23
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوت طاهٍ عملاق وذكي للغاية، أمضى سنوات في تعلم طهي ملايين الأطباق باستخدام مكتبة ضخمة من الوصفات. هذا الروبوت موهوب للغاية، لكنه أيضًا جامد جدًا؛ فإذا طلبت منه طهي طبق إقليمي محدد لم يره من قبل، فقد يواجه صعوبة لأنه اعتاد اتباع كتاب وصفاته الأصلي الضخم بدقة.

تقليديًا، لتعليم هذا الروبوت طبقًا جديدًا، سيتعين عليك إعادة كتابة كتاب وصفاته بالكامل (وهي عملية تسمى الضبط الدقيق الكامل - Full Fine-Tuning). هذه العملية مكلفة، بطيئة، وتخاطر بجعل الروبوت ينسى أطباقه المفضلة الأصلية.

تقدم هذه الورقة طريقة أذكى وأخف وزنًا لتعليم الروبوت: التكيف القائم على التلقين (Prompt-based Adaptation - PA). بدلًا من إعادة كتابة الكتاب بأكل، يمكنك فقط إعطاء الروبوت ملاحظة صغيرة ومحددة أو إشارة بصرية لتوجيهه. تستعرض الورقة طريقتين رئيسيتين للقيام بذلك: التلقين البصري (Visual Prompting - VP) وضبط التلقين البصري (Visual Prompt-Tuning - VPT).

إليك تفصيل الورقة باستخدام تشبيهات بسيطة:

1. الاستراتيجيتان الرئيسيتان: "الملاحظة اللاصقة" مقابل "المصافحة السرية"

يقسم المؤلفون هذه التقنيات إلى فئتين بناءً على أين يتم تقديم التعليمات للروبوت.

التلقين البصري (VP): "الملاحظة اللاصقة" على المكونات

  • كيف تعمل: تقوم بتعديل المدخلات (المكونات الخام) قبل أن يبدأ الروبوت في الطهي. قد ترسم دائرة حول البصل، أو تضيف ملصقًا ملونًا إلى الصورة، أو تضع نمطًا فوقها.
  • التشبيه: تخيل أنك تعرض على الروبوت صورة لقطة. بدلًا من تغيير عقل الروبوت، ترسم صندوقًا أحمر حول أذني القطة على الصورة. أنت تقول له: "هيا، انظر هنا تمامًا!"
  • الأنواع:
    • ثابت (Fixed): تستخدم صندوقًا مرسومًا مسبقًا أو يشير إنسان بإصبعه (مثل التطبيقات التفاعلية). لا حاجة للتعلم.
    • قابل للتعلم (Learnable): يتعلم الروبوت رسم أفضل صندوق أو نمط ممكن بنفسه للحصول على الإجابة الصحيحة.
    • مولّد (Generated): يقوم روبوت مساعد صغير برسم ملاحظة فريدة ومخصصة لكل صورة يراها، مما يتكيف فورًا مع الإضاءة أو الزاوية.
  • الأفضل لـ: عندما لا يمكنك لمس عقل الروبوت (لأنه "صندوق أسود" أو API)، أو عندما تحتاج للتفاعل مع الصورة مباشرة (مثل النقر على ورم في فحص طبي).

ضبط التلقين البصري (VPT): "المصافحة السرية" داخل العقل

  • كيف تعمل: لا تلمس الصورة. بدلًا من ذلك، تقوم بحقن "رموز" (Tokens) صغيرة وغير مرئية (مثل الأكواد السرية) مباشرة في عملية التفكير الداخلي للروبوت. يظل العقل الرئيسي للروبوت ثابتًا، لكن هذه الرموز الصغيرة تهمس بالتعليمات إليه أثناء معالجة الصورة.
  • التشبيه: تخيل أن الروبوت يقرأ كتابًا. أنت لا تغير صفحات الكتاب، بل تضع "فاصلًا مرجعيًا" (Bookmark) سحريًا وصغيرًا داخل الكتاب يقول: "عندما ترى كلبًا، فكر في أنه 'جولدن ريتريفر'". يقرأ الروبوت نفس الصفحات ولكنه يفسرها بشكل مختلف بسبب الفاصل المرجعي الخاص بك.
  • الأنواع:
    • قابل للتعلم (Learnable): تقوم بتدريب مجموعة صغيرة من هذه "الفواصل المرجعية" لتكون التلميح المثالي لمهمة محددة.
    • مولّد (Generated): ينشئ مساعد صغير مجموعة فريدة من الفواصل المرجعية لكل صورة، مما يجعل النصيحة مصممة خصيصًا للموقف المحدد.
  • الأفضل لـ: عندما يكون لديك وصول إلى الطبقات الداخلية للروبوت وتحتاج لتعليمه مفاهيم عميقة ومعقدة (مثل فهم الفرق بين نوعين متشابهين جدًا من السحب أو التعرف على الأشياء في الفضاء ثلاثي الأبعاد).

2. لماذا يعد هذا أمرًا مهمًا؟ (عامل "الكفاءة")

توضح الورقة أن تعليم الروبوت بالكامل (الضبط الدقيق الكامل) يشبه محاولة ترميم ناطحة سحاب لمجرد إضافة باب جديد. إنه أمر مكلف ومخاطرة.

  • الـ PA يشبه إضافة جرس باب ذكي. فهو رخيص، سريع، ولا يخاطر بانهيار المبنى.
  • الذاكرة: يوفر قدرًا هائلًا من ذاكرة الكمبيوتر لأنك لا تقوم بحفظ أوزان جديدة للروبوت بالكامل، بل تحفظ فقط "الملاحظات" أو "الفواصل المرجعية" الصغيرة.
  • البيانات: يعمل حتى لو كان لديك أمثلة قليلة فقط للمهمة الجديدة (التعلم من أمثلة قليلة - Few-Shot Learning)، لأن الروبوت يعرف بالفعل كيف يطبخ؛ هو فقط يحتاج إلى دفعة بسيطة بشأن ماذا يطبخ.

3. أين تُستخدم هذه التقنيات؟ (تطبيقات العالم الحقيقي)

تظهر الدراسة أن هذه التقنيات تُستخدم في كل مكان:

  • الطب: مساعدة الأطباء في رصد الأورام في الأشعة السينية عن طريق رسم "تلقين" حول المنطقة المشبوهة دون إعادة تدريب الذكاء الاصطناي بالكامل.
  • الروبوتات: تعليم ذراع الروبوت فهم الأشياء ثلاثية الأبعاد (مثل كومة من الأدوات) عن طريق ترجمة الصور ثنائية الأبعاد إلى تعليمات ثلاثية الأبعاد.
  • السيارات ذاتية القيادة: مساعدة السيارات على التعرف على الطرق في المطر الغزير أو الضباب من خلال "تلقين" النظام لتجاهل المطر والتركيز على المسار.
  • المصانع الصناعية: رصد العيوب الصغيرة في الصفائح المعدنية عن طريق تعليم الذكاء الاصطناعي كيفية البحث عن "عيوب" محددة دون الحاجة لآلاف الصور للأجزاء المكسورة.

4. التحديات (العقبات)

على الرغم من أن هذه أداة رائعة، إلا أن الورقة تحذر من بعض العقبات:

  • السلامة: تمامًا كما يمكن خداع الإنسان بلوحة إرشادية مضللة، يمكن لجهات سيئة استخدام "التلقينات" لخداع الذكاء الاصطناعي للقيام بشيء ضار أو متحيز.
  • عدم الاستقرار: أحيانًا، تغيير التلقين بشكل طفيف جدًا (مثل تحريك نقطة بمقدار بكسل واحد) يمكن أن يجعل الروبوت يفشل تمامًا. قد يكون الأمر هشًا بعض الشيء.
  • السرعة: إضافة هذه "الملاحظات" أو "الفواصل المرجعية" الإضافية يستغرق وقتًا إضافيًا بسيطًا للمعالجة، وهو أمر مهم إذا كنت بحاجة لأن يستجيب الروبوت فورًا.
  • الاختبار في العالم الحقيقي: معظم الاختبارات تتم على مجموعات بيانات نظيفة ومثالية. تحث الورقة الباحثين على اختبار هذه الأساليب في العالم الحقيقي الفوضوي والمضطرب (مثل شارع ممطر أو مصنع مغبر) لمعرفة مدى صمودها حقًا.

الملخص

هذه الورقة هي دليل إرشادي للباحثين. تقول: "توقفوا عن محاولة إعادة بناء عقل الذكاء الاصطناعي بالكامل في كل مرة تريدون فيها تعليمه شيئًا جديدًا. بدلًا من ذلك، استخدموا هذه 'التلقينات' الذكية والخفيفة (سواء كانت ملاحظات بصرية على الصورة أو أكواد سرية في العقل) لتوجيه الذكاء الاصطناعي. إنها أرخص، أسرع، وتعمل بشكل جيد تقريبًا مثل الطريقة القديمة."

إنه الفرق بين إعادة كتابة القاموس بالكامل لإضافة كلمة جديدة، وبين مجرد كتابة ملاحظة لاصقة على الصفحة تقول: "هذه الكلمة الجديدة تعني X". ترسم الورقة المسار الدقيق لكيفية كتابة تلك الملاحظات اللاصقة لمستقبل الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →