Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
تقدم هذه الورقة البحثية "تحسين المطالبات متعدد الوسائط" (MPO)، وهو إطار عمل موحد يوسع نطاق تحسين المطالبات إلى ما هو أبعد من النصوص ليشمل التحسين المشترك للمدخلات النصية وغير النصية (مثل الصور، والفيديوهات، والجزيئات) باستخدام تحديثات حافظة على المحاذاة واختيار بايزي، مما يتفوق على الأساليب الحالية المقتصرة على النصوص ويطلق العنان للإمكانات الكاملة للنماذج اللغوية الكبيرة متعددة الوسائط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعد روبوت فائق الذكاء (نموذج لغوي كبير متعدد الوسائط، أو MLLM)، يمكنه رؤية الصور، ومشاهدة مقاطع الفيديو، وحتى فهم الهياكل الكيميائية. تريد من هذا الروبوت أن يحل مشكلة معقدة، مثل تحديد نوع طائر معين من صورة، أو التنبؤ بما إذا كان دواء جديد سيعمل أم لا.
لجعل الروبوت يقدم أفضل ما لديه، تحتاج إلى إعطائه تعليمات، تسمى المطالبة (Prompt).
المشكلة: "العمى النصي فقط"
لفترة طويلة، كان الأشخاص الذين يحاولون تعليم هذه الروبوتات يستخدمون النصوص فقط. كانوا يكتبون جملًا طويلة ومعقدة مثل: "انظر إلى الطائر. لديه منقار باهت، وريش داكن، ويعيش في شمال المحيط الهادئ. قد يكون طائر القطرس ذو القدم السوداء، ولكن تحقق مما إذا كان المنقار أبيض..."
تجادل الورقة البحثية بأن هذا يشبه محاولة وصف بيتزا لذيذة لشخص لم يرها من قبل، باستخدام الكلمات فقط. قد تقول "دائرية، صلصة حمراء، جبن ذائب"، لكنه قد يتخيل فطيرة مربعة بصلصة الكاتشب. هذا الأسلوب غير فعال وغالبًا ما يسبب الارتباك.
أدرك المؤلفون: لماذا لا نُري الروبوت صورة للبيتزا؟
الحل: MPO (محسن المطالبات متعدد الوسائط)
أنشأ الفريق نظامًا جديدًا يسمى MPO. فكر في MPO كـ معلم خصوصي خارق لا يكتفي بكتابة تعليمات أفضل فحسب، بل ينشئ أيضًا وسائل إيضاح بصرية أفضل لترافق تلك التعليمات.
إليك كيف يعمل MPO، باستخدام تشبيه بسيط:
1. فريق "الحفاظ على التوافق" (المساعدون الطيارون)
تخيل أنك تحاول إصلاح سيارة معطلة.
- الطريقة القديمة: لديك ميكانيكي واحد يتحدث فقط. يقول: "صوت المحرك غريب"، وعليك أنت أن تخمن ما يجب فعله.
- طريقة MPO: لديك فريق من المساعدين الطيارين. أحدهم هو "ميكانيكي النصوص"، والآخر هو "الميكانيكي البصري".
- إذا فشلت السيارة في اختبار ما، فهم لا يتجادلون حول الكلمات فحسب. بل ينظرون إلى المحرك معًا.
- يقول ميكانيكي النصوص: "نحن بحاجة لفحص شمعات الاحتراق (Spark Plugs)".
- يقوم الميكانيكي البصري فورًا برسم مخطط يوضح بالضبط أين توجد شمعات الاحتراق.
- الأمر الحاسم: هما يحدّثان تعليماتهما معًا. النص والصورة يتطابقان دائمًا. إذا قال النص "أحمر"، فإن الصورة تُظهر اللون الأحمر. هذا يمنع حدوث الارتباك (عدم التوافق).
للقيام بذلك، يستخدم MPO ثلاث أدوات خاصة (المشغلات/Operators):
- التوليد (Generation): "لنقم برسم صورة جديدة تمامًا من الصفر لشرح الأمر."
- التعديل (Edit): "لنأخذ الصورة القديمة ونقوم فقط بإصلاح الجزء الضبابي."
- الدمج (Mix): "لنأخذ أفضل الأجزاء من الصورة (أ) والصورة (ب) وندمجهما في دليل واحد مثالي."
2. "المختار الذكي" (المدرب الخبير)
الآن، يحاول MPO تجربة آلاف التوليفات المختلفة من النصوص والصور. لا يمكنه اختبارها جميعًا؛ لأن ذلك سيستغرق وقتًا طويلاً جدًا. إنه بحاجة إلى طريقة لاختيار الفائزين بسرعة.
- الطريقة القديمة: يختار المدرب لاعبًا عشوائيًا لتجربته، يرى ما إذا كان سيفشل، ثم يجرب آخر عشوائي. هذا بطيء ومضيعة للوقت.
- طريقة MPO: يستخدم المدرب الخبرة.
- لاحظت الورقة البحثية أنه إذا كانت "المطالبة الأم" (التعليمات الأصلية) جيدة، فإن "أبنائها" (النسخ الجديدة منها) من المرجح أن تكون جيدة أيضًا.
- يستخدم MPO خدعة رياضية تسمى Bayesian UCB. فكر فيها كمدرب يقول: "هذه الفكرة الجديدة تشبه كثيرًا الفكرة التي نجحت بشكل رائع بالأمس، لذا دعونا نمنحها فرصة أولاً!"
- هذا يسمح لـ MPO بتخطي الأفكار السيئة والتركيز على الأفكار الواعدة، مما يوفر حوالي 42% من الوقت والمال مقارنة بالطرق القديمة.
النتائج: لماذا هذا مهم؟
اختبر الفريق MPO في ثلاثة عوالم مختلفة تمامًا:
- الطيور: تحديد أنواع الطيور بدقة من الصور.
- القيادة: مشاهدة مقاطع فيديو للسيارات وفهم ما يجب على السائق فعله.
- الجزيئات: النظر في الهياكل الكيميائية للتنبؤ بما إذا كان الدواء سيتم امتصاصه من قبل الجسم.
النتيجة:
في كل اختبار، تفوق MPO على أفضل الخبراء الذين يعتمدون على "النصوص فقط".
- النصوص فقط كانت مثل محاولة وصف جسم ثلاثي الأبعاد معقد باستخدام رسم ثنائي الأبعاد.
- MPO كان مثل تسليم الروبوت نموذجًا ثلاثي الأبعاد ومع دليل إرشادي.
الخلاصة الكبرى
هذه الورقة البحثية هي بمثابة جرس إنذار. لقد بنينا روبوتات يمكنها الرؤية، والسمع، والشعور، لكننا كنا نعلمها باستخدام حاسة واحدة فقط: القراءة.
تحسين المطالبات متعدد الوسائط (Multimodal Prompt Optimization) هو الإدراك بأننا لكي نطلق العنان للقوة الكاملة لهذه العقول الاصطناعية الخارقة، لا يجب أن نكتفي بالتحدث إليها فحسب، بل يجب أن نُريها أيضًا. من خلال تحسين الكلمات والصور معًا، يمكننا الحصول على نتائج أكثر ذكاءً، وأكثر دقة، وأكثر كفاءة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.