Test-Time Computing for Referring Multimodal Large Language Models
تقدم الورقة البحثية ControlMLLM++، وهو إطار عمل للتكيف في وقت الاختبار يتيح الاستدلال البصري القائم على المناطق بدقة عالية في النماذج اللغوية الكبيرة متعددة الوسائط المجمدة من خلال تحسين المطالبات البصرية القابلة للتعلم أثناء الاستدلال دون الحاجة إلى إعادة تدريب النموذج أو ضبطه الدقيق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك روبوتًا ذكيًا جدًا ومطلعًا (نموذج لغوي كبير متعدد الوسائط، أو MLLM)، يمكنه النظر إلى صورة ووصفها. ومع ذلك، يعاني هذا الروبوت من مشكلة بسيطة: فهو يرى العالم بلمحات عامة. إذا سألته: "ماذا يوجد في هذه الصورة؟" قد يقول لك: "يوجد كلب، وكرة، وشجرة". ولكن إذا أشرت إلى الكلب وسألته: "ما هو لون طوق هذا الكلب تحديدًا؟"، فقد يرتبك الروبوت. قد يصف الصورة بأكملها مرة أخرى، أو الأسوأ من ذلك، قد يخمن اللون الخاطئ لأنه يعتمد كثيرًا على ما "يعتقد" أن طوق الكلاب عادة ما يكون عليه، بدلاً من النظر فعليًا إلى طوق الكلب المحدد الذي أشرت إليه.
تقليديًا، لإصلاح ذلك، كان على المهندسين تفكيك الروبوت وإعادة تدريبه باستخدام آلاف الأمثلة الجديدة لعملية "الإشارة إلى الأشياء"، والأمل في أن يتعلمها. كانت هذه العملية مكلفة وبطيئة، وغالبًا ما ينسى الروبوت خلالها كيف يكون ذكيًا في أشياء أخرى.
إليك ControlMLLM++: "قلم التحديد السحري" للذكاء الاصطناعي.
يقدم هذا البحث حيلة ذكية تسمى ControlMLLM++. بدلًا من إعادة تدريب الروبوت، فإنهم يمنحونه "قلم تحديد سحري" يعمل أثناء تفكيره. إليك كيف يعمل، مقسمًا إلى مفاهيم بسيطة:
١. الرمز "الشبح" (المتغير الكامن القابل للتعلم)
تخيل أن الروبوت يقرأ كتابًا. عادةً، هو يقرأ الكلمات فقط. ControlMLLM++ يضيف سرًا ملاحظة "شبحية" صغيرة وغير مرئية إلى ملاحظات الروبوت الداخلية. هذه الملاحظة الشبحية هي متغير قابل للتعلم. فكر فيها كأنها ورقة ملاحظات لاصقة يمكن للروبوت تحريكها وتغيير شكلها في الوقت الفعلي.
عندما تشير إلى جزء معين من الصورة (مثل قبعة حمراء)، يقوم النظام بتعديل هذه "الملاحظة الشبحية" بحيث يتم جذب انتباه الروبوت جسديًا نحو تلك القبعة الحمراء. الأمر يشبه دفع الروبوت بلطف لتوجيه عينيه بالضبط حيث تريد، دون إجباره على نسيان كل شيء آخر يعرفه.
٢. "مغناطيس الطاقة" (دالة الطاقة)
كيف يعرف النظام كيفية دفع الملاحظة الشبحية؟ إنه يستخدم مفهومًا يسمى دالة الطاقة (Energy Function).
تخيل أن انتباه الروبوت يشبه المغناطيس. يقوم النظام بإنشاء مجال مغناطيسي حول المنطقة التي أشرت إليها ("المنطقة المشار إليها"). "الملاحظة الشبحية" هي كرة معدنية. يقوم النظام بدفع الكرة حتى تشعر بأقوى جذب مغناطيسي من منطقتك المحددة. بمجرد أن تستقر الكرة هناك، يتدفق انتباه الروبوت طبيعيًا إلى ذلك الموقع.
- مغناطيس قوي: إذا رسمت صندوقًا أو قناعًا حول كائن ما، فإن المغناطيس يكون جدارًا صلبًا.
- مغناطيس ناعم: إذا وضعت مجرد خربشة أو نقطة، فإن المغناطيس يكون تدرجًا لطيفًا، يجذب الانتباه بالقرب من خربشتك.
٣. "الدفعة الذكية" (Optim++)
في النسخة الأولى من هذه الفكرة، كان النظام أخرق نوعًا ما. حاول دفع انتباه الروبوت في كل جزء من دماغه في وقت واحد، مما جعله بطيئًا وأحيانًا يجعل الروبوت مرتبكًا.
ControlMLLM++ هو النسخة المطورة. لقد أدرك أن الروبوت يحتاج فقط إلى دفعه في "الطبقات الوسطى" المحددة من دماغه حيث يربط بين الكلمات والصور. إنه يشبه مدربًا كان يصرخ بالتعليمات للفريق بأكبره، ولكنه الآن يهمس بتعليمات محددة فقط للاعبين الذين يحتاجون إليها. هذا يجعل الروبوت يركز بشكل أسرع وأكثر دقة.
٤. "محطم التحيز" (PromptDebias)
هنا يكمن الجزء الصعب: الروبوتات بارعة في اللغة ولكنها سيئة في تجاهل تحيزاتها الخاصة. إذا سألت: "ما هو الشيء غير العادي في هذه القطة؟" واعتقد الروبوت أن القطط عادة ما تجلس ساكنة، فقد يتخيل أشياء (يهلوس) حتى لو أشرت إلى قطة تقفز.
آلية PromptDebias هي مثل فلتر "الرأي الثاني":
- يسأل النظام الروبوت: "ماذا تعتقد لو لم أظهر لك الصورة؟" (يعتمد على تحيزه اللغوي).
- ثم يسأله: "ماذا تعتقد لو أظهرت لك الصورة وإشارتك؟"
- ثم يقوم بطرح الإجابة الأولى من الثانية. هذا يلغي تخمينات الروبوت ويجبره على الاعتماد فقط على ما يراه في المنطقة المحددة التي أشرت إليها.
لماذا يعد هذا أمرًا بالغ الأهمية؟
- لا إعادة تدريب: لا تحتاج لتعليم الروبوت مهارة جديدة. أنت فقط تستخدم هذا "القلم السحري" كلما احتجت إليه.
- يعمل في كل مكان: يعمل على الروبوتات (النماذج) القديمة والجديدة، ويعمل حتى لو سألته عن أشياء لم يراها من قبل (مثل قراءة نص في لقطة شاشة لتطبيق بلغة أجنبية).
- تقليل الهلوسة: لأنه يجبر الروبوت على النظر إلى البقعة المحددة التي أشرت إليها، فإنه يتوقف عن تأليف قصص عن أشياء ليست موجودة.
باختختصار:
ControlMLLM++ يشبه إعطاء عبقري معصوب العينين نظارات لا تظهر له سوى الشيء المحدد الذي تشير إليه. إنه لا يغير من ماهية هذا العبقري؛ بل يساعده فقط على تركيز قدراته الذهنية الهائلة تمامًا حيث تحتاج إليه، فورًا ودون أي واجبات منزلية إضافية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.