PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
تُعد PixelPrune طريقةً لتقليل الرموز (tokens) على مستوى البكسل وتكيفيةً ولا تتطلب تدريباً، حيث تستفيد من الترميز التنبؤي لإزالة رقع الصور الزائدة قبل مُشفر المحول الرؤيوي (Vision Transformer)، مما يسرع بشكل كبير عمليات التدريب والاستدلال لنماذج الرؤية واللغة مع الحفاظ على دقة تنافسية في اختبارات قياس المستندات وواجهات المستخدم الرسومية (GUI).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول شرح صورة لمساعد آلي (روبوت) ذكي جداً، ولكنه مشغول جداً.
المشكلة: الروبوت "المُفرط في الشرح"
نماذج الذكاء الاصطناعي الحالية (التي تسمى نماذج اللغة-الرؤية - Vision-Language Models) تشبه هذا الروبوت: فهي ذكية للغاية، ولكن لديها عادة سيئة، وهي أنها تحاول وصف كل بكسل في الصورة، حتى الأجزاء المملة منها.
فكر في مستند أو شاشة كمبيوتر:
- الأجزاء المملة: الهوامش البيضاء الضخمة، أشرطة الأدوات الزرقاء المصمتة، أشرطة الحالة الفارغة.
- الأجزاء المهمة: النص الفعلي، زر صغير، رسم بياني.
إذا سلمت لقطة شاشة بدقة 4K لموقع إلكتروني لهذا الروبوت، فقد يقوم بتقسيم الصورة إلى 14,000 قطعة صغيرة (توكنز/Tokens). ثم يحاول تحليل كل قطعة منها، حتى الـ 10,000 قطعة التي ليست سوى مساحات بيضاء فارغة. الأمر يشبه أن تطلب من طباخ تذوق كل حبة ملح في وعاء ضخم من الحساء فقط ليتأكد من ملوحة الحساء. إنه هدر هائل للوقت والطاقة.
الحل: PixelPrune (المحرر الذكي)
قام الباحثون في مركز OPPO AI ببناء أداة تسمى PixelPrune. فكر فيها كـ محرر فائق السرعة وفائق الذكاء يقف قبل أن يرى الروبوت الصورة حتى.
إليك كيف تعمل، باستخدام تشبيه بسيط:
1. محقق "النسخ واللصق"
تخيل أنك تنظر إلى صف طويل من البلاطات البيضاء المتطابقة.
- الطريقة القديمة: أنت تصف البلاطة الأولى، ثم الثانية، ثم الثالثة... وصولاً إلى المليون بلاطة.
- طريقة PixelPrune: ينظر إلى البلاطة الأولى، ثم ينظر إلى الثانية، ويقول: "مهلاً، هذه الثانية مطابقة تماماً للأولى. لست بحاجة لإخبار الروبوت عنها. سأخبر الروبوت فقط: 'تخطَّ هذه، إنها نسخة من السابقة'".
يفعل ذلك للصورة بأكملة. إذا كان قسم كامل من الشاشة عبارة عن خلفية رمادية مصمتة، فإن PixelPrune يقول: "أنا أعرف كيف يبدو هذا، سأتنبأ به. لن أرسله إلى الروبوت".
2. خدعة "الترميز التنبئي"
تعتمد هذه الطريقة على فكرة قديمة تسمى الترميز التنبئي (Predictive Coding) (وهي نفس الرياضيات المستخدمة لجعل ملفات PNG وJPEG صغيرة الحجم).
- التشبيه: تخيل أنك تقرأ قصة حيث يكرر المؤلف نفس الجملة باستمرار. القارئ الذكي سيقول: "أنا أعرف ما سيأتي بعد ذلك؛ إنه نفس ما سبق"، وسيتخطى قراءتها بصوت عالٍ.
- السحر: ينظر PixelPrune إلى جيران قطعة معينة (القطع المجاورة لها). إذا كانت القطعة التي على اليسار بيضاء، والقطعة التي في الأعلى بيضاء، فإنه يتنبأ بأن القطعة الحالية ستكون بيضاء أيضاً. إذا كان الأمر كذلك، فإنه يحذف تلك القطعة من القائمة المرسلة إلى الذكاء الاصطناعي.
لماذا يعد هذا تغييراً جذرياً؟
1. يعمل قبل القيام بالعمل الشاق
معظم الطرق الأخرى تحاول تقليل العمل بعد أن يبدأ الروبوت بالفعل في التفكير. الأمر يشبه محاولة إيقاف سيارة بعد أن اصطدمت بالفعل.
PixelPrune يقلص قائمة الأشياء التي يجب النظر إليها قبل أن يبدأ الروبوت في تشغيل محركه.
- النتيجة: لا يعمل الروبوت بشكل أسرع فحسب، بل إن العملية بأكملها (من رؤية الصورة إلى إعطاء الإجابة) تصبح أسرع بـ 4 مرات.
2. هو "غير فاقد للجودة" (بدون انخفاض في الجودة)
لأن PixelPrune بارع جداً في التنبؤ، يمكنه غالباً حذف 70% إلى 90% من بيانات الصورة دون أن يلاحظ الذكاء الاصطناعي ذلك.
- التشبيه: تخيل أنك ترسل رسالة إلى صديق. بدلاً من كتابة "السماء زرقاء، السماء زرقاء، السماء زرقاء"، تكتب فقط "السماء زرقاء (×100)". صديقك سيقرأ الملحوظة وسيفهمها تماماً؛ المعلومات هي نفسها، لكنك فقط لم تهدر الورق.
3. لا يحتاج إلى تدريب
عادةً، لجعل الذكاء الاصطناعي أسرع، عليك إعادة تعليمه لأسابيع. PixelPrane يشبه فلتر "وصل وشغل" (Plug-and-Play). أنت فقط تقوم بتشغيله، ويبدأ فوراً في توفير الوقت. لا يحتاج لتعلم أي شيء جديد؛ فهو يستخدم الرياضيات فقط لرصد التكرارات.
التأثير في العالم الحقيقي
اختبرت الورقة البحثية هذا على:
- المستندات: ملفات PDF، الرسوم البيانية، والنماذج.
- واجهات المستخدم الرسومية (GUIs): شاشات الكمبيوتر وتطبيقات الهاتف المحمول.
النتائج:
- السرعة: أنهى الذكاء الاصطناعي المهام أسرع بـ 4.2 مرة.
- الذاكرة: استخدم ذاكرة كمبيوتر أقل بنسبة 33%.
- الدقة: حصل الذكاء الاصطناعي على الإجابات بنفس الدقة تقريباً كما في السابق، رغم أنه نظر إلى عدد أقل بكثير من البكسلات.
الملخص
PixelPrune يشبه حارس النادي للذكاء الاصطناعي. فبدلاً من السماح لـ 10,000 شخص (بكسل) بالدخول إلى غرفة كبار الشخصيات (عقل الذكاء الاصطناعي)، فإنه يفحص القائمة، ويرى أن 8,000 منهم يرتدون نفس الزي تماماً مثل الشخص الموجود بالداخل بالفعل، ويقول: "يمكنكم الانتظار في الخارج؛ نحن نعرف كيف تبدون".
يحصل الذكاء الاصطناعي على نفس المعلومات، لكنه لا يضطر لإضاعة الطاقة في معالجة الحشد. إنه أسرع، وأرخص، وأكثر ذكاءً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.