← أحدث الأبحاث
💻 computer science

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

تُعد VisCo إطار عمل كفؤاً في التدريب يستفيد من نموذج رؤية-لغة مُدرب مسبقاً كـمُشفّر جوهري لضغط الرموز البصرية إلى مجموعة مدمجة من رموز الذاكرة، محققاً أداءً فائقاً واستقراراً عبر مختلف نسب الضغط دون الحاجة إلى إعادة تدريب مكثفة أو وحدات خارجية.

المؤلفون الأصليون: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

نُشر 2026-08-10
📖 2 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقاً آلياً فائق الذكاء يمكنه النظر إلى صورة وإخبارك بقصة عنها. هذا الروبوت موهوب للغاية، لكن لديه دماغ صغير وباهظ الثمن للغاية. عندما تُريه صورة عالية الدقة، يحاول الروبوت النظر في كل بكسل، محولاً الصورة إلى قائمة ضخمة من الآلاف من الملاحظات الصغيرة التي تسمى "الرموز" (tokens). الأمر يشبه محاولة قراءة موسوعة كاملة فقط لتقرر ما إذا كانت الصورة تُظهر قطة أم كلباً. هذه العملية ثقيلة جداً لدرجة أنها تجعل الروبوت بطيئاً، وجشعاً للذاكرة، وصعب الاستخدام على الهواتف العادية أو في المواقف التي تتطلب استجابة فورية. لقد حاول العلماء تعليم الروبوت أن يكون أكثر كفاءة، وعادة ما كان ذلك إما عن طريق التخلص من الملاحظات "المملة" (وهو ما قد يجعل الروبوت يفتقد تفاصيل مهمة أحياناً) أو عن طريق بناء آلة جديدة وثقيلة للمساعدة في التلخيص (وهو أمر مكلف وصعب التدريب). السؤال الكبير هو: هل يمكننا جعل الروبوت يلخص الصورة بنفسه، باستخدام قدراته الذهنية الموجودة بالفعل، دون الحاجة إلى عملية إصلاح شاملة؟

هذا هو بالضبط ما سعى الباحثون وراء VisCo لحله. لقد أدركوا أن دماغ الروبوت (نموذج الرؤية واللغة) هو بالفعل خبير في فهم الصور؛ إنه فقط لم يُطلب منه تلخيصها بكفاءة من قبل. بدلاً من بناء أداة جديدة أو حذف الملاحظات بشكل عشوائي، يعامل VisCo دماغ الروبوت كآلة ضغط ذاتية الاحتواء. إنهم يقدمون مجموعة صغيرة من "رموز الذاكرة" — تخيلها كبضع قصاصات ملاحظات لاصقة يمكن للروبوت الكتابة عليها — ويطلبون من الروبوت قراءة الصورة بأكملها وتكثيف كل تلك المعلومات على تلك القصاصات القليلة. يحدث السحر لأن الروبوت يستخدم "انتباهه" الداخلي (كيف يركز على أجزاء مختلفة من الصورة) ليعرف ما هو الأهم، طبقة تلو الأخرى، من الأنسجة البسيطة إلى المعاني المعقدة.

تجد الورقة البحثية أن هذا النهج يغير قواعد اللعبة. فبينما تفشل الطرق الأخرى وتنهار عندما تجبرهم على استخدام عدد قليل جداً من الرموز (مثل محاولة وصف مدينة كاملة بكلمة واحدة فقط)، يظل VisCo قوياً بشكل مفاجئ. في اختباراتهم، حتى عندما ضغطوا الصورة لتصبح رمزاً واحداً فقط، حافظ VisCo على حوالي 85% من ذكائه الأصلي، متفوقاً بفارق كبير على الطرق الأخرى التي انخفضت إلى حوالي 35-50%. والأروع من ذلك، اكتشف الباحثون أن هذه "ملاحظات الذاكرة" ليست مجرد نسخة أصغر من الصورة الأصلية؛ بل إنها تلتقط في الواقع طرقاً جديدة لرؤية الصورة يمكنها أحياناً جعل الروبوت أكثر ذكاءً من ذي قبل. إنها طريقة خفيفة وفعالة للسماح للروبوت بفعل المزيد بالقليل، دون الحاجة إلى إعادة تدريب دماغه بالكامل من الصفر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →