← أحدث الأبحاث
🤖 machine learning

How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs

تتقصى هذه الورقة حدود السعة المعلوماتية لرموز الرؤية (vision tokens) في نماذج الرؤية واللغة من خلال تحديد انتقال ثلاثي المراحل من الاستقرار إلى الانهيار تحت تأثير زيادة الكثافة البصرية، وصياغة قانون قياس عالمي لتوجيه تحسين كفاءة ضغط السياق ودقته.

المؤلفون الأصليون: Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

السؤال الكبير: كم يمكن لـ "رمز رؤية" (Vision Token) واحد أن يحمل؟

تخيل أنك تحاول إرسال رسالة طويلة جدًا إلى صديق، ولكن يُسمح لك فقط باستخدام عدد قليل جدًا من البطاقات البريدية لإتمام ذلك. عليك حشر الرسالة بأكملها في هذه البطاقات القليلة.

في عالم الذكاء الاصطناعي، تعمل نماذج الرؤية واللغة (VLMs) بشكل مشابه. فهي تنظر إلى صورة (مثل صفحة ممسوحة ضوئيًا من نص) وتحولها إلى سلسلة من "الرموز الرقمية" (حزم بيانات صغيرة) التي يستطيع عقل الذكاء الاصطناعي قراءتها.

تسأل هذه الورقة سؤالاً جوهرياً: هل هناك حد لكمية المعلومات التي يمكننا حشرها في "رمز رؤية" واحد؟ إذا حاولنا وضع الكثير من النص في صورة واحدة وأجبرنا الذكاء الاصطناعي على ضغطها في عدد قليل جداً من الرموز، فماذا سيحدث؟

التجربة: "اختبار الضغط"

لم يكتفِ الباحثون بالتخمين؛ بل أجروا اختبار ضغط. قاموا بإنشاء صور مليئة بالنصوص الصرفة (مثل الروايات، أو القوانين، أو الرسائل) وزادوا كمية النص في كل صورة تدريجياً. حافظوا على عدد "البطاقات البريدية" (رموز الرؤية) التي يُسمح للذكاء الاصطناعي باستخدامها ثابتاً، ثم راقبوا ما يحدث مع زيادة طول وكثافة النص.

المراحل الثلاث للفشل

بدلاً من أن يتدهور أداء الذكاء الاصطناعي ببطء مع زيادة طول النص، وجد الباحثون أن الأداء لا يتلاشى تدريجياً، بل يمر عبر ثلاث "مراحل" متميزة، تماماً مثل المصباح الكهربائي الذي يرتعش قبل أن يحترق وينطفئ:

  1. المرحلة المستقرة (وضع "السهولة"):

    • ماذا يحدث: يقرأ الذكاء الاصطناعي النص بشكل مثالي.
    • التشبيه: تخيل نافذة صافية. يمكنك رؤية كل شيء بوضوح لأن الأشياء الموجودة أمامها ليست كثيرة. لدى الذكاء الاصطناعي "مساحة" كافية في رموزه لوصف النص.
  2. مرحلة عدم الاستقرار (وضع "الارتعاش"):

    • ماذا يحدث: يبدأ الذكاء الاصطناعي في ارتكاب الأخطاء، لكن الأمر يكون فوضوياً. أحياناً يقرأ النص بشكل صحيح، وأحياناً أخرى يفشل تماماً، حتى لو كانت كمية النص متقاربة جداً.
    • السبب: هذا ليس لأن الذكاء الاصطناعي "غبي"، بل بسبب محاذاة الشبكة (Grid Alignment).
    • التشبيه: تخيل أن الذكاء الاصطناعي ينظر إلى الصورة من خلال شبكة من النوافذ المربعة (مثل سياج شبكي). إذا وقع حرف ما بالضبط على الخط الفاصل بين نافذتين، فسيصاب الذكاء الاصطناعي بالارتباك. قد يرى نصف الحرف في نافذة والنصف الآخر في النافذة المجاورة، ولا يستطيع دمجهما معاً.
    • الحل: أثبت الباحثون ذلك عن طريق إزاحة الصورة قليلاً (مثل تحريك صورة معلقة على حائط). عندما قاموا بإزاحتها، أصبحت الحروف "السيئة" فجأة "جيدة" مرة أخرى. هذا يعني أن المعلومات كانت لا تزال موجودة، لكنها كانت مخفية خلف الجزء الخاطئ من الشبكة.
  3. مرحلة الانهيار (الجدار الصلب):

    • ماذا يحدث: يستسلم الذكاء الاصطناعي فجأة. ترتفع نسبة الخطأ بشكل هائل، ولم يعد قادراً على قراءة النص على الإطلاق.
    • السبب: هذا هو حد السعة الحقيقي.
    • التشبيه: تخيل أن لديك حقيبة ظهر يمكنها حمل 5 أرطال فقط. إذا حاولت حشر 50 رطلاً من الكتب داخلها، فإن الحقيبة لن تصبح "فوضوية قليلاً" فحسب، بل ستتمزق وتخرج كل الأشياء منها. بغض النظر عن كيفية تحريك الحقيبة أو إعادة ترتيب الكتب، فهي ببساطة لا تستطيع تحمل هذا الوزن. لقد نفدت "المساحة الذهنية" للذكاء الاصطناعي لتشفير هذه المعلومات.

"التركيبة السحرية" (قانون القياس)

لم يتوقف الباحثون عند اكتشاف المشكلة فحسب؛ بل وضعوا قاعدة رياضية (قانون قياس) للتنبؤ بدقة متى سيفشل الذكاء الاصطناعي.

وجدوا أن أمرين هما الأكثر أهمية:

  1. كم مقدار النص الموجود؟ (الحمل الإجمالي).
  2. ما مدى ازدحام النص؟ (الكثافة).

قاموا بدمج هذين العاملين في "درجة صعوبة" واحدة.

  • الاكتشاف: كمية النص تهم أكثر بكثير من مدى ازدحام الحروف.
  • "منطقة عدم الاستقرار" ثابتة: وجدوا أن مرحلة "الارتعاش" (حيث يكون الذكاء الاصطناعي مرتبكاً) تستمر دائماً لمدة 2.2 ضعف طول النص، بغض النظر عن حجم الصورة. إنها منطقة عازلة يمكن التنبؤ بها قبل الانهيار التام.

لماذا يهم هذا الأمر (وفقاً للورقة البحثية)

تخلص الورقة إلى أنه بينما يعد تحويل الصور إلى رموز نصية طريقة رائعة لتوفير قدرة الكمبيوتر الحاسوبية، إلا أن هناك حداً فيزيائياً صلباً لكمية المعلومات التي يمكن ضغطها بهذه الطريقة.

  • للمطورين: إذا كنت تريد بناء ذكاء اصطناعي يقرأ المستندات الطويلة، فلا يمكنك مجرد التخمين بشأن عدد الرموز التي يجب استخدامها. يجب عليك حساب "درجة الصعوبة" أولاً. إذا كان النص كثيفاً جداً، يجب أن تعطي الذكاء الاصطناعي المزيد من الرموز (المزيد من "البطاقات البريدية") وإلا سيصطدم بـ "الجدار الصلب" ويفشل.
  • الخلاصة: رموز الرؤية قوية، لكنها ليست سحرية. لها سعة محدودة، وبمجرد تجاوز هذا الخط، تضيع المعلومات للأبد، ولا تكتفي بمجرد الارتباك.

ملخص في جملة واحدة

تثبت الورقة أن أنظمة رؤية الذكاء الاصطناعي لديها "نقطة انكسار" حيث لا تعود قادرة على قراءة النصوص، وذلك بسبب عدم محاذاة الصورة مع الشبكة الداخلية للذكاء الاصطناعي أولاً، ثم بسبب نفاذ المساحة الرقمية المتاحة لحمل المعلومات في النهاية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →