← أحدث الأبحاث
🤖 machine learning

INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference

يُعد INAR-VL نظام توجيه خفيف الوزن بين الحافة والسحابة، يقوم بالاختيار ديناميكيًا بين نماذج الرؤية واللغة المحلية وتلك القائمة على السحابة بناءً على تعقيد المدخلات، مما يحقق انخفاضًا كبيرًا في زمن الاستجابة واستهلاك الطاقة مع الحفاظ على دقة تقارب دقة النماذج السحابية.

المؤلفون الأصليون: Ahmed Šabanović, Paul Joe Maliakel, Ivona Brandić

نُشر 2026-05-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ahmed Šabanović, Paul Joe Maliakel, Ivona Brandić

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً ذكياً يمكنه "رؤية" الصور و"قراءة" النصوص للإجابة على أسئلتك. يُسمى هذا بنموذج الرؤية واللغة (VLM). تقدم هذه الورقة نظاماً جديداً يسمى INAR-VL يعمل كمنظم حركة مرور ذكي لهذه المساعدات، حيث يقرر ما إذا كان سيجيب على سؤالك مباشرة على جهازك (الحافة - Edge) أو يرسله إلى حاسوب خارق في السحابة (Cloud).

إليك القصة البسيطة للمشكلة والحل، باستخدام تشبيهات من الحياة اليومية.

المشكلة: معضلة "السريع لكن الغبي" مقابل "البطيء لكن الذكي"

تخيل أن هاتفك أو كاميرا الروبوت هي بمثابة ورشة ميكانيكا محلية.

  • الورشة المحلية (الحافة - Edge): هي قريبة منك جداً. هي سريعة للغاية في تقديم التشخيص، ولا تستهلك الكثير من الوقود للتشغيل. ومع ذلك، فإن الميكانيكي هناك يمتلك مجموعة أدوات أساسية فقط. إذا جلبت له مشكلة بسيطة (مثل "هل هذا الإطار فارغ من الهواء؟")، فسيصلحها فوراً. ولكن إذا جلبت له مشكلة معقدة في المحرك أو صورة ضبابية لقطعة صغيرة، فقد يخطئ في التشخيص لأن أدواته ليست قوية بما يكفي.
  • المرآب الرئيسي (السحابة - Cloud): هو مرفق ضخم وعالي التقنية يقع على بعد أميال. لديه كل أداة يمكن تخيلها وأفضل الميكانيكيين. يمكنه حل أي مشكلة، حتى الأصعب منها. ولكن، عليك قيادة سيارتك إلى هناك (إرسال البيانات عبر الإنترنت)، مما يستغرد وقتاً ووقوداً (طاقة). وإذا كان الطريق سيئاً (إنترنت بطيء)، فقد تنتظر للأبد.

العقبة: ليست كل المشكلات تحتاج إلى المرآب الرئيسي. إرسال سؤال بسيط مثل "هل هذا الإطار فارغ؟" إلى المرآب الرئيسي هو إهدار للوقت والوقود. ولكن إرسال سؤال معقد مثل "لماذا يصدر هذا المحرك صوتاً غريباً؟" إلى الورشة المحلية قد يؤدي إلى إجابة خاطئة.

معظم الأنظمة اليوم تشبه مديراً عنيداً يقول: "نحن نستخدم الورشة المحلية فقط" أو "نحن نستخدم المرآب الرئيسي فقط"، بغض النظر عن طبيعة المشكلة. وهذا يؤدي إما إلى إجابات بطيئة أو إجابات خاطئة.

الحل: INAR-VL (الموزع الذكي)

قام المؤلفون ببناء INAR-VL، وهو موزع ذكي ينظر إلى كل سؤال قبل الإجابة عليه ليقرر المسار الأفضل.

كيف يعمل:

  1. الفحص السريع: قبل إرسال أي سؤال إلى أي مكان، يقوم INAR-VL بإجراء فحص سريع للغاية (يستغرق جزءاً بسيطاً من الثانية). إنه ينظر إلى شيئين:
    • الصورة: هل هي ضبابية؟ هل هي مظلمة؟ هل هي صورة بسيطة أم مخطط معقد؟
    • السؤال: هل هو سؤال بسيط مثل "ما هذا؟" أم سؤال معقد مثل "اشرح المنطق وراء هذا الرسم البياني"؟
  2. القرار:
    • إذا كانت الصورة واضحة والسؤال بسيطاً، يقول الموزع: "تعامل مع هذا محلياً!". هنا تقوم الورشة المحلية (الحافة) بالإجابة فوراً.
    • إذا كانت الصورة ضبابية أو كان السؤال يتطلب تفكيراً عميقاً، يقول الموزع: "أرسل هذا إلى المرآب الرئيسي!". عندها تتولى السحابة المهمة لضمان الدقة.

الفريق "المتكامل":
النظام لا يمتلك مجرد ورشة محلية واحدة ومرآب رئيسي واحد. بل لديه فريق صغير من الخبراء المختلفين. بعضهم أفضل في قراءة النصوص (OCR)، بينما البعض الآخر أفضل في التفكير المنطقي. يقوم INAR-VL باختيار الخبير المناسب للمهمة، وليس فقط الموقع المناسب.

النتائج: الحصول على أفضل ما في العالمين

اختبر الباحثون هذا النظام على آلاف الأسئلة. وإليك ما حدث:

  • السرعة: من خلال معالجة الأسئلة البسيطة محلياً، أصبح النظام أسرع بنسبة 24% في المتوسط مقارنة بإرسال كل شيء إلى السحابة.
  • الطاقة: استهلك طاقة أقل بنسبة 26%، لأنه لم يهدر الطاقة في إرسال واستقبال البيانات للمهام السهلة.
  • الدقة: لم يضحِّ بالجودة. فقد حافظ على 97% من الدقة التي كنت ستحصل عليها لو أرسلت كل شيء إلى الحاسوب الخارق.
  • التوزيع: تم التعامل مع حوالي 36% من الطلبات محلياً (مما وفر الوقت والطاقة)، بينما أُرسلت المهمة الأصعب بنسبة 64% إلى السحابة (لضمان الإجابة بشكل صحيح).

الخلاصة

INAR-VL يشبه إشارة المرور الذكية للذكاء الاصطناعي. فبدلاً من إجبار كل السيارات على سلوك الطريق السريع الطويل (السحابة) أو إبقاء كل السيارات في الحي (الحافة)، فإنه ينظر إلى الوجهة وظروف المرور. يرسل الرحلات السهلة عبر الطريق المحلي ويحجز الطريق السريع للشحنات الثقيلة.

النتيجة؟ تحصل على إجابات ذكية تقريباً مثل الحاسوب الخارق، ولكنها أسرع بكثير وأقل تكلفة في التشغيل، خاصة عندما لا يكون اتصال الإنترنت لديك مثالياً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →