← أحدث الأبحاث
💬 NLP

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

تُعد SpecEyes إطار عمل للتسريع التخميني بمستوى وكيل، يستخدم نموذجاً خفيف الوزن كمخطط تخميني مع آلية بوابات معرفية وقمع متوازي غير متجانس لتقليل زمن الاستجابة بشكل كبير وتحسين إنتاجية النماذج اللغوية الكبيرة متعددة الوسائط مع الحفاظ على الدقة أو تعزيزها.

المؤلفون الأصليون: Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

نُشر 2026-03-25
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك محققاً ذكياً جداً ولكنه بطيء للغاية (النموذج اللغوي متعدد الوسائط الوكيل - Agentic Multimodal LLM). هذا المحقق بارع في حل الألغاز البصرية المعقدة، مثل العثور على خطأ مطبعي صغير في صورة بدقة 4K أو معرفة مكان اختباء قطة بالضبط في غرفة مزدحمة. وللقيام بذلك، يمتلك المحقق مجموعة أدوات خاصة: يمكنه التكبير، وقص الصور، وقراءة النصوص، والنظر إلى الأشياء من زوايا مختلفة.

ومع ذلك، هناك مشكلة ضخمة: المحقق بطيء بشكل مؤلم.

لماذا؟ لأنه يعمل في خطوة بخطوة صارمة:

  1. ينظر إلى الصورة كاملة.
  2. يقرر: "أحتاج إلى التكبير على الجانب الأيسر".
  3. ينتظر حتى ينتهي التكبير.
  4. ينظر إلى الجزء الذي كبّره.
  5. يقرر: "الآن أحتاج إلى قراءة النص هنا".
  6. ينتظر حتى تتم قراءة النص.
    ... وهكذا دواليك.

إذا طلبت 100 شخص توظيف هذا المحقق، فسيتعين عليهم جميعاً الانتظار في طابور واحد. يمكن للمحقق القيام بخطوة واحدة فقط لشخص واحد في كل مرة. وهذا ما يسمى بـ "عنق الزجاجة المرتبط بالحالة" (Stateful Bottleneck). إنه يشبه جسراً بمسار واحد حيث يتعين على كل سيارة العبور واحدة تلو الأخرى، حتى لو كان الطريق أمامها خالياً.

ظهور: SpecEyes (نظام "الحدس السريع")

أدرك الباحثون وراء SpecEyes أمراً عبقرياً: ليست كل الأسئلة تحتاج فعلياً إلى مجموعة أدوات المحقق البطيئة والخطوة بخطوة.

أحياناً، تسأل فقط: "ما هو لون السيارة؟" الإجابة واضحة من الصورة الرئيسية. لست بحاجة للتكبير أو قراءة لافتة. لكن المحقق البطيء لا يعرف ذلك بعد؛ فهو يبدأ عملية طويلة ومكلفة بشكل أعمى على أي حال.

SpecEyes يقدم "الحدسي السريع" (Fast Intuitionist) (نموذج ذكاء اصطناعي صغير وخفيف الوزن) ليقف عند الباب الأمامي. وإليك كيف يعمل، باستخدام تشبيه بسيط:

1. "الحدسي السريع" مقابل "المحقق البطيء"

تخيل طابور أمن في مطار مزدحم.

  • المحقق البطيء هو جهاز المسح الكامل للجسم والتفتيش اليدوي للحقائب. إنه دقيق ولكنه يستغرق 10 دقائق لكل شخص.
  • الحدسي السريع هو رجل أمن بنظرة خاطفة. يمكنه النظر إلى مسافر وقول: "تبدو بخير، لا داعي للمسح الضوئي"، أو "تبدو مريباً، اذهب إلى الماسح الضوئي".

في SpecEyes:

  • الحدسي السريع ينظر إلى الصورة والسؤال. إذا كان السؤال سهلاً (مثل "ما لون السيارة؟")، فإن الحدسي يجيب فوراً. لا حاجة لأدوات. لا انتظار.
  • إذا كان الحدسي غير متأكد، أو إذا كان السؤال واضحاً أنه صعب (مثل "ابحث عن الرقم التسلسلي على الصندوق الصغير في الزاوية")، فإنه يقول: "أنا لست متأكداً، أرسلهم إلى المحقق البطيء".

2. "بوابة الثقة" (البوابة المعرفية)

كيف يعرف الحدسي السريع متى يثق في نفسه؟
عادةً ما تكون نماذج الذكاء الاصطناعي سيئة في معرفة متى تخمن. قد تقول "أنا متأكد بنسبة 99%" حتى عندما تكون مخطئة.

يستخدم SpecEyes حيلة ذكية تسمى "قابلية الفصل للإجابة" (Answer Separability).

  • تخيل أن الحدسي السريع يخمن الإجابة.
  • تخمين سيء: يعتقد النموذج أن الإجابة هي "أحمر"، لكنه متأكد أيضاً من أنها قد تكون "برتقالي" أو "وردي". الدرجات كلها متقاربة. هذه هي "قابلية فصل منخفضة". النظام يقول: "لا تثق بهذا؛ أرسله إلى المحقق البطيء".
  • تخمين جيد: يعتقد النموذج أن الإجابة هي "أحمر" بدرجة عالية جداً، بينما يحصل "البرتقالي" على صفر تقريباً. الفجوة واسعة. هذه هي "قابلية فصل عالية". النظام يقول: "هذا فوز واضح! دعونا نتخطى المحقق البطيء".

تضمن هذه البوابة أننا نتخطى العملية البطيئة فقط عندما نكون واثقين حقاً، حتى لا نفقد الدقة.

3. "القمع المتوازي" (سحر السرعة)

إليك السحر الحقيقي.

  • المحقق البطيء هو نظام "مرتبط بالحالة" (stateful). هو يتذكر ما فعله للشخص (أ) قبل الانتقال إلى الشخص (ب). هذا يعني أنه لا يمكنه العمل على الشخص (أ) والشخص (ب) في نفس الوقت. إنه عالق في مسار واحد.
  • الحدسي السريع هو نظام "غير مرتبط بالحالة" (stateless). هو لا يهتم بالماضي. يمكنه النظر إلى 100 شخص في نفس الوقت وإعطاء 100 إجابة فوراً.

يقوم SpecEyes بإعداد قمع:

  1. يدخل 100 شخص.
  2. ينظر الحدسي السريع إلى الـ 100 جميعاً في وقت واحد (بالتوازي!).
  3. لنفترض أن 80 منهم لديهم أسئلة سهلة. الحدسي يجيب عليهم فوراً.
  4. الأسئلة الـ 20 الصعبة المتبقية فقط تذهب إلى المحقق البطيء.
  5. المحقق البطيء يتعامل الآن مع 20 شخصاً فقط بدلاً من 100.

لأن المحقق البطيء يتعامل الآن فقط مع الحالات "الصعبة"، فإن النظام بأكمله يتحرك أسرع بمقدار 1.7 إلى 3.3 مرة.

النتائج

اختبرت الورقة البحثية هذا على ثلاثة أنواع مختلفة من الألغاز البصرية:

  • الأشياء السهلة (V Bench):* كان النظام سريعاً للغاية وحصل فعلياً على إجابات صحيحة أكثر لأن النظام تجنب "الهلوسة" (الأخطاء) التي تحدث عندما يبالغ المحقق البطيء في التفكير في الأشياء البسيطة.
  • الأشياء الصعبة (HR-Bench): حتى هنا، حيث تتطلب العديد من الأسئلة بالفعل تدخل المحقق البطيء، نجح النظام في تسريع العملية من خلال تصفية الأسئلة السهلة أولاً.
  • المقارنة: حاولت طرق أخرى تسريع المحقق البطيء من خلال جعلهم يخمنون الرموز (tokens) بشكل أسرع، لكنهم ظلوا مضطرين للقيام بالعملية الطويلة بأكملها. أما SpecEyes فيتخطى العملية بأكملها للأسئلة السهلة.

الملخص

SpecEyes يشبه توظيف مساعد سريع البديهة لتصفية بريدك قبل أن يصل إلى مديرك المشغول.

  • قبل: كان المدير يقرأ كل رسالة، حتى الرسائل المزعجة (Spam) ورسائل "عيد ميلاد سعيد"، واحدة تلو الأخرى.
  • الآن: يقوم المساعد بفرز البريد بسرعة. هو يتولى رسائل "عيد ميلاد سعيد" فوراً، ويرسل فقط الوثائق القانونية المعقدة إلى المدير.
  • النتيجة: يتلقى المدير عملاً أقل، ويتم معالجة البريد بشكل أسرع، ولا يزال المدير يتعامل مع الأمور الصعبة بشكل مثالي.

هذا يسمح لأنظمة الذكاء الاصطناعي بأن تكون أسرع، وأرخص، وأكثر كفاءة دون التضحية بذكائها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →