← أحدث الأبحاث
🤖 machine learning

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

تقدم هذه الورقة البحثية Insight-V++، وهو إطار عمل موحد متعدد الوكلاء يعالج ندرة بيانات الاستدلال البصري طويلة السلسلة من خلال توظيف مسار قابل للتوسع وذاتي التحسين باستخدام خوارزميات ST-GRPO وJ-GRPO المبتكرة لتعزيز قدرات الاستدلال المكاني-الزماني في النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير.

المؤلفون الأصليون: Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

نُشر 2026-03-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك عبقرياً بارعاً ولكنه مشتت الذهن قليلاً يُدعى أليكس. أليكس بارع في النظر إلى الصور ومقاطع الفيديو، ولكن عندما تسأله سؤالاً صعباً مثل: "لماذا سقطت الكرة للأعلى بدلاً من الأسفل؟"، يندفع أليكس نحو الإجابة، ويصاب بالارتباك بسبب الخدعة، ويعطيك نتيجة خاطئة.

الورقة البحثية التي شاركتَها تقدم طريقة جديدة لتدريب أليكس (ونماذج الذكاء الاصطناعي الأخرى) ليصبح محققاً بصرياً حقيقياً. هم يسمون هذا النظام Insight-V ونسخته المطورة Insight-V++.

إليك قصة كيف فعلوا ذلك، مشروحة ببساًطة:

1. المشكلة: فخ "الاندفاع للإجابة"

نماذج الذكاء الاصطناعي الحالية تشبه الطلاب الذين يخشون الوقوع في الخطأ، لذا يخمنون الإجابة فور قراءة الجملة الأولى من السؤال. إنهم لا يأخذون الوقت للتفكير خطوة بخوة.

  • المشكلة: عندما تطلب منهم حل لغز بصري معقد (مثل فيديو تكون فيه الكاميرا مقلوبة)، فإنهم يتوهون. كما أنهم يفتقرون إلى مكتبة ضخمة من أمثلة "كيفية التفكير" لأن البشر بطيئون جداً في كتابتها جميعاً.

2. الحل: فريق "المحقق والقاضي"

بدلاً من تدريب روبوت واحد للقيام بكل شيء، قام الباحثون بتقسيم المهمة إلى دورين متخصصين، مما خلق نظاماً متعدد الوكلاء (Multi-Agent System):

  • وكيل الاستنتاج (المحقق): مهمة هذا الروبوت الوحيدة هي النظر إلى الصورة أو الفيديو وكتابة قصة طويلة ومفصلة عما يحدث. هو لا يهتم بالإجابة النهائية بعد؛ بل يريد فقط إيجاد الأدلة. "الخطوة 1: الرجل معلق رأساً على عقب. الخطوة 2: الكرة تتحرك نحو السقف..."
  • وكيل التلخيص (القاضي): هذا الروبوت يقرأ قصة المحقق. يعمل كمحرر صارم. يتحقق من: "هل المنطق سليم؟ هل أغفل المحقق دليلاً ما؟ هل الاستنتاج النهائي صحيح؟" ثم يقدم الإجابة النهائية.

التشبيه: فكر في الأمر كأنه قاعة محكمة. المحقق يجمع كل الأدلة ويبني القضية. القاضي يراجع الأدلة، ويتأكد من عدم وجود ثغرات في المنطق، ثم يصدر الحكم. إذا رأى القاضي أن المحقق ارتكب خطأً، يمكنه أن يقول: "مهلاً، هذا لا يبدو منطقياً"، ويجبره على إعادة التقييم.

3. السر الخفي: التعلم بدون معلمين بشر

كانت العقبة الأكبر هي: كيف تعلم ذكاءً اصطناعياً ليكون محققاً أفضل دون توظيف آلاف البشر لكتابة الدروس؟

قام الباحثون ببناء مصنع ذاتي التحسين:

  1. المولد (The Generator): استخدموا الذكاء الاصطناعي لإنشاء مشكلاته التدريبية الخاصة و"مسارات التفكير".
  2. المقيّم (The Scorer): استخدموا ذكاءً اصطناعياً فائق الذكاء لتقييم هذه المسارات. "هذا الاستنتاج حصل على 90/100. وهذا حصل على 20/100 لأنه أغفل خدعة الكاميرا المقلوبة".
  3. الحلقة (The Loop): يتعلم الذكاء الاصطناعي فقط من الأمثلة التي حصلت على 90/100. يحاول مجدداً، يتم تقييمه، ويتعلم من أخطائه.

التشبيه: تخيل طالباً يكتب مقالاً تدريبياً، ويحصل على تقييم من معلم صارم، ثم يعيد كتابته فوراً بناءً على الملاحظات. يفعل ذلك مراراً وتكراراً حتى يكتب مقالاً مثالياً. يقوم الذكاء الاصطناعي بهذا ملايين المرات تلقائياً، صانعاً "كتابه المدرسي" الخاص من الاستنتاجات المثالية.

4. الترقية: ++Insight-V (المسافر عبر الزمن)

كان الإصدار الأول (Insight-V) رائعاً في النظر إلى الصور الثابتة. لكن العالم الحقيقي يتحرك! الفيديوهات أصعب لأن الأشياء تغير موقعها، والوقت يمر.

أضافت ++Insight-V قوتين جديدتين للتعامل مع الفيديو:

  • ST-GRPO (متتبع الوقت): هذه طريقة تدريب خاصة تجبر "المحقق" على الانتباه إلى الوقت. يتعلم أنه إذا أُلقيت كرة للأعلى، فلا بد أن تعود للأسفل لاحقاً. إنه يربط النقاط عبر إطارات مختلفة من الفيديو.
  • J-GRPO (ضبط الجودة): هذا يدرب "القاضي" ليكون أكثر صرامة. يتعلم رصد الأخطاء الدقيقة في قصة المحقق حول الفيديو.

التشبيه: إذا كان Insight-V هو محقق ينظر إلى صورة لمسرح جريمة، فإن ++Insight-V هو محقق يشاهد لقطات كاميرا المراقبة. يجب عليه تتبع المشتبه به وهو ينتقل من الردهة إلى المصعد، وفهم تسلسل الأحداث، وليس مجرد لقطة واحدة.

5. النتيجة: عقل يتطور ذاتياً

الجزء الأكثر إثارة هو أن النظام يتطور.

  • "القاضي" يقدم ملاحظات لـ "المحقق".
  • "المحقق" يصبح أفضل، مما يجعل مهمة "القاضي" أسهل.
  • يقومون بتغذية هذه البيانات الجديدة، الأعلى جودة، مرة أخرى في النظام لتدريب أنفسهم.

إنه يشبه لعبة فيديو حيث يلعب الذكاء الاصطنا ضد نفسه، ويتحسن في كل جولة، ويصبح في النهاية بطلاً كبيراً دون أن يلمس أي إنسان وحدة التحكم.

الملخص

تقدم الورقة نظاماً يوقف الذكاء الاصطناعي عن التخمين ويبدأه في التفكير. من خلال تقسيم المهمة إلى مفكر ومدقق، والسماح لهما بتدريب أنفسهما باستخدام حلقة من التغذية الراجعة، خلقوا ذكاءً اصطناعياً يمكنه حل الألغاز البصرية المعقدة في كل من الصور والفيديوهات، متفوقاً في كثير من الأحيان على نماذج أكبر وأغلى ثمناً.

باختصار: لقد علموا الذكاء الاصطناعي أن يبطئ، ويفكر خطوة بخطوة، ويدقق في عمله، ويتعلم من أخطائه، محولين "آلة تخمين" إلى "آلة استنتاج".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →