Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
تقدم هذه الورقة البحثية Insight-V++، وهو إطار عمل موحد متعدد الوكلاء يعالج ندرة بيانات الاستدلال البصري طويلة السلسلة من خلال توظيف مسار قابل للتوسع وذاتي التحسين باستخدام خوارزميات ST-GRPO وJ-GRPO المبتكرة لتعزيز قدرات الاستدلال المكاني-الزماني في النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير.