💻 computer science

iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models

تقترح الورقة البحثية إطار عمل iGSP، وهو إطار عمل مبتكر للتعلم المستمر لنماذج الرؤية واللغة بكفاءة، يعالج مشكلتي انفجار المعلمات والنقل السلبي من خلال نمذجة مشاركة المحاذاة كمسألة هندسية واستخدام إسقاط فضاء التدرج الضمني لتعظيم إعادة استخدام المعرفة مع تقليل المعلمات القابلة للتدريب بشكل كبير.

Xuezhi Cui, Dongbo Zhou, Wang Guo, Zeyuan Wang, Ziyu Li, Gaozhi Zhou, Xian Li, Ling Zhao, Wentao Yang, Chao Tao, Haifeng (…)2026-05-20
💻 computer science

TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards

تقترح الورقة البحثية TextAlign، وهو إطار عمل غير جراحي لما بعد التدريب يستفيد من مكافأة قائمة على نموذج رؤية ولغة هرمي لمحاذاة نماذج تحويل النص إلى صورة الكبيرة لتحسين دقة عرض النصوص دون تعديل بنيتها الأساسية.

Mingxuan Cui, Jingpu Yang, Fengxian Ji, Qian Jiang, Zhecheng Shi, Jiaming Wang, Zirui Song, Fajri Koto, Xiuying Chen2026-05-20
💻 computer science

Semantic-Enriched Latent Visual Reasoning

تقدم هذه الورقة البحثية إطار عمل الاستدلال البصري الكامن المعزز دلاليًا (SLVR)، وهو إطار عمل ثنائي المراحل يعزز الاستدلال البصري الكامن من خلال إثراء التمثيلات بدلالات السمات دقيقة التفاصيل ومواءمتها مع استعلامات متنوعة عبر تحسين السياسة النسبي للمجموعات متعدد الاستعلامات، مدعومًا بمجموعة بيانات SLV-Set المنشأة حديثًا ومعيار SV-QA.

Tianrun Xu, Yue Sun, Qixun Wang, Jingyi Lu, Yuan Wang, Tianren Zhang, Longteng Guo, Fengyun Rao, Jing Lyu, Feng Chen, Ji (…)2026-05-20
💻 computer science

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

تشخص هذه الورقة بشكل منهجي خمسة أنماط متميزة لفشل التدريب في نماذج "خليط الخبراء" (Mixture-of-Experts) ذات اختيار الرموز (Token-Choice) المتفرقة في نماذج "ترانسفورمر الانتشار" (Diffusion Transformers) للفيديو، وتقترح "فرضية الفائض الوظيفي" لتفسير حالة الجمود الانتقائي الملحوظة، وتقدم حلاً هندسياً كاملاً إلى جانب خارطة طريق تطورية لتوسيع نطاق هذه البنيات المعمارية.

Haiying Sha2026-05-20
💻 computer science

LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

تقدم هذه الورقة البحثية LMM-Track4D، وهو إطار عمل مبتكر يعزز قدرات الاستنتاج الديناميكي رباعي الأبعاد للنماذج اللغوية متعددة الوسائط من خلال مهمة ومعيار جديد للحوار المرتكز على المسار (Track4D-Bench)، وذلك باستخدام مكونات متخصصة مثل ترميز الهندسة الشعاعية-الزمنية (Ray-Time Geometry Encoding) وفك تشفير حركية كينماتيكية لفتحات الكائنات (Object-Slot Kinematic decoder) لتحقيق تقدير قوي للحالة ثلاثية الأبعاد في ظل حالات الاحتجاب وتغيرات زوايا الرؤية.

Chaoyue Li, Yongxue Xu, Jie Feng, Jiayu Ding2026-05-20
🤖 machine learning

Neuron Incidence Redistribution for Fairness in Medical Image Classification

تقترح هذه الورقة البحثية طريقة "إعادة توزيع حدوث العصبونات" (NIR)، وهي طريقة تنظيم خفيفة الوزن تخفف من التفاوتات في الأداء الديموغرافي في تصنيف الصور الطبية عن طريق معاقبة تباين التنشيط عبر عصبونات الطبقة قبل الأخيرة، مما يقلل من تحيز المجموعات الفرعية دون الحاجة إلى تسميات ديموغرافية أثناء التدريب.

Abin Shoby, Lyle John Palmer, Nikhil Cherian Kurian2026-05-20
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

تقدم هذه الورقة بحث DyMoS، وهو أسلوب لا يتطلب تدريباً ومستقل عن النموذج يعمل على تعزيز ديناميكيات الحركة في توليد الصور إلى فيديوهات من خلال إعادة توازن هيمنة الإطار المرجعي في آلية الانتباه، مما يتغلب على كبح الحركة دون المساس بالدقة البصرية أو الحاجة إلى تدريب إضافي.

Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon2026-05-20
💻 computer science

Vision Harnessing Agent for Open Ad-hoc Segmentation

تقدم الورقة البحثية VASA، وهو وكيل موجه بصرياً لا يتطلب تدريباً، يستفيد من قناع عمل مستمر واستدلال بصري تكراري لإنشاء أقنعة تقسيم للمفاهيم المفتوحة والمخصصة، متفوقاً بشكل كبير على النماذج المرجعية الحالية في الاختبارات الجديدة والقياسية.

Zilin Wang, Stella X. Yu2026-05-20
🤖 AI

KappaPlace: Learning Hyperspherical Uncertainty for Visual Place Recognition via Prototype-Anchored Supervision

يُعد KappaPlace إطار عمل مبتكر للتعرف البصري على الأماكن يعالج نقص اليقين المعاير في الأساليب الحالية من خلال تقديم استراتيجية إشراف مرتكزة على النماذج الأولية ونمذجة واصفات الصور كمتغيرات "فون ميسيز-فيشر" للتنبؤ باليقين العرضي، مما يقلل بشكل كبير من خطأ المعايرة مع الحفاظ على دقة استرجاع عالية عبر مختلف المعايير.

Maya Yanko, Yoli Shavit2026-05-20
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

تقدم الورقة البحثية تحسين سياسة الأدلة التباينية (CEPO)، وهي طريقة جديدة للتقطير الذاتي في التعلم المعزز من التغذية الراجعة عبر النماذج اللغوية (RLVR) تستفيد من كل من المخرجات الصحيحة والمرفوضة لتوليد إشارة مكافأة تباينية، مما يحدد بدقة خطوات الاستدلال الحاسمة مع تجنب تسرب المعلومات والتفوق على النماذج المرجعية الحالية مثل GRPO في معايير الاستدلال الرياضي متعدد الوسائط.

Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan2026-05-20