💻 computer science

VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference

تقدم هذه الورقة البحثية VIP، وهي طريقة لا تتطلب تدريباً تستفيد من إطار عمل DINO المدرك مكانياً والمعزز بالتطور الموجه بصرياً للمطالبات، للتغلب على الانحياز المكاني والغموض الدلالي في نموذج CLIP، محققةً بذلك أداءً هو الأفضل في مجال التجزئة الدلالية مفتوحة المفردات بكفاءة وقدرة عالية على التعميم.

Hao Zhu, Shuo Jin, Wenbin Liao, Jiayu Xiao, Yan Zhu, Siyue Yu, Feng Dai2026-05-13
🤖 machine learning

Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

تقدم الورقة البحثية نموذج GAP (نموذج المحاذاة الحبيبية)، وهو إطار عمل مبتكر يعالج عدم التطابق في فضاء الميزات في الاستدلال البصري الكامن للنماذج اللغوية الكبيرة متعددة الوسائط من خلال محاذاة مخرجات فك التشفير مع تضمينات المدخلات عبر مستويات الميزة والسياق والسعة، مما يحقق أداءً فائقاً في الإدراك والاستدلال على نموذج Qwen2.5-VL 7B.

Yanting Miao, Yutao Sun, Dexin Wang, Mengyu Zhou, Pascal Poupart, Lei Lv, Qi Zhao, Li Wang, Hao Li, Xiaoxi Jiang, Guanju (…)2026-05-13
🤖 machine learning

SEMIR: Semantic Minor-Induced Representation Learning on Graphs for Visual Segmentation

يقدم SEMIR إطار عمل مبتكر للتجزئة المرئية يتغلب على قيود الحوسبة ذات الشبكة الثابتة وعدم توازن الفئات من خلال تعلم تمثيل "الحد الأدنى للرسم البياني" (graph minor) متكيف مع المهمة ومحاذٍ للحدود عبر عمليات التقليص والحذف المحددة بالمعلمات، مما يتيح فك تشفير دقيق وفعال لتجزئة الهياكل المتفرقة عالية الدقة.

Luke James Miller, Yugyung Lee2026-05-13
💻 computer science

LychSim: A Controllable and Interactive Simulation Framework for Vision Research

تُعد LychSim إطار عمل محاكاة تفاعلي عالي التحكم مبني على محرك Unreal Engine 5، يعمل على جسر الفجوة بين أدوات الرسوميات المعقدة وأبحاث الرؤية الحاسوبية من خلال توفير واجهة برمجة تطبيقات Python مبسطة، ومسار بيانات إجرائي لتحديات متنوعة خارج نطاق التوزيع، وتكامل أصيل مع بروتوكول سياق النموذج (Model Context Protocol) لدعم التحسين في الحلقة المغلقة والاستدلال المنطقي للنماذج اللغوية الكبيرة الوكيلية.

Wufei Ma, Chloe Wang, Siyi Chen, Jiawei Peng, Patrick Li, Alan Yuille2026-05-13
🤖 AI

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

تُعد OmniNFT إطار عمل جديد للتعلم التعزيزي للانتشار عبر الإنترنت والمدرك للنماذج، والذي يعزز التوليد المشترك للصوت والفيديو من خلال معالجة عدم الاتساق متعدد الأهداف، واختلال التوازن في التدرج، والتعيين الموحد للائتمان عبر التوجيه المتميز لكل نمط، والجراحة التدريجية للتدرج، وإعادة وزن الخسارة حسب المنطقة.

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan (…)2026-05-13
🤖 machine learning

Elastic Attention Cores for Scalable Vision Transformers

تقدم هذه الورقة بحثًا حول VECA (انتباه النواة المرن البصري)، وهي بنية محول رؤية (Vision Transformer) تحقق تعقيدًا حسابيًا خطيًا ومعالجة عالية الدقة وقابلة للتوسع عبر استبدال الانتباه الذاتي الشامل التربيعي بهيكل نواة-محيط فعال حيث تتواصل رموز الرقع (patch tokens) حصريًا من خلال مجموعة صغيرة متعلمة من تضمينات النواة.

Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael (…)2026-05-13
🤖 machine learning

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

تقترح الورقة البحثية AlphaGRPO، وهو إطار عمل يعزز قدرات التوليد والتحسين الذاتي التأملي للنماذج متعددة الوسائط الموحدة دون مرحلة بدء بارد عبر تطبيق تحسين السياسة النسبي المجموعي الموجه بمكافأة التحقق التفكيكية (DVReward) المبتكرة من أجل إشراف مستقر وقابل للتفسير.

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao2026-05-13
💻 computer science

From Web to Pixels: Bringing Agentic Search into Visual Perception

تقدم هذه الورقة البحثية "Perception Deep Research"، وهو تحدٍ جديد للإدراك البصري في العالم المفتوح حيث يجب تحديد الأشياء عبر المعرفة الخارجية قبل التوطين، وتعالج هذا التحدي من خلال معيار WebEye وإطار العمل الوكيل Pixel-Searcher، الذي يُظهر أداءً رائدًا مفتوح المصدر في عمليات التوطين القائمة على البحث، والتجزئة، والأسئلة والأجوبة البصرية (VQA).

Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue2026-05-13
💻 computer science

Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

تتناول هذه الورقة ضعف موثوقية وكلاء استخدام الكمبيوتر في التفاعلات المعقدة ومنخفضة التكرار من خلال تقديم معيار CUActSpot ومسار لتخليق البيانات قائم على المُنظِّم (renderer)، واللذين مكنّا نموذجاً بـ 4 مليارات معلمة من التفوق على نماذج مفتوحة المصدر أكبر منه عبر مختلف أنماط واجهات المستخدم الرسومية (GUI).

Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong (…)2026-05-13
💻 computer science

Surgical Visual Understanding (SurgVU) Dataset

تقدم هذه الورقة مجموعة بيانات الفهم البصري الجراحي (SurgVU)، وهي مجموعة واسعة النطاق من فيديوهات الجراحة بمساعدة الروبوت مع تسميات مصاحبة مصممة لتعزيز الأبحاث التأسيسية ومعالجة تحديات تعلم الآلة المتنوعة ضمن علوم البيانات الجراحية.

Aneeq Zia, Max Berniker, Rogerio Nespolo, Xiaorui Zhang, Conor Perreault, Ziheng Wang, Benjamin Mueller, Ryan Schmidt, K (…)2026-05-12