🤖 AI

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

تقدم هذه الورقة معياراً جديداً يتكون من 144 مهمة بصرية لتقييم قدرة نماذج الرؤية واللغة على أداء اتخاذ المنظور البصري، مما يكشف أنه بينما تتفوق هذه النماذج في فهم المشاهد، فإن أداءها ينخفض بشكل كبير في الاستدلال المكاني واتخاذ المنظور البصري، مما يسلط الضوء على فجوة حرجة بين التعرف على الأشياء والإدراك المكاني الأعمق.

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński2026-03-31
💻 computer science

Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery

تقيم هذه الدراسة مدى التوافق بين الأصوات الحضرية والبيانات المرئية عبر الصور الملتقطة على مستوى الشارع والصور الجوية في لندن ونيويورك وطوكيو، كاشفةً أنه في حين توفر النماذج القائمة على التضمين (embedding-based models) تطابقاً دلالياً فائقاً، فإن الطرق القائمة على التجزئة (segmentation-based methods) تقدم رؤى إيكولوجية أكثر قابلية للتفسير ضمن إطار "البيوفوني-الجيوفوني-الأنثروبوني" (Biophony–Geophony–Anthrophony).

Pengyu Chen, Xiao Huang, Teng Fei, Sicheng Wang2026-03-31
💻 computer science

SECOND: Mitigating Perceptual Hallucination in Vision-Language Models via Selective and Contrastive Decoding

تقترح الورقة البحثية SECOND، وهو نهج فك تشفير انتقائي وتباين جديد يقلل من هلاوس الكائنات في النماذج اللغوية البصرية من خلال الاختيار والتباين التدريجي للمعلومات البصرية متعددة المقاييس للتوافق مع الإدراك البشري وتحسين الدقة عبر المعايير المرجعية.

Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do2026-03-31
⚡ electrical engineering

Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking and Strategic Insights

تُظهر هذه الدراسة أنه في حين تتفوق النماذج اللغوية البصرية المتخصصة طبياً في المهام المتوافقة مع أنماطها، فإن النماذج اللغوية البصرية العامة التي تم ضبطها بدقة وكفاءة يمكن أن تحقق أداءً مماثلاً أو متفوقاً عبر معظم السيناريوهات السريرية، لا سيما في الأنماط غير المرئية أو النادرة، مما يوفر مساراً أكثر قابلية للتوسع وفعالية من حيث التكلفة للنهوض بالذكاء الاصطناعي السريري.

Yuan Zhong, Ruinan Jin, Qi Dou, Xiaoxiao Li2026-03-31
💻 computer science

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

تقدم هذه الورقة ShotBench، وهو معيار شامل لتقييم الفهم السينمائي في النماذج الرؤية-اللغوية، وتقدم ShotVL، وهو نموذج رائد تم تدريبه على مجموعة بيانات واسعة النطاق يتفوق بشكل كبير على الأنظمة الحالية في تفسير اللغة البصرية الدقيقة للسينما.

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu (…)2026-03-31
💻 computer science

AnthroTAP: Learning Point Tracking with Real-World Motion

يقدم AnthroTAP مساراً مؤتمتاً يولد بيانات تتبع نقاط ذات تسميات زائفة واسعة النطاق من فيديوهات حركة بشرية واقعية عبر الاستفوتادة من نماذج SMPL واتساق التدفق البصري، مما يمكّن نموذجاً تم تدريبه على هذه البيانات من تحقيق أداء رائد في معيار TAP-vid.

Inès Hyeonsu Kim, Seokju Cho, Jahyeok Koo, Junghyun Park, Jiahui Huang, Honglak Lee, Joon-Young Lee, Seungryong Kim2026-03-31
💻 computer science

MAN++: Scaling Momentum Auxiliary Network for Supervised Local Learning in Vision Tasks

تقترح الورقة البحثية إطار عمل MAN++، وهو إطار تعلم محلي تحت الإشراف يستخدم شبكة مساعدة ذات زخم تعتمد على المتوسط المتحرك الأسي مع انحياز قياس قابل للتعلم لسد الفجوات المعلوماتية بين الكتل، مما يحقق أداءً يضاهي الانتشار العكسي من طرف إلى طرف مع تقليل استهلاك ذاكرة وحدة معالجة الرسومات بشكل كبير.

Junhao Su, Feiyu Zhu, Hengyu Shi, Tianyang Han, Yurui Qiu, Junfeng Luo, Xiaoming Wei, Jialin Gao2026-03-31
💻 computer science

AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

يُعد AVATAR إطار عمل مبتكر للاستدلال متعدد الوسائط في الفيديو، يتغلب على قيود عدم كفاءة البيانات، وتلاشي الميزة، والتعيين الموحد للمسؤولية التي تعاني منها الأساليب الحالية مثل GRPO، وذلك من خلال تقديم بنية تدريب خارج السياسة (off-policy) وتشكيل الميزة الزمني (Temporal Advantage Shaping)، محققاً بذلك أداءً فائقاً وكفاءة عينات تبلغ 5 أضعاف عبر معايير قياسية متعددة.

Yogesh Kulkarni, Pooyan Fazli2026-03-31
💻 computer science

Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions

تقدم هذه الورقة إطار عمل للتصوير الحراري ثنائي النطاق يعالج تحدي عدم التحديد المتمثل في فصل الانبعاث والانعكاس المتغيرين زمنياً في الظروف القريبة من المحيط عبر الاستفادة المشتركة من قيود الانبعاث الطيفي وديناميكيات الإشارة الزمنية لاستعادة حقول درجات الحرارة بدقة.

Sriram Narayanan, Mani Ramanagopal, Srinivasa G. Narasimhan2026-03-31
🤖 AI

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

تكشف هذه الورقة أنه في حين أن توسيع الاستدلال القائم على التعلم المعزز لنماذج الرؤية واللغة يحسن الاستنتاج المنطقي، فإنه يتسبب دون قصد في "نسيان بصري" يؤدي إلى تدهور التجذر الإدراكي، وهي مشكلة يعالجها المؤلفون من خلال طريقة "تحسين السياسة المرتكزة على الرؤية" (VAPO) المقترحة، والتي تحقق نتائج هي الأفضل حالياً عبر توجيه الاستدلال صراحةً نحو مسارات مرتكزة بصرياً.

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Fabian Waschkowski, Lukas Wesemann, Peter Tu, Jing Zhang2026-03-31