💬 NLP

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

تقدم الورقة البحثية TimeCatch، وهو معيار مرجعي يكشف أنه بينما تتفوق نماذج الرؤية واللغة في اكتشاف الشذوذ على مستوى الإطار، فإنها تعاني بشكل كبير من تحديد التناقضات الزمنية الناتجة عن تبديل الإطارات، مما يشير إلى وجود فجوة جوهرية في قدرتها على الاستنتاج بشأن البنية الزمنية مقارنة بالبشر.

Marek Hradil, Danae Sánchez Villegas2026-08-25
💻 computer science

GeoWAM: Visual Geometry World Action Models for Autonomous Driving

تقدم هذه الورقة GeoWAM، وهو نموذج عمل عالمي للقيادة الذاتية يستبدل التنبؤ المستقبلي القائم على البكسل بالتنبؤ بالهندسة المستقبلية باستخدام السحب النقطية لالتقاط البنية المكانية والحركة بشكل أفضل، مما يؤدي إلى سياسات قيادة أقوى بكثير مقارنة بالبدائل القائمة على الصور.

Yiren Lu, Xin Ye, Jiaming Liu, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Dan (…)2026-08-25
💻 computer science

Investigating Relational Reasoning in VLMs

تتقصى هذه الورقة ما إذا كانت نماذج الرؤية واللغة تفهم حقاً العلاقات البصرية أم تعتمد على اختصارات لغوية، وذلك باستخدام مجموعة بيانات هندسية اصطناعية ونموذج Qwen3-VL-4B، مما يكشف أن نماذج الرؤية واللغة الحالية تجمع بين الاستدلال البصري الحقيقي والاستراتيجيات المتجذرة أساساً في الإشارات اللغوية.

Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap2026-08-25
🤖 machine learning

Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement

تُظهر هذه الدراسة أن نموذج التعلم العميق متعدد المخرجات (NODE)، الذي يستفيد من بيانات الاستشعار متعددة الأنماط من مجموعة بيانات MAISON-LLF، يتفوق على النهج أحادي المخرج في التنبؤ المتزامن بخمس نتائج سريرية تتعلق بالتعافي الوظيفي والعزلة الاجتماعية لكبار السن الذين يتعافون من كسور الأطراف السفلية أو استبدال مفصل الورك.

Santosh Ray, Pratik K. Mishra, Ali Abedi, Charlene H. Chu, Amir Ahmad, Shehroz S. Khan2026-08-25
💻 computer science

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

تقدم هذه الورقة معيار "سترووب المضمن" (Embedded Stroop) ومجموعة بيانات "ما لون النص" (WCIT) لإثبات أن النماذج اللغوية الكبيرة متعددة الوسائط تعاني بشكل متكرر من "هلوسات ستروب"، حيث تجيب بشكل غير صحيح بالمعنى الدلالي للنص المضمن في صورة ما بدلاً من اللون الفعلي لذلك النص، مما يكشف أن المقروئية الدلالية يمكن أن تطغى على الإدراك البصري للون.

Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu2026-08-24
🔬 physics

MeltwaterBench: Deep learning for spatiotemporal downscaling of surface meltwater

تقدم هذه الورقة MeltwaterBench، وهو إطار عمل للتعلم العميق يدمج بيانات الاستشعار عن بعد مع النماذج القائمة على الفيزياء لإنشاء خرائط يومية لمياه الذوبان السطحي بدقة 100 متر فوق نهر هيلهيم الجليدي في جرينلاند، محققاً دقة أعلى بكثير (95%) من النهج الحالية غير القائمة على التعلم العميق، مع توفير مجموعة بيانات مرجعية جديدة لأبحاث تقليل النطاق الزماني والمكاني.

Björn Lütjens, Patrick Alexander, Raf Antwerpen, Til Widmann, Guido Cervone, Marco Tedesco2026-08-24
💻 computer science

Deep Models, Shallow Alignment: Uncovering the Granularity Mismatch in Neural Decoding

تقدم الورقة البحثية "المحاذاة الضحلة" (Shallow Alignment)، وهو إطار عمل يحسن فك التشفير البصري العصبي من خلال محاذاة إشارات الدماغ بشكل منهجي مع الطبقات المتوسطة لنماذج الرؤية مسبقة التدريب بدلاً من مجرد التضمينات النهائية، مما يعالج عدم تطابق الحبيبية ويحقق مكاسب كبيرة في الأداء تتناسب طردياً مع سعة النموذج.

Yang Du, Siyuan Dai, Yonghao Song, Paul M. Thompson, Haoteng Tang, Liang Zhan2026-08-24
💻 computer science

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

تُعد MultiCube طريقة مبتكرة تعتمد على الانتشار ثنائي المراحل، تتيح توليد نماذج ثلاثية الأبعاد تركيبية بدقة عبر قبول مطالبات نصية عامة إلى جانب تخطيطات دلالية ومكانية محددة على مستوى الأجزاء، لإنتاج كائنات ثلاثية الأبعاد عالية الجودة ذات مكونات يمكن التحكم بها بشكل مستقل.

Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou2026-08-24
💻 computer science

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

تقدم هذه الورقة البحثية OraRL، وهو إطار عمل للتعلم التعزيزي القابل للتوسع لنماذج اللغات الكبيرة متعددة الوسائط للفيديو (video MLLMs)، والذي يعامل التوصيفات كمسارات أوراكل (oracle rollouts) ضمن آلية تقدير ميزة مفككة للتغلب على انقلاب الميزة (advantage inversion)، محققاً بذلك أداءً فائقاً في الاختبارات المعيارية الزمنية والمكانية مع كفاءة تدريب أعلى بكثير واستدلال أسرع مقارنة بالطرق الحالية.

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng2026-08-24
💻 computer science

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

تقدم هذه الورقة Grounded-Exo2Ego، وهو إطار عمل لانتشار الفيديو ثنائي الفروع يجمع بين الارتكاز الهندسي وفرع تجذير دلالي مبتكر وخوارزمية إعادة تحديد موقع الكاميرا لتوليد فيديوهات من منظور الشخص الأول (egocentric) من مدخلات من منظور خارجي (exocentric) بشكل قوي، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات EgoExo4D من خلال تحسين البنية وتوليد البيانات الاصطناعية بشكل مؤتمت بالكامل.

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello2026-08-24