💻 computer science

HST-HGN: Heterogeneous Spatial-Temporal Hypergraph Networks with Bidirectional State Space Models for Global Fatigue Assessment

تقترح الورقة البحثية إطار عمل HST-HGN، وهو شبكة هيبيرغراف هرمية مبتكرة لالتقاط التآزرات الوجهية المكانية عالية الرتبة ووحدة Mamba ثنائية الاتجاه لنمذجة زمنية طويلة المدى وفعالة، وذلك لتحقيق تقييم فوري وحالة متطورة لإجهاد السائق عالمياً من فيديوهات غير مقصوصة في ظل ميزانيات حوسبة مقيدة.

Changdao Chen2026-04-10
💬 NLP

Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models

تقدم هذه الورقة البحثية "تأريض تدرج الإنتروبيا" (Entropy-Gradient Grounding)، وهي طريقة لا تتطلب تدريباً تعزز قدرة نماذج الرؤية واللغة على استرجاع الأدلة للاستعلامات المعقدة عبر نشر إنتروبيا الرمز التالي عكسياً لتوليد خرائط صلة، مما يتيح صقلاً بصرياً تكرارياً مدفوعاً بعدم اليقين دون الحاجة إلى كواشف مساعدة.

Marcel Gröpl, Jaewoo Jung, Seungryong Kim, Marc Pollefeys, Sunghwan Hong2026-04-10
💻 computer science

CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning

تقدم هذه الورقة CrashSight، وهو معيار مرجعي واسع النطاق للرؤية واللغة يستخدم بيانات كاميرات الطريق من العالم الحقيقي وتصنيفاً ثنائي المستويات لتقييم وكشف أوجه القصور في نماذج الرؤية واللغة الحالية في فهم والاستدلال حول مشاهد حوادث المرور من منظور البنية التحتية.

Rui Gan, Junyi Ma, Pei Li, Xingyou Yang, Kai Chen, Sikai Chen, Bin Ran2026-04-10
💻 computer science

Novel View Synthesis as Video Completion

تقدم الورقة البحثية FrameCrafter، وهو نهج مبتكر يعمل على تطويع نماذج الانتشار بالفيديو لتركيب مناظر جديدة نادرة عبر إعادة صياغة المهمة كمسألة إكمال فيديو غير معتمدة على الترتيب، مما يتيح الاستفضاء من المعرفة الضمنية متعددة الرؤى دون الحاجة إلى بيانات تدريب معقدة متعددة الرؤى.

Qi Wu, Khiem Vuong, Minsik Jeon, Srinivasa Narasimhan, Deva Ramanan2026-04-10
💻 computer science

Self-Improving 4D Perception via Self-Distillation

تقترح الورقة البحثية SelfEvo، وهو إطار عمل للتحسين الذاتي يستفيد من التقطير الذاتي مع عدم التماثل في السياق الزماني والمكاني لتعزيز نماذج إعادة البناء متعددة المشاهد مسبقة التدريب على مقاطع الفيديو غير المصنفة، محققاً مكاسب كبيرة في مهام الإدراك رباعي الأبعاد مثل تقدير العمق والكاميرا دون الحاجة إلى تسميات توضيحية حقيقية.

Nan Huang, Pengcheng Yu, Weijia Zeng, James M. Rehg, Angjoo Kanazawa, Haiwen Feng, Qianqian Wang2026-04-10
💻 computer science

ParseBench: A Document Parsing Benchmark for AI Agents

تقدم هذه الورقة ParseBench، وهو معيار مرجعي جديد يضم حوالي 2,000 وثيقة مؤسسية تم التحقق منها بشرياً، صُممت لتقييم وكلاء الذكاء الاصطناعي بناءً على خمسة أبعاد حرجة للصحة الدلالية — الجداول، والرسوم البيانية، وأمانة المحتوى، والتنسيق الدلالي، والتأسيس البصري — مما يكشف أن طرق التحليل الحالية تفتقر إلى الأداء المتسق عبر جميع القدرات.

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Simon Suo2026-04-10
💬 NLP

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

يُعد OpenVLThinkerV2 نموذج استدلال متعدد الوسائط قوي الأداء وعام الغرض، يحقق أداءً فائقاً عبر مهام بصرية متنوعة من خلال تقديم خوارزمية Gaussian GRPO (G2^2RPO) لضمان تكافؤ التدرج واستقراره بين المهام، إلى جانب آليات مبتكرة لتشكيل طول الاستجابة والاعتلاج (entropy) للموازنة بفعالية بين الإدراك دقيق التفاصيل والاستدلال متعدد الخطوات.

Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang2026-04-10
💬 NLP

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

تحدد هذه الورقة ظاهرة "الرؤية دون التفكير" في نماذج خليط الخبراء متعددة الوسائط وتعالجها، حيث تتسبب المدخلات البصرية في عدم تفعيل آليات التوجيه للخبراء المعنيين بالاستدلال ذوي الصلة بالمهمة، وتقترح تدخلاً موجهاً للتوجيه يحسن بشكل كبير أداء الاستدلال البصري المعقد من خلال ضمان التفعيل المناسب للخبراء.

Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Z (…)2026-04-10
💻 computer science

UAVDB: Point-Guided Masks for UAV Detection and Segmentation

تقدم هذه الورقة UAVDB، وهي مجموعة بيانات مرجعية واسعة النطاق للكشف عن الطائرات بدون طيار وتجزئتها، تتميز بأجسام متعددة المقاييس وتسميات عالية الدقة تم إنشاؤها من خلال مسار إشراف ضعيف موجه بالنقاط يجمع بين تقارب شدة الرقعة (Patch Intensity Convergence) لصناديق الإحاطة ونموذج SAM2 لأقنعة التجزئة.

Yu-Hsi Chen2026-04-09
⚡ electrical engineering

MozzaVID: Mozzarella Volumetric Image Dataset

تقدم الورقة البحثية MozzaVID، وهي مجموعة بيانات حجمية متعددة الدقة وواسعة النطاق للبنية المجهرية لجبن الموزاريلا مستمدة من فحوصات التصوير المقطعي بالأشعة السينية (X-ray CT)، والمصممة لاختبار نماذج التعلم العميق لتحليل وتصنيف بنية الأغذ "ثلاثية الأبعاد".

Pawel Tomasz Pieta, Peter Winkel Rasmussen, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Arjomand Bigdeli, Carste (…)2026-04-09