💬 NLP

Sparser Block-Sparse Attention via Token Permutation

تقدم هذه الورقة البحثية آلية "انتباه الكتل المتبادلة" (Permuted Block-Sparse Attention - PBS-Attn)، وهي طريقة جاهزة للاستخدام تعتمد على تبديل ترتيب الرموز (token permutation) لتحسين التشتت على مستوى الكتل في النماذج اللغوية الكبيرة ذات السياق الطويل، محققةً تسريعاً يصل إلى 2.75 ضعفاً في مرحلة التعبئة المسبقة (prefilling) مع الحفاظ على دقة تضاهي الانتباه الكامل.

Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipe (…)2026-05-25
💻 computer science

Enhancing 3D Semantic Scene Completion with a Refinement Module

تقترح الورقة البحثية إطار عمل ESSC-RM، وهو إطار عمل جاهز للتشغيل (plug-and-play) يعمل على تعزيز نماذج إكمال المشهد الدلالي الحالية من خلال دمج وحدة واعية بضجيج التنبؤ ووحدة هندسة محلية على مستوى الفوكسل لتنقية التنبؤات التقريبية، مما يؤدي إلى تحسين أداء متوسط تقاطع الاتحاد (mean IoU) على مجموعة بيانات SemanticKITTI.

Dunxing Zhang (Technical University of Munich, Munich, Germany), Jiachen Lu (Technical University of Munich, Munich, Ger (…)2026-05-25
💻 computer science

Benchmarking and Enhancing VLM for Compressed Image Understanding

تقدم هذه الورقة أول معيار شامل لتقييم نماذج الرؤية واللغة على الصور المضغوطة، وتحدد فشل التعميم باعتباره المصدر الرئيسي لفجوات الأداء، وتقترح مهايئاً عالمياً يحسن أداء النماذج عبر مختلف برامج الترميز ومعدلات البت بنسبة تتراوح بين 10% و30%.

Zifu Zhang, Tongda Xu, Siqi Li, Shengxi Li, Yue Zhang, Mai Xu, Yan Wang2026-05-25
🤖 AI

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

تقدم هذه الورقة البحثية VGAS، وهو إطار عمل لاختيار كتل الأفعال الموجهة بالقيمة يعزز تكيف الرؤية واللغة والأفعال في حالات التعلم من أمثلة قليلة، وذلك عبر الجمع بين مولد مقترحات عالي الاستدعاء وناقد قائم على الأسس الهندسية وتنظيم هندسي صريح لحل حالات الغموض وتحسين المتانة في ظل الإشراف المحدود.

Changhua Xu, En Yu, Junyu Xuan, Jie Lu2026-05-25
🤖 AI

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

تقدم هذه الورقة نموذج DiNa-LRM، وهو نموذج مكافأة كامن أصيل في عملية الانتشار (diffusion-native) وفعال حاسوبياً، يصيغ تعلم التفضيلات مباشرة على حالات الانتشار المشوشة للتغلب على عدم تطابق النطاق والتكاليف العالية لنماذج المكافآت القائمة على النماذج اللغوية البصرية، محققاً أداء محاذاة فائقاً مع متطلبات موارد أقل بكثير.

Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wen (…)2026-05-25
💻 computer science

Towards Generalizable Mapping of Hedges and Linear Woody Features from Earth Observation Data: a national Product for Germany

تقدم هذه الورقة سير عمل معياري وقابل للتعميم يجمع بين واجهة بيانات مرنة وشبكة عصبية عميقة واحدة لرسم خرائط المعالم الخشبية الخطية عبر ألمانيا بنطاق وطني بنجاح باستخدام بيانات رصد أرضي متنوعة دون الحاجة إلى إعادة تدريب النموذج.

Thorsten Hoeser, Verena Huber-Garcia, Sarah Asam, Ursula Gessner, Claudia Kuenzer2026-05-25
💻 computer science

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

يُعد 4DThinker إطار عمل مبتكر يعزز الاستدلال المكاني الديناميكي لنماذج الرؤية واللغة من خلال تمكينها من "التفكير بـ 4D" عبر محاكاة داخلية للصور الذهنية الكامنة، مدعوماً بمسار بيانات خالٍ من التوسيم، والضبط الدقيق للصور الديناميكية، والتعلم التعزيزي رباعي الأبعاد.

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xia (…)2026-05-25
💻 computer science

OpenGaFF: Open-Vocabulary Gaussian Feature Field with Codebook Attention

يُعد OpenGaFF إطار عمل جديد لفهم المشاهد ثلاثية الأبعاد ذات المفردات المفتوحة، وهو مبني على تقنية Gaussian Splatting ثلاثية الأبعاد، حيث يعمل على تعزيز التماسك الدلالي المكاني والاتساق على مستوى الكائنات من خلال ربط حقل سمات Gaussian بكتيب رموز مهيكل وآلية انتباه موجهة بكتيب الرموز.

Kunyi Li, Michael Niemeyer, Sen Wang, Stefano Gasperini, Nassir Navab, Federico Tombari2026-05-25
💻 computer science

Extending Deep Event Visual Odometry with Sparse Point-Cloud Export

توسع هذه الورقة البحثية إطار عمل تقدير المسافة البصرية للأحداث العميقة (DEVO) عبر إضافة مسار تصدير سحابي نقطي متفرق يقوم بتحويل البنية ثلاثية الأبعاد الداخلية للنظام إلى تمثيل هندسي صريح لأغراض التصور والمعالجة اللاحقة، محققةً دقة محلية عالية على بيانات الاختبار المرجعية مع الحفاظ على أداء تقدير المسافة الأصلي.

Alireza Safdari, Sajad Ashraf2026-05-25
💻 computer science

Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

تكشف هذه الورقة أن معايير التقييم الحالية للرؤية واللغة تفشل في تقييم الربط البصري دقيق التفاصيل بشكل موثوق لأن النماذج مفتوحة المصدر تظهر حساسية منخفضة بشكل مفاجئ تجاه التدهور البصري وتعتمد على الأدلة البصرية بدرجة أقل مما تشير إليه مقاييس الدقة القياسية، وهي ظاهرة تُعزى إلى زيادة التشابه بين الرموز البصرية في طبقات الشبكة العميقة.

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou2026-05-25