💻 computer science

R2E-VID: Two-Stage Robust Routing via Temporal Gating for Elastic Edge-Cloud Video Inference

تقترح الورقة البحثية إطار عمل R2E-VID، وهو إطار توجيه قوي ثنائي المراحل يستفيد من البوابة الزمنية للتكيف ديناميكيًا مع أعباء عمل استنتاج الفيديو بين الحافة والسحابة، مما يقلل التكاليف وزمن الاستجابة بشكل كبير مع تحسين الدقة مقارنة بالحلول الحالية.

Zheming Yang, Lulu Zuo, Shun Lu, Yangyu Zhang, Zhicheng Li, Xiangyang Li, Yang You2026-04-15
💻 computer science

Multi-Head Attention based interaction-aware architecture for Bangla Handwritten Character Recognition: Introducing a Primary Dataset

تقدم هذه الورقة مجموعة بيانات جديدة ومتوازنة للأحرف البنغالية المكتوبة بخط اليد، وتقترح بنية تعلم عميق هجينة مدركة للتفاعل تجمع بين وحدات EfficientNetB3 وVision Transformer وConformer مع دمج الانتباه المتقاطع متعدد الرؤوس، محققةً دقة هي الأفضل في فئتها وقدرة قوية على التعميم على كل من مجموعة البيانات الجديدة والمراجع الخارجية.

Mirza Raquib, Asif Pervez Polok, Kedar Nath Biswas, Farida Siddiqi Prity, Saydul Akbar Murad, Nick Rahimi2026-04-15
💻 computer science

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

تقترح الورقة البحثية استراتيجية فك تشفير DOP-OBC، وهي استراتيجية لا تتطلب إعادة تدريب، تعمل على التخفيف من حدة هلوسة الكائنات في النماذج اللغوية الكبيرة متعددة الوسائط من خلال فرض تخصيص متساوٍ للانتباه عبر عقوبة الكائن المهيمن ومعامل تعزيز القيم المتطرفة، مما يؤدي إلى تحسين جودة الربط والتوليد دون الحاجة إلى إعادة تدريب النموذج.

Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imr (…)2026-04-15
💻 computer science

Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

تقترح هذه الورقة إطار عمل لوكيل نموذج لغوي بصري (VLM) ذي حلقة مغلقة يستفيد من الاستدلال التكراري وثلاث تقنيات محددة عند الاستنتاج لتحسين أداء إعادة ترتيب وضعية الأشياء سداسية الأبعاد (6D) والتحكم الروبوتي الموجه بالنصوص بشكل كبير دون الحاجة إلى ضبط دقيق إضافي.

Sangwon Baik, Gunhee Kim, Mingi Choi, Hanbyul Joo2026-04-15
💻 computer science

RobustMedSAM: Degradation-Resilient Medical Image Segmentation via Robust Foundation Model Adaptation

يعالج RobustMedSAM موثوقية تقسيم الصور الطبية في ظل تشوهات الصور الواقعية من خلال توظيف استراتيجية دمج نقاط تفتيش على مستوى الوحدات تجمع بين مشفر صور مهيأ بـ MedSAM وفك تشفير قناع مهيأ بـ RobustSAM، محققاً مكاسب كبيرة في الأداء من خلال الضبط الدقيق المستهدف على مجموعات بيانات طبية متنوعة.

Jieru Li, Matthew Chen, Micky C. Nnamdi, J. Ben Tamo, Benoit L. Marteau, May D. Wang2026-04-15
💻 computer science

Vector Field Synthesis with Sparse Streamlines Using Diffusion Model

تقدم هذه الورقة إطار عمل جديد لنموذج الانتشار الشرطي يقوم بتخليق حقول متجهة ثنائية الأبعاد معقولة فيزيائياً من مدخلات خطوط انسياب متفرقة، متفوقاً بذلك على الطرق التقليدية القائمة على الأمثلة من حيث المرونة والاتساق الفيزيائي.

Nguyen K. Phan, Ricardo Morales, Sebastian D. Espriella, Guoning Chen2026-04-15
💻 computer science

Do vision models perceive illusory motion in static images like humans?

تُظهر هذه الورقة أن معظم نماذج التدفق البصري الحالية تفشل في إدراك الحركة الوهمية في الصور الثابتة مثل خداع "الأفاعي الدوارة"، بينما ينجح نموذج ثنائي القنوات مستوحى من البشر مع آليات انتباه متكررة في محاكاة الإدراك البشري تحت ظروف حركات العين الارتجافية المحاكية، مما يسلط الضوء على فجوة كبيرة بين معالجة الحركة لدى الآلة ومعالجة الحركة لدى البشر.

Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikola (…)2026-04-15
💻 computer science

FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views

يُعد FF3R إطار عمل أمامي التغذية، خالٍ تماماً من التوسيم، يوحد بين إعادة البناء الهندسي والدلالي ثلاثي الأبعاد من صور متعددة المشاهد غير مقيدة عبر الاستفوتادة من الإشراف على التصيير وآليات مبتكرة مثل الاندماج القائم على الرموز (Token-wise Fusion) والتعزيز المتبادل بين الدلالة والهندسة (Semantic-Geometry Mutual Boosting) لتحقيق أداء فائق في تخليق المشاهد الجديدة، والتجزئة ذات المفردات المفتوحة، وتقدير العمق دون الحاجة إلى أوضاع الكاميرا أو تسميات توضيحية.

Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang2026-04-15
💻 computer science

Topo-ADV: Generating Topology-Driven Imperceptible Adversarial Point Clouds

تقدم هذه الورقة البحثية Topo-ADV، وهو أول إطار عمل للهجوم الخصومي القائم على الطوبولوجيا للسحب النقطية ثلاثية الأبعاد، والذي يستفيد من الهومولوجيا المستمرة لتوليد اضطرابات غير محسوسة تحقق معدلات نجاح هجوم تصل إلى 100% من خلال استغلال الثغرات الهومولوجية بدلاً من الخصائص الهندسية التقليدية.

Gayathry Chandramana Krishnan Nampoothiry, Raghuram Venkatapuram, Anirban Ghosh, Ayan Dutta2026-04-15
💻 computer science

PointSplat: Efficient Geometry-Driven Pruning and Transformer Refinement for 3D Gaussian Splatting

يُعد PointSplat إطار عمل مبتكرًا مدفوعًا بالهندسة ثلاثية الأبعاد، يعمل بكفاءة على تقليل متطلبات الذاكرة والتخزين لتقنية Gaussian Splatting ثلاثية الأبعاد من خلال تقليم الـ Gaussians بناءً على السمات ثلاثية الأبعاد فقط وتحسينها باستخدام محول ثنائي الفرع، مما يحقق رندر عالي الدقة دون الحاجة إلى تحسين لكل مشهد.

Anh Thuan Tran, Jana Kosecka2026-04-15