💻 computer science

Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design

يقدم Le-DETR عمودًا فقريًا فعالًا (EfficientNAT) ومشفرًا هجينًا مُعاد تصميمُه لتحقيق أداء رائد في اكتشاف الأشياء في الوقت الفعلي مع تقليل تكاليف التدريب المسبق بشكل كبير، مما يلغي الحاجة إلى التدريب المسبق المكلف مع التفوق على النماذج الرائدة مثل YOLOv12 وDEIM-D-FINE في كل من الدقة والسرعة.

Jiannan Huang, Aditya Kane, Fengzhe Zhou, Yunchao Wei, Humphrey Shi2026-02-25
🤖 AI

MIP Candy: A Modular PyTorch Framework for Medical Image Processing

تُعد MIP Candy إطار عمل مفتوح المصدر يعتمد على PyTorch ومبنياً على نظام الوحدات (modular)، صُمم لتبسيط معالجة الصور الطبية عبر توفير مسار عمل كامل ومرن يوازن بين سهولة التنفيذ والتحكم الدقيق من خلال ميزات مثل التكوين المؤجل، والتتبع المكثف للتجارب، ونظام الحزم المسبقة البناء.

Tianhao Fu, Yucheng Chen2026-02-25
💻 computer science

Optimizing Occupancy Sensor Placement in Smart Environments

تقترح هذه الورقة طريقة آلية لوضع المستشعرات تستخدم محاكاة مسارات الشاغلين والبرمجة الخطية الصحيحة لتحديد التخطيطات المثلى لمستشعرات زمن الطيران التي تحافظ على الخصوصية، وذلك بهدف تعظيم دقة عد إشغال المناطق في الوقت الفعلي في البيئات التجارية.

Hao Lu, Richard J. Radke2026-02-25
💻 computer science

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

تقدم هذه الورقة UDVideoQA، وهي مجموعة بيانات مرجعية واسعة النطاق تحافظ على الخصوصية ومستمدة من لقطات حركة المرور الحضرية في العالم الحقيقي، وتتميز بـ 28 ألف زوج من الأسئلة والأجوبة لتقييم الاستدلال الزماني المكاني متعدد الكائنات، مما يكشف عن فجوة كبيرة بين الإدراك والاستدلال في النماذج الحالية مع إثبات أن الضبط الدقيق للنماذج مفتوحة المصدر الأصغر حجماً يمكن أن يحقق أداءً مماثلاً للأنظمة المملوكة.

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Moh (…)2026-02-25
💻 computer science

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

تقترح هذه الورقة إطار عمل لاسترجاع النصوص إلى الصور قابل للتحكم في الجودة، يستفيد من النماذج اللغوية التوليدية لإثراء استعلامات المستخدم القصيرة والغامضة بتفاصيل سياقية وقيود جودة صريحة، مما يؤدي إلى تحسين أداء الاسترجاع وتمكين نتائج قابلة للتوجيه وشفافة دون تعديل نماذج الرؤية واللغة الموجودة.

Jianglin Lu, Simon Jenni, Kushal Kafle, Jing Shi, Handong Zhao, Yun Fu2026-02-25
💻 computer science

Mask-HybridGNet: Graph-based segmentation with emergent anatomical correspondence from pixel-level supervision

يُعد Mask-HybridGNet إطار عمل جديد للتقسيم القائم على الرسوم البيانية (graph-based) يلغي الحاجة إلى تعليقات المعالم اليدوية (manual landmark annotations) من خلال التدريب مباشرة على الأقنعة القياسية لكل بكسل (pixel-wise masks)، مما يُمكّن النماذج القائمة على الرسوم البيانية من تحقيق أداء تنافسي مع تعلم ارتباطات تشريحية متسقة عبر المرضى بشكل طارئ.

Nicolás Gaggion, Maria J. Ledesma-Carbayo, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante2026-02-25
💬 NLP

Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

تقدم هذه الورقة "التخطيط التأملي أثناء وقت الاختبار" (Reflective Test-Time Planning)، وهو إطار عمل يعزز النماذج اللغوية الكبيرة المتجسدة من خلال دمج "التأمل أثناء الفعل"، و"التأمل في الفعل"، و"التأمل الاسترجاعي" لتحويل التجربة والخطأ المتكررة إلى خبرة تراكمية، مما يؤدي إلى تحسين أداء المهام طويلة المدى وتصحيح السلوك بشكل كبير.

Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Jiajun Wu, Yejin Choi2026-02-25
🤖 machine learning

Squint: Fast Visual Reinforcement Learning for Sim-to-Real Robotics

تقدم الورقة البحثية Squint، وهي طريقة سريعة للتعلم التعزيزي البصري تجمع بين المحاكاة المتوازية، والناقد التوزيعي، وتقنيات التدريب المُحسّنة لتحقيق تقارب سريع في وقت التشغيل الفعلي ونقل ناجح من المحاكاة إلى الواقع على مجموعة جديدة من مهام المناولة باستخدام وحدة معالجة رسوميات واحدة.

Abdulaziz Almuzairee, Henrik I. Christensen2026-02-25
💻 computer science

Face Pyramid Vision Transformer

تقترح الورقة البحثية "Face Pyramid Vision Transformer (FPVT)"، وهي بنية مبتكرة تدمج تقنيات تقليل الأبعاد المكانية، وتقليل الأبعاد، وتحسين تضمين الرقع (patch embedding)، وشبكة تغذية أمامية تلافيفية (convolutional feed-forward network) لتحقيق أداء رائد في التعرف على الوجوه بعدد أقل من المعلمات عبر الجمع بفعالية بين نقاط القوة في الشبكات التلافيفية (CNNs) ومحولات الرؤية (Vision Transformers).

Khawar Islam, Muhammad Zaigham Zaheer, Arif Mahmood2026-02-24
🤖 AI

Learning to See the Elephant in the Room: Self-Supervised Context Reasoning in Humans and AI

تُثبت هذه الورقة أن كلاً من البشر ونموذج "SeCo" الجديد المستوحى بيولوجياً يمكنهما تعلم وتعميم الاستدلال السياقي بسرعة لاستنتاج الأجسام الخفية من المشاهد المحيطة دون إشراف صريح، مما يسلط الضوء على الدور الحاسم للارتباطات السياقية في فهم المشهد.

Xiao Liu, Soumick Sarker, Ankur Sikarwar, Bryan Atista Kiely, Gabriel Kreiman, Zenglin Shi, Mengmi Zhang2026-02-24