💻 computer science

Wandering around: A bioinspired approach to visual attention through object motion sensitivity

تقدم هذه الورقة نظام انتباه مستوحى حيويًا وخاليًا من التعلم، يستخدم كاميرات تعتمد على الأحداث وشبكات عصبية تلافيفية نبضية لتحقيق تقسيم حركة الأجسام واستهداف حركات العين السريعة في الوقت الفعلي وبكفاءة للتطبيقات الروبوتية.

Giulia D'Angelo, Victoria Clerico, Chiara Bartolozzi, Matej Hoffmann, P. Michael Furlong, Alexander Hadjiivanov2026-02-11
💻 computer science

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models

تُظهر الورقة البحثية أن استبدال الضجيج غير المشروط الذي تم تعلمه بشكل ضعيف في نماذج الانتشار المضبوطة بدقة بضجيج متوقع من نموذج أساسي عالي الجودة (أو حتى نموذج انتشار مختلف) يحسن بشكل كبير من جودة التوليد الشرطي.

Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung2026-02-11
💻 computer science

Benchmarking 3D Human Pose Estimation Models under Occlusions

تقيم هذه الورقة مدى متانة تسعة من نماذج تقدير وضعية جسم الإنسان ثلاثية الأبعاد المتطورة في مواجهة حالات الاحتجاب الواقعية باستخدام مجموعة بيانات BlendMimic3D، مما يكشف أن جميع النماذج تعاني من تدهور كبير في الأداء — لا سيما عند المفاصل الطرفية — ويسلط الضوء على الحاجة الماسة لتحسين القدرة على التعميم في السيناريوهات الواقعية.

Filipa Lino, Carlos Santiago, Manuel Marques2026-02-11
💻 computer science

ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking

تقدم الورقة البحثية ReaMOT، وهو معيار ومهمة جديدة تركز على التتبع متعدد الأجسام القائم على الاستنتاج، والذي يتطلب من النماذج تحديد الأهداف من خلال قيود منطقية ضمنية، مصحوباً بمجموعة بيانات واسعة النطاق وإطار عمل خالٍ من التدريب يسمى ReaTrack يجمع بين نماذج اللغات الكبيرة متعددة الوسائط ذات التفكير المتغير وSAM2.

Sijia Chen, Yanqiu Yu, En Yu, Wenbing Tao2026-02-11
💻 computer science

Keystep Recognition using Graph Neural Networks

تقترح الورقة البحثية إطار عمل GLEVR، وهو إطار عمل فعال حاسبياً لتعلم الرسوم البيانية يعامل التعرف على الخطوات الرئيسية كمهمة تصنيف عقد، ويعمل على تحسين الأداء من خلال الاستفادة من التبعيات طويلة المدى والمحاذاة عبر الوسائط بين فيديوهات المنظور الشخصي، وفيديوهات المنظور الخارجي، والتعليقات التوضيحية.

Julia Lee Romero, Kyle Min, Subarna Tripathi, Morteza Karimzadeh2026-02-11
🤖 machine learning

UFM: A Simple Path towards Unified Dense Correspondence with Flow

تقدم الورقة البحثية نموذج UFM (التدفق والمطابقة الموحد)، وهو نموذج قائم على المحولات (transformer) يحقق دقة وسرعة فائقتين من خلال توحيد التدفق البصري والمطابقة الكثيفة واسعة النطاق عبر إطار تدريب واحد.

Yuchen Zhang, Nikhil Keetha, Chenwei Lyu, Bhuvan Jhamb, Yutian Chen, Yuheng Qiu, Jay Karhade, Shreyas Jha, Yaoyu Hu, Dev (…)2026-02-11
🤖 AI

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

يُعد TAMMs إطار عمل موحداً متعدد الوسائط يقوم بشكل مشترك بوصف التغير الزمني والتنبؤ بصور الأقمار الصناعية المستقبلية، وذلك باستخدام وحدات التكيف الزمني وحقن التحكم المدمج دلالياً لتعزيز الفهم الزمني طويل المدى والاتساق التوليدي.

Zhongbin Guo, Yuhao Wang, Ping Jian, Chengzhi Li, Xinyue Chen, Zhen Yang, Ertai E2026-02-11
💬 NLP

Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication

تقدم هذه الورقة مجموعة بيانات "الأشياء الشائعة خارج السياق" (COOCo) للتحقيق في كيفية موازنة نماذج الرؤية واللغة (VLMs) بين سمات الأشياء المحلية وسياق المشهد العالمي عند توليد المراجع، مما يكشف أن النماذج تستخدم السياق بشكل تكيفي بناءً على التطابق الدلالي ومستويات الضجيج.

Filippo Merlo, Ece Takmaz, Wenkai Chen, Albert Gatt2026-02-11
🤖 AI

Driving as a Diagnostic Tool: Scenario-based Cognitive Assessment in Older Drivers from Driving Video

تقترح هذه الورقة إطار عمل يستخدم نماذج الرؤية الكبيرة لتحليل فيديوهات القيادة الطبيعية، بهدف اكتشاف العلامات المبكرة للتدهور المعرفي والخرف لدى السائقين كبار السن من خلال تحديد "البصمات الرقمية" في سلوكهم الواقعي أثناء القيادة.

Md Zahid Hasan, Guillermo Basulto-Elias, Jun Ha Chang, Shauna Hallmark, Matthew Rizzo, Anuj Sharma, Soumik Sarkar2026-02-11
🤖 AI

STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision

يقدم STELAR-Vision إطار تدريب يعزز نماذج الرؤية واللغة من خلال استخدام طوبولوجيات استدلال متنوعة (مثل الأشجار والرسوم البيانية) عبر مسار بيانات اصطناعي يسمى TopoAug، مما يحسن دقة الاستدلال وكفاءة المخرجات بشكل كبير مقارنة بطرق سلسلة الأفكام التقليدية.

Chen Li, Han Zhang, Zhantao Yang, Fangyi Chen, Zihan Wang, Anudeepsekhar Bolimera, Marios Savvides2026-02-11