💬 NLP

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

تقدم الورقة البحثية RAVENEA، وهو معيار جديد يدمج أكثر من 11,000 وثيقة منسقة من ويكيبيديا لتقييم وتوضيح كيف يعزز التوليد المعزز بالاسترجاع بشكل كبير فهم الثقافة البصرية في النماذج متعددة الوسائط من خلال تحسين الأداء في مهام الإجابة على الأسئلة البصرية التي تركز على الثقافة ووصف الصور.

Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, P (…)2026-02-17
🤖 machine learning

Grounding Bodily Awareness in Visual Representations for Efficient Policy Learning

تقدم هذه الورقة البحثية ICon، وهي طريقة تعلم تبايني لنماذج المحولات الرؤية (Vision Transformers) تعمل على فصل الرموز الخاصة بالوكيل عن الرموز الخاصة بالبيئة لإنشاء تمثيلات بصرية مدركة للجسم، مما يعزز كفاءة تعلم السياسات وقابلية النقل عبر الروبوتات في مهام المناولة الروبوتية.

Junlin Wang, Zhiyun Lin2026-02-17
🤖 AI

Multi-Spectral Gaussian Splatting with Neural Color Representation

تقدم هذه الورقة MS-Splatting، وهو إطار عمل جديد لتقنية "Gaussian Splatting" ثلاثية الأبعاد متعددة الأطياف يستخدم تمثيلاً لونياً عصبياً مُتعلماً لتوحيد المجالات الطيفية المتنوعة في تضمين واحد مدمج، مما يلغي الحاجة إلى المعايرة عبر الأنماط ويحسن جودة الرندرة بشكل كبير لتطبيقات مثل تحليل مؤشر الغطاء النباتي.

Lukas Meyer, Josef Grün, Maximilian Weiherer, Bernhard Egger, Marc Stamminger, Linus Franke2026-02-17
💻 computer science

Stretching Beyond the Obvious: A Gradient-Free Framework to Unveil the Hidden Landscape of Visual Invariance

تقدم هذه الورقة إطار عمل "التمدد والضغط" (SnS)، وهو إطار عمل خالٍ من التدرج يعمل على توصيف الثبات البصري والهشاشة العدائية من خلال تحسين المحفزات لتمديد التمثيلات العلوية مع ضغط استجابات الوحدات السفلية، مما يكشف عن أنماط تحول متميزة عبر طبقات الشبكة واختلافات في القابلية للتفسير بين النماذج القوية والقياسية.

Lorenzo Tausani, Paolo Muratore, Morgan B. Talbot, Giacomo Amerio, Gabriel Kreiman, Davide Zoccolan2026-02-17
💻 computer science

HMSViT: A Hierarchical Masked Self-Supervised Vision Transformer for Corneal Nerve Segmentation and Diabetic Neuropathy Diagnosis

تقترح الورقة البحثية نموذج HMSViT، وهو نموذج "Vision Transformer" هرمي يعتمد على التعلم الذاتي المقنع، والذي يستفيد من التدريب المسبق بالتقنيع الكتلي واستخراج الميزات متعدد المقاييس لتحقيق أداء رائد في تقسيم أعصاب القرنية وتشخيص اعتلال الأعصاب السكري، مع تقليل الاعتماد على البيانات المصنفة والتكاليف الحسابية.

Xin Zhang, Liangxiu Han, Yue Shi, Yanlin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik2026-02-17
💻 computer science

Hyperspectral vs. RGB for Pedestrian Segmentation in Urban Driving Scenes: A Comparative Study

تُظهر هذه الدراسة أن تحويل البيانات فائقة الطيف ذات الـ 128 قناة إلى تمثيلات ثلاثية القنوات باستخدام الاختيار الأمثل للنطاقات (CSNR-JMIM) يتفوق بشكل كبير على التصوير التقليدي بنظام RGB في تقسيم المشاة والركاب في مشاهد القيادة الحضرية، محققاً مكاسب ملموسة في مقاييس IoU وF1-score عبر نماذج متعددة للتجزئة الدلالية.

Jiarong Li, Imad Ali Shah, Enda Ward, Martin Glavin, Edward Jones, Brian Deegan2026-02-17
⚡ electrical engineering

CellINR: Implicitly Overcoming Photo-induced Artifacts in 4D Live Fluorescence Microscopy

يستخدم إطار العمل CellINR تمثيلاً عصبياً ضمنياً خاصاً بالحالة مع التلافيف العمياء وتضخيم البنية لإزالة العيوب الناجمة عن الضوء بشكل فعال واستعادة الاستمرارية الهيكلية في المجهر الفلوري الحي رباعي الأبعاد، مصحوباً بإصدار مجموعة بيانات مزدوجة جديدة ورمز للتحليل البيولوجي الكمي.

Cunmin Zhao, Ziyuan Luo, Guoye Guan, Zelin Li, Yiming Ma, Zhongying Zhao, Renjie Wan2026-02-17
💻 computer science

BEVTraj: Map-Free End-to-End Trajectory Prediction in Bird's-Eye View with Deformable Attention and Sparse Goal Proposals

يُعد BEVTraj إطار عمل للتنبؤ بالمسارات من طرف إلى طرف وخالٍ من الخرائط، يستخدم الانتباه القابل للتشكل لاستخراج السياق بكفاءة من ميزات منظور عين الطائر (Bird's-Eye View) الكثيفة ووحدة اقتراح أهداف متفرقة لتحقيق تنبؤ متعدد الأنماط وقوي يضاهي الأساليب القائمة على خرائط عالية الدقة دون الاعتماد على خرائط مسبقة البناء.

Minsang Kong, Myeongjun Kim, Sang Gu Kang, Hejiu Lu, Yupeng Zhong, Sang Hun Lee2026-02-17
💻 computer science

DeLiVR: Differential Spatiotemporal Lie Bias for Efficient Video Deraining

تُعد DeliVR طريقة فعالة لإزالة المطر من الفيديو، حيث تستفيد من انحيازات زمرة "لي" (Lie-group) المكانية والزمانية التفاضلية ضمن آليات الانتباه لتحقيق محاذاة متسقة هندسيًا وإزالة دقيقة لخطوط المطر، متجاوزةً بذلك القيود الحسابية وقيود المتانة التي تفرضها الأساليب الحالية القائمة على التدفق البصري.

Shuning Sun, Jialang Lu, Xiang Chen, Jichao Wang, Dianjie Lu, Guijuan Zhang, Guangwei Gao, Zhuoran Zheng2026-02-17
🤖 machine learning

Efficient Test-Time Scaling for Small Vision-Language Models

تقترح هذه الورقة استراتيجيتين فعالتين للتوسع في وقت الاختبار، وهما تعزيز وقت الاختبار (TTAug) وتكييف وقت الاختبار (TTAdapt)، اللتان تستفيدان من ميزات النموذج الداخلية لتحسين أداء نماذج الرؤية واللغة الصغيرة بشكل كبير عبر مختلف المعايير مع الحفاظ على الكفاءة الحسابية المناسبة للبيئات محدودة الموارد.

Mehmet Onurcan Kaya, Desmond Elliott, Dim P. Papadopoulos2026-02-17