💻 computer science

Systematic Analysis of Coupling Effects on Closed-Loop and Open-Loop Performance in Aerial Continuum Manipulators

تقارن هذه الورقة بشكل منهجي بين النماذج الديناميكية المنفصلة والمقترنة للمناولات المستمرة الجوية، مظهرةً أنه في حين يُظهر النموذج المنفصل تباينات كبيرة في الحلقة المفتوحة، فإنه يحقق دقة تتبع في الحلقة المغلقة مماثلة للنموذج المقترن مع تقليل التكلفة الحسابية عند استخدامه في متحكم رؤية خادم جديد يعتمد على الديناميكيات.

Niloufar Amiri, Shayan Sepahvand, Iraj Mantegh, Farrokh Janabi-Sharifi2026-02-24
💻 computer science

NeXt2Former-CD: Efficient Remote Sensing Change Detection with Modern Vision Architectures

تقترح الورقة البحثية NeXt2Former-CD، وهو إطار عمل فعال وشامل (end-to-end) للكشف عن التغيير في الاستشعار عن بعد يجمع بين مشفر ConvNeXt مُهيأ بـ DINOv3 ووحدة دمج انتباه تشوهي (deformable attention fusion module) ومفكك شفرة Mask2Former للتفوق على الأساليب الحديثة القائمة على نماذج الحالة الفضائية (State Space Model) في الدقة مع الحفاظ على زمن استجابة مماثل عند الاستدلال.

Yufan Wang, Sokratis Makrogiannis, Chandra Kambhamettu2026-02-24
🤖 AI

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

تقدم الورقة البحثية MiSCHiEF، وهو معيار يتكون من مجموعات بيانات للأزواج الدنيا (minimal-pair) تتعلق بالسلامة والثقافة لتقييم التوافق الدقيق بين الصورة والوصف في نماذج الرؤية واللغة، مما يكشف أن النماذج الحالية تعاني في تحقيق الربط المتقاطع الدقيق بين الوسائط وتظهر تحيزات محددة في التمييز بين الفروق الدلالية والبصرية الطفيفة.

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma2026-02-24
🤖 AI

Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code

تقدم هذه الورقة GeoCode، وهي مجموعة بيانات هندسية متعددة الوسائط مُولدة اصطناعياً تضمن الاتساق من خلال عرض الرسوم التخطيطية القائم على الكود، وتستفيد من كود الرسم البياني كهدف محاذاة صريح لتعزيز قدرات الاستدلال الهندسي لنماذج الرؤية واللغة بشكل كبير.

Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan2026-02-24
🤖 AI

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

تقترح الورقة البحثية إطار عمل TAG، وهو إطار عمل للرؤية واللغة يعمل على تعزيز التعرف على تعبيرات الوجه من خلال تقييد الاستدلال متعدد الوسائط ليكون مرتبطاً بشكل صريح بوحدات الحركة الوجهية (Action Units)، مما يؤدي إلى تحسين دقة التنبؤ، والأمانة البصرية، والمتانة ضد الهلوسة عبر مجموعات بيانات متعددة.

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang2026-02-24
💻 computer science

A high-resolution nationwide urban village mapping product for 342 Chinese cities based on foundation models

تقدم هذه الورقة GeoLink-UV، وهي مجموعة بيانات وطنية عالية الدقة ترسم خرائط للقرى الحضرية عبر 342 مدينة صينية باستخدام إطار عمل مدفوع بنموذج تأسيسي، مما يكشف عن تفاوتات إقليمية كبيرة في انتشارها ومورفولوجيتها مع توفير مورد جغرافي مكاني تم التحقق من صحته للحوكمة الحضرية وتخطيط التنمية المستدامة.

Lubin Bai, Sheng Xiao, Ziyu Yin, Haoyu Wang, Siyang Wu, Xiuyuan Zhang, Shihong Du2026-02-24
💻 computer science

Initialization matters in few-shot adaptation of vision-language models for histopathological image classification

تقترح هذه الورقة البحثية التعلم متعدد الحالات صفري المعرفة (ZS-MIL)، وهو طريقة تكيف قليلة المعرفة لنماذج الرؤية واللغة في علم أمراض الأنسجة، والتي تستخدم تضمينات فئات مشفر النصوص لتهيئة المصنفات الخطية، مما يؤدي إلى تفوقها على التهيئة العشوائية في كل من الدقة والاستقرار لتصنيف الصور كاملة الشريحة.

Pablo Meseguer, Rocío del Amor, Valery Naranjo2026-02-24
💻 computer science

Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection

تقترح هذه الورقة البحثية نموذج LMP، وهو كاشف ثنائي المسارات يعزز عملية الكشف عن الأشياء في ظل ظروف التعلم القليل من الأمثلة عبر المجالات (Cross-Domain Few-Shot Object Detection) من خلال تعلم نماذج أولية متعددة الأنماط تجمع بين التوجيه النصي مفتوح المفردات والنماذج البصرية المشكلة ديناميكيًا لالتقاط كل من الدلالات الثابتة عبر المجالات وتفاصيل التحديد المكاني الخاصة بكل مجال.

Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen2026-02-24
💻 computer science

HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation

تقدم هذه الورقة البحثية HeRO، وهو سياسة قائمة على الانتشار تحقق أداءً رائدًا في التلاعب الروبوتي المدرك للوضعية من خلال توظيف حقول دلالية هرمية لدمج ميزات DINOv2 الحساسة للهندسة مع تناظرات Stable Diffusion المتماسكة عالميًا، مما يتيح فهمًا دلاليًا دقيقًا على مستوى الأجزاء للتعامل مع الكائنات المعقدة.

Chongyang Xu, Shen Cheng, Haipeng Li, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu2026-02-24
🤖 machine learning

Bayesian Lottery Ticket Hypothesis

تُثبت هذه الورقة أن فرضية تذكرة اليانصيب تمتد لتشمل الشبكات العصبية البايزية، مما يكشف أن الشبكات الفرعية المتفرقة يمكنها تحقيق دقة مماثلة أو متفوقة على النماذج الكثيفة عند تقليمها بناءً على مقدار الوزن بشكل أساسي والانحراف المعياري بشكل ثانوي، مع استكشاف التفاعل بين بنية القناع وتهيئ الأوزان في الوقت ذاته.

Nicholas Kuhn, Arvid Weyrauch, Lars Heyen, Achim Streit, Markus Götz, Charlotte Debus2026-02-24