💻 computer science

Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline

تقدم هذه الورقة البحثية OVRSISBenchV2، وهو معيار مرجعي واسع النطاق وموجه نحو التطبيقات مع مجموعة بيانات OVRSIS95K وبروتوكولات المهام اللاحقة، إلى جانب نموذج الأساس Pi-Seg الذي يستخدم آلية ضوضاء ذات حافز إيجابي لتعزيز تقسيم صور الاستشعار عن بعد مفتوح المفردات بشكل واقعي.

Bingyu Li, Tao Huo, Haocheng Dong, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li2026-04-20
💻 computer science

CPU Optimization of a Monocular 3D Biomechanics Pipeline for Low-Resource Deployment

تقدم هذه الورقة مساراً للبيوميكانيكا ثلاثية الأبعاد أحادي العدسة ومُحسَّناً لوحدات المعالجة المركزية (CPU)، والذي يحقق زيادة في الإنتاجية بمعدل 2.47 ضعفاً وانخفاضاً في وقت التشغيل بنسبة 59.6% على الأجهزة الاستهلاكية، مع الحفاظ على دقة عالية تضاهي النماذج المرجعية القائمة على وحدات معالجة الرسومات (GPU)، مما يتيح تقييماً قابلاً للتوسع ومنخفض الموارد للحركة.

Yan Zhang, Xiong Zhao2026-04-20
💻 computer science

HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learning

تقدم هذه الورقة البحثية HyCal، وهي طريقة لمعايرة النماذج الأولية لا تتطلب تدريباً، تعمل على تخفيف حدة "جاذبية النطاق" (Domain Gravity) —وهي عدم تماثل تمثيلي ناتج عن عدم توازن البيانات في النطاقات غير المتجانسة— لتمكين التعلم التزايدي للفئات في ظل محدودية العينات (Few-Shot Class-Incremental Learning) عبر تخصصات متنوعة باستخدام نماذج الرؤية واللغة المجمدة.

Eunju Lee, MiHyeon Kim, JuneHyoung Kwon, Yoonji Lee, JiHyun Kim, Soojin Jang, YoungBin Kim2026-04-20
💻 computer science

Self-Supervised Angular Deblurring in Photoacoustic Reconstruction via Noisier2Inverse

تقترح هذه الورقة طريقة إعادة بناء ذاتية التوجيه تسمى Noisier2Inverse، تعالج بفعالية ضبابية الصور الناتجة عن الكواشف ذات الحجم المحدود في التصوير المقطعي الصوتي الضوئي من خلال العمل مباشرة على القياسات المشوشة دون الحاجة إلى بيانات حقيقية.

Markus Haltmeier, Nadja Gruber, Gyeongha Hwang2026-04-20
🤖 AI

Diffusion Autoencoder for Unsupervised Artifact Restoration in Handheld Fundus Images

تقترح هذه الورقة مشفرًا تلقائيًا بالانتشار غير خاضع للإشراف يتم تدريبه حصريًا على صور قاع العين عالية الجودة لاستعادة مختلف العيوب غير المهيكلة في عمليات الحصول على صور قاع العين المحمولة يدويًا بفعالية، مما يحسن دقة التشخيص بشكل كبير دون الحاجة إلى إشراف مقترن.

Mathumetha Palani, Kavya Puthumana, Ayantika Das, Ganapathy Krishnamurthi2026-04-20
🤖 AI

Sketch and Text Synergy: Fusing Structural Contours and Descriptive Attributes for Fine-Grained Image Retrieval

تقترح هذه الورقة إطار عمل STBIR، الذي يدمج بين الرسومات اليدوية والأوصاف النصية من خلال التعلم المنهجي، وتحسين المعرفة بالفئات، والمحاذاة متعددة المراحل عبر الوسائط لتحقيق أداء فائق في استرجاع الصور دقيق التفاصيل، مدعوماً بمجموعة بيانات مرجعية تم تنسيقها حديثاً.

Siyuan Wang, Hanchen Gao, Guangming Zhu, Jiang Lu, Yiyue Ma, Tianci Wu, Jincai Huang, Liang Zhang2026-04-20
💬 NLP

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

تقدم هذه الورقة البحثية RefereeBench، وهو أول معيار واسع النطاق يضم 11 رياضة وأكثر من 6,000 زوج من الأسئلة والأجوبة لتقييم نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) كحكام رياضيين، مما يكشف أن حتى النماذج الأكثر تطوراً تعاني في تطبيق القواعد والتأصيل الزمني، حيث حققت دقة تبلغ حوالي 60% فقط، مما يسلط الض�وء على الفجوة الكبيرة بين القدرات الحالية والتحكيم الآلي الموثوق.

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin2026-04-20
💻 computer science

PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding

تقدم هذه الورقة PLAF، وهو إطار عمل يحقق استخراجاً دقيقاً للميزات على مستوى البكسل ومتوافقاً لغوياً في البعد ثنائي الأبعاد، ومخطط تخزين فعالاً لتمكين فهم ثلاثي الأبعاد للمشاهد مفتوح المفردات وقابل للتوسع مع تقليل التكرار إلى أدنى حد.

Junjie Wen, Junlin He, Fei Ma, Jinqiang Cui2026-04-20
💻 computer science

Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow

تقترح هذه الورقة طريقة تدفق المعلومات التكيفي (AIF) التي تعزز نماذج الرؤية واللغة من خلال تعديل الانتباه ديناميكيًا أثناء الاستدلال لضمان تركيز الرموز النصية فقط على الرموز المرئية المهمة، مما يؤدي إلى تصحيح عدم التوافق بين الإدراك البصري وتوليد الإجابة.

Chengxin Liu, Wonseok Choi, Chenshuang Zhang, Tae-Hyun Oh2026-04-20
💻 computer science

SSFT: A Lightweight Spectral-Spatial Fusion Transformer for Generic Hyperspectral Classification

تقترح الورقة البحثية نموذج SSFT، وهو محول دمج طيفي-مكاني خفيف الوزن يحقق أداءً هو الأفضل في حالته في التصنيف الطيفي الفائق العام عبر مجموعات بيانات متنوعة من خلال تحليل تعلم التمثيل إلى مسارات طيفية ومكانية متكاملة عبر الانتباه المتقاطع، وكل ذلك مع استخدام أقل من 2% من معاملات الطرق الرائدة السابقة.

Alexander Musiat, Nikolas Ebert, Oliver Wasenmüller2026-04-20