💻 computer science

Semantic-Fast-SAM: Efficient Semantic Segmenter

تقترح الورقة البحثية نموذج Semantic-Fast-SAM (SFS)، وهو إطار عمل للتقسيم الدلالي في الوقت الفعلي يدمج نموذج FastSAM الفعال مع استراتيجية تسمية دلالية لتحقيق دقة عالية وقدرات المفردات المفتوحة بتكاليف حوسبة أقل بكثير من النهج الحالية القائمة على SAM.

Byunghyun Kim2026-04-23
🤖 machine learning

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

تقدم هذه الورقة البحثية WildFireVQA، وهو معيار مرجعي مفتوح المصدر واسع النطاق يضم أكثر من 6,000 عينة جوية بالأشعة المرئية والحرارية (RGB-thermal) و207,000 سؤال مصممة لتقييم وتحسين الاستدلال متعدد الوسائط من أجل مراقبة حرائق الغابات التشغيلية باستخدام البيانات الحرارية الإشعاعية.

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah2026-04-23
⚡ electrical engineering

Secure Rate-Distortion-Perception: A Randomized Distributed Function Computation Approach for Realism

تُوصّف هذه الورقة المقايضات الجوهرية بين المعدل والتشويه والإدراك تحت قيود أمنية صارمة لكل من القنوات عديمة الضجيج وقنوات البث، مُبينةً أن الترميز الموزع العشوائي مع العشوائية المشتركة يمكن أن يحقق في آن واحد سرية قوية، وتشويهاً منخفضاً، وجودة إدراكية عالية.

Gustaf Åhlgren, Onur Günlü2026-04-23
💻 computer science

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

تقدم الورقة البحثية SurgCoT، وهو معيار شامل مصمم لتقييم وتطوير قدرات الاستدلال عبر تسلسل الأفكار المكاني والزماني دقيق التفاصيل للنماذج اللغوية الكبيرة متعددة الوسائط عبر إجراءات جراحية متنوعة، وذلك من خلال تحديد خمسة أبعاد استدلال جوهرية وبروتوكول تعليق هيكلي.

Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen2026-04-23
💻 computer science

Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation

تقترح هذه الورقة إطار عمل لمطابقة التدفق مدفوعاً بالاستقرار لتوليد حركات تعاونية طبيعية وفعالة بين البشر، وذلك من خلال دمج استراتيجيات قائمة على إمكانات الأشياء، ومسبق تفاعلي تنافسي للوضعيات الواقعية، ومحاكاة مدفوعة بالاستقرار لتحسين حالات التفاعل.

Jiahao Xu, Xiaohan Yuan, Xingchen Wu, Chongyang Xu, Kun Li, Buzhen Huang2026-04-23
💻 computer science

X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis

تقدم هذه الورقة البحثية X-PCR، وهو أول معيار شامل مصمم لتقييم قدرات الاستدلال السريري التدريجي عبر الوسائط المتعددة للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) في تشخيص أمراض العيون من خلال سير عمل مكون من ست مراحل ومهام التكامل متعدد الوسائط.

Gui Wang, Zehao Zhong, YongSong Zhou, Yudong Li, Ende Wu, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen2026-04-23
💻 computer science

LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel

تُعد LaplacianFormer نوعاً متطوراً من نماذج المحولات (Transformer) يستبدل انتباه "softmax" بنواة "Laplacian" ذات أسس نظرية رصينة، معززة بخريطة ميزات حقانية وتقريب "Nyström" فعال يعتمد على طريقة "Newton–Schulz"، وذلك لتحقيق توازن فائق بين الأداء والكفاءة لمهام الرؤية الحاسوبية عالية الدقة.

Zhe Feng, Sen Lian, Changwei Wang, Muyang Zhang, Tianlong Tan, Rongtao Xu, Weiliang Meng, Xiaopeng Zhang2026-04-23
💻 computer science

Self-supervised pretraining for an iterative image size agnostic vision transformer

تقدم هذه الورقة إطار عمل جديد للتعلم الذاتي الموجه يتيح التدريب المسبق واسع النطاق لنموذج "Vision Transformer" غير مقيد بحجم الصورة، وذلك عبر الجمع بين بنية تكرارية مستوحاة من الرؤية المركزية (foveal) وهدف التقطير الذاتي الخاص بـ DINO، محققةً أداءً تنافسياً مع الحفاظ على ميزانية حوسبة ثابتة عبر دقات عرض مختلفة.

Nedyalko Prisadnikov, Danda Pani Paudel, Yuqian Fu, Luc Van Gool2026-04-23
💻 computer science

MLG-Stereo: ViT Based Stereo Matching with Multi-Stage Local-Global Enhancement

تقترح الورقة البحثية MLG-Stereo، وهو إطار عمل لمطابقة الاستريو يعتمد على محولات الرؤية (ViT)، يتغلب على قيود الطرق الحالية في التعامل مع الدقات التعسفية والتفاصيل المحلية من خلال دمج شبكة ميزات متعددة التدرج، وحجم تكلفة محلي-عالمي، ووحدة تكرارية موجهة محلية-عالمية لتحقيق أداء رائد في المعايير القياسية.

Haoyu Zhang, Jingyi Zhou, Peng Ye, Jiakang Yuan, Lin Zhang, Feng Xu, Tao Chen2026-04-23
💻 computer science

SpaCeFormer: Fast Proposal-Free Open-Vocabulary 3D Instance Segmentation

تقدم الورقة البحثية نموذج SpaCeFormer، وهو نموذج محول (transformer) سريع وخالٍ من الاقتراحات لتجزئة الكائنات ثلاثية الأبعاد ذات المفردات المفتوحة، والذي يحقق أداءً في الوقت الفعلي ودقة فائقة من خلال الاستفادة من بنية منحنى الفضاء (space-curve) المبتكرة ومجموعة بيانات SpaCeFormer-3M التي صدرت حديثاً، وهي الأكبر من نوعها وتضم 3 ملايين وصف نصي متسق عبر الرؤى المتعددة.

Chris Choy, Junha Lee, Chunghyun Park, Minsu Cho, Jan Kautz2026-04-23