🤖 machine learning

VIDS-Seg: Towards Reliable Uncertainty Quantification in Pediatric Cardiac Ultrasound Segmentation

تقدم هذه الورقة VIDS-Seg، وهو إطار عمل يستفيد من الاستدلال التبايني الموزع لتوفير تقدير موثوق لعدم اليقين في تقسيم صور الموجات فوق الصوتية للقلب لدى الأطفال، مما يمكّن من اكتشاف حالات الفشل الصامت في سيناريوهات التعلم الصفري حيث تُطبق النماذج المدربة على بيانات البالغين على الأطفال دون الحاجة إلى إعادة التدريب.

Paul Fischer, Ece Ozkan2026-08-12
💻 computer science

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

تقدم هذه الورقة هجوماً بباب خلفي قابل للبرمجة على نماذج الرؤية واللغة (VLMs)، والذي يُمكّن المهاجمين، من خلال مرحلة تسميم واحدة وإخفاء معلومات في فضاء السمات (feature-space steganography)، من توليد محفزات خفية ديناميكياً لأي نصوص وصفية مستهدفة عشوائية وغير مرئية مسبقاً وقت الاستدلال، مما يفصل فعلياً عملية اختيار الهدف عن عملية التدريب الأولية.

Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu2026-08-12
💻 computer science

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

تقدم هذه الورقة البحثية OSSQ-OMR، وهي أول مجموعة بيانات ومعيار للتعرف البصري على الموسيقى (OMR) لمدونات الرباعي الوتري متعدد الأجزاء، والتي تضم أكثر من 122,000 صورة ونسخ نصي متوافق بتنسيقات متعددة، إلى جانب تقييمات أساسية تسلط الضوء على تأثير الترميز، والتقسيم، وبنية النموذج على دقة التعرف.

Dongmin Kim, Brian Liu, Jose J. Valero-Mas, Dasaem Jeong2026-08-12
💻 computer science

Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers

تقترح هذه الورقة البحثية طريقة "التقليم المتكيف مع المهام" (TAP)، وهي طريقة تستخدم سجلات خاصة بكل مهمة لترتيب الرموز ديناميكياً وتخصيص ميزانيات التقليم عبر مهام مختلفة لنموذج "Vision Transformer"، مما يحقق تحسينات كبيرة في معدل الإنتاجية مع الحفاظ على أداء تنافسي في تصنيف الصور، والتجزئة الدلالية، وكشف الأشياء.

Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed2026-08-12
💻 computer science

HUI360: A 360{\deg} Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation

تقدم هذه الورقة البحثية HUI360، أكبر مجموعة بيانات في الطبيعة (in-the-wild) بزاوية 360 درجة للتفاعل بين الإنسان والروبوت من منظور الشخص الأول (egocentric)، والتي تتميز بأكثر من مليون تعليق توضيحي تمت معالجتها مسبقاً، ومسار عمل للوسم التلقائي للتفاعلات، ومعايير مرجعية أساسية لتعزيز تعميم السلوكيات الروبوتية الاستباقية.

Raphael Lorenzo-Louis, Fabio Amadio, Bertrand Luvison, Serena Ivaldi2026-08-12
💻 computer science

Static in Frames, Dynamic in Events: Rethinking Features in Event Cameras as Motion Cues

تعيد هذه الورقة تفسير سمات كشف الزوايا القائمة على الأحداث كإشارات حركة، مبرهنةً من خلال التحليل النظري والتجارب أن دمجها مع المعلومات الهندسية المحلية يعزز تقدير التدفق البصري، لا سيما بالنسبة للنماذج ذات السعة المنخفضة وسيناريوهات ندرة البيانات.

Hesam Araghi, Jan van Gemert, Nergis Tomen2026-08-12
💻 computer science

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

تقدم الورقة البحثية استراتيجية FEEDS، وهي استراتيجية تدريب فعالة من حيث التسمية والحوسبة تستفيد من تضمينات النماذج التأسيسية لاختيار حالات PET/CT غير المصنفة الأكثر إفادة للتعليق التوضيحي، محققةً أداءً بمستوى البيانات كاملة التسمية عبر أنواع مختلفة من السرطانات والمواد المشعة باستخدام جهد أقل في التعليق التوضيحي بنسبة 70%.

Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James (…)2026-08-12
💻 computer science

Every Packet Counts: Dispersing Information for Loss-Resilient Learned Image Compression

تقترح هذه الورقة إطار عمل لضغط الصور المتعلم والمقاوم للفقد بشكل شامل (end-to-end)، والذي يجمع بين إعادة التوزيع بين القنوات، والتجميع المتداخل للقنوات، وبنية ذات مسارين ذاتية الانحدار ثنائية الطبقة لتشتيت المعلومات وتقصير سلاسل الاعتماد، مما يحسن بشكل كبير جودة وإستقرار إعادة البناء في ظل ظروف فقدان الحزم العشوائية والمتفجرة على حد سواء.

Yuhang Wei (Shanghai Jiao Tong University), Chuqin Zhou (Shanghai Jiao Tong University), Yibo Shi (Huawei Technologies L (…)2026-08-12
🤖 machine learning

AlbumentationsX: One Augmentation Pipeline for Images and Related Annotations

تُعد AlbumentationsX مكتبة تعزيز موحدة تضمن اتساق البيانات عبر الصور والتعليقات التوضيحية المتنوعة (مثل الأقنعة، والصناديق، والنقاط الرئيسية) من خلال تطبيق مجموعة واحدة من التحويلات العشوائية من بذرة مشتركة، مما يمنع مشكلات عدم المحاذاة الشائعة في مسارات المعالجة المنفصلة.

Vladimir Iglovikov2026-08-12
💬 NLP

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

تقدم الورقة البحثية نموذج التبديل اللغوي متعدد الوسائط (MMCS)، وهو نموذج تدريب مسبق مبتكر يدمج الكائنات المرئية ضمن النصوص لتوفير إشراف صريح على مستوى الكائن، مما يحسن بشكل كبير من كفاءة البيانات وقدرات الربط البصري مقارنة بطرق محاذاة الصور والنصوص التقليدية.

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai2026-08-12