🤖 AI

Demographic-aware fine-grained visual recognition of pediatric wrist pathologies

تقترح هذه الورقة نموذجاً هجيناً من التلافيف والمحولات (convolution-transformer) مدركاً للخصائص الديموغرافية مع قناع بيانات وصفية تدريجي لتحسين التعرف الدقيق على أمراض معصم الأطفال من خلال التمييز الفعال بين التباينات النمائية الطبيعية والتشوهات الحقيقية باستخدام عمر المريض وجنسه.

Ammar Ahmed, Ali Shariq Imran, Zenun Kastrati, Sher Muhammad Daudpota2026-07-30
🤖 AI

Fake & Square: Training Self-Supervised Vision Transformers with Synthetic Data and Synthetic Hard Negatives

تقدم هذه الورقة إطار عمل Syn2Co، الذي يعزز التعلم الخاضع للإشراف الذاتي لنماذج محولات الرؤية (vision transformers) من خلال الاستفফার من البيانات الاصطناعية لتنوع العينات ومن السلبيات الصعبة الاصطناعية للتباينات الصعبة، وبالتالي استكشاف إمكانات وحدود "التظاهر بالامتلاك" لتقليل الاعتماد على مجموعات البيانات الضخمة من العالم الحقيقي.

Nikos Giakoumoglou, Andreas Floros, Kleanthis Marios Papadopoulos, Tania Stathaki2026-07-30
💬 NLP

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

تقدم هذه الورقة البحثية VideoNorms، وهي مجموعة بيانات تضم أكثر من 3,0٠٠ تعليق توضيحي للمعايير الثقافية مستمدة من برامج تلفزيونية أمريكية وصينية تم إنشاؤها من خلال التعاون بين البشر والذكاء الاصطناعي، والتي تكشف أن نماذج الفيديو اللغوية الكبيرة (VideoLLMs) الحالية تعاني بشكل أكبر مع السياقات الثقافية الصينية والأدلة غير اللفظية، مما يسلط الضوء على الحاجة إلى تدريب وتقييم قائمين على أسس ثقافية.

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan2026-07-30
🤖 machine learning

Breaking the Stealth-Potency Trade-off in Clean-Image Backdoors with Generative Trigger Optimization

تقدم هذه الورقة البحثية "الأبواب الخلفية للصور النظيفة التوليدية" (GCB)، وهو إطار عمل يستفيد من نموذج (InfoGAN) الشرطي لتحديد سمات الصور الطبيعية كـمحفزات، مما يتيح هجمات أبواب خلفية شديدة التخفي عبر مجموعات بيانات ومهام متنوعة مع حد أدنى من التدهور في دقة الصور النظيفة.

Binyan Xu, Fan Yang, Di Tang, Xilin Dai, Kehuan Zhang2026-07-30
💻 computer science

LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency

يُعد LISA-3D إطار عمل ثنائي المراحل وفعال من حيث المعلمات، يعمل على رفع مستوى التجزئة ثنائية الأبعاد الموجهة لغوياً إلى إعادة بناء ثلاثية الأبعاد مستقرة عبر تكييف نموذج LISA بطبقات تكيف منخفضة الرتبة (LoRA) مدركة للهندسة، وفرض اتساق متعدد الرؤى من خلال فقدان إعادة إسقاط قابل للتفاضل.

Zhongbin Guo, Jiahe Liu, Wenyu Gao, Yushan Li, Xiaomin He, Chengzhi Li, Ping Jian2026-07-30
💻 computer science

LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs

يُعد LiDarlDraft إطار عمل مبتكرًا يولد سحب نقاط ليدار (LiDAR) واقعية ومتنوعة من مدخلات متعددة الاستخدامات مثل النصوص والصور والرسومات التخطيطية عبر توحيدها في تخطيطات ثلاثية الأبعاد لتوجيه نموذج ControlNet القائم على خريطة النطاق (rangemap)، مما يتيح "المحاكاة من الصفر" القابلة للتحكم لبيئات القيادة الذاتية.

Haiyun Wei, Fan Lu, Yunwei Zhu, Zehan Zheng, Weiyi Xue, Lin Shao, Xudong Zhang, Ya Wu, Guang Chen2026-07-30
💻 computer science

VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning

تقدم هذه الورقة VidNum، وهو معيار مرجعي تم تنسيقه يدويًا ويتكون من 1,167 سؤالاً صُممت لتشخيص أوضاع فشل محددة في الاستدلال العددي القائم على الفيديو في نماذج الرؤية واللغة، مما يكشف عن فجوات أداء كبيرة مقارنة بالبشر ويحدد بناء الهدف المهيكل والاستدلال التركيبي القائم على الأفعال كعقبات رئيسية لا يتم حلها بشكل موثوق عبر التلقين بسلسلة الأفكار (chain-of-thought) دون تدريب مسبق.

Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He2026-07-30
🤖 AI

G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement

تقترح الورقة البحثية إطار عمل G2VD، وهو إطار عمل عام للكشف عن الفيديوهات المولدة بواسطة الذكاء الاصطناعي يستفيد من التدخل المضاد للواقع وفك التشابك السببي للتخفيف من تعلم الاختصارات وتحقيق أداء فائق عبر المجالات من خلال فصل الإشارات الجنائية الجوهرية عن الانحيازات الخاصة بكل مجال.

Meng Du, Hongchang Chen, Ran Li, Junjie Zhang, Qi Ouyang, Shibo Zhang, Shuxin Liu2026-07-30
⚡ electrical engineering

ScalablePromptus: Scalable and High-Fidelity Prompt-Based Video Streaming

يُعد ScalablePromptus إطار عمل قوي لبث الفيديو يتغلب على ضعف الطرق الحالية القائمة على المطالبات تجاه تقلبات الشبكة من خلال توظيف استراتيجية تدريب الإسقاط وتقنيات استكمال متقدمة، مما يتيح إعادة بناء فيديو عالي الدقة من مطالبات مبتورة تعسفياً ويقلل من تدهور الأداء بنسبة 82%–95% في الظروف التي تشوبها الخسارة.

Zehao Cao, Bowei Xu, Xun Cao, Zhan Ma, Hao Chen2026-07-30