🤖 machine learning

GEPC: Group-Equivariant Posterior Consistency for Out-of-Distribution Detection in Diffusion Models

تقدم هذه الورقة GEPC، وهي طريقة خالية من التدريب للكشف عن البيانات خارج التوزيع في نماذج الانتشار، والتي تستفيد من اتساق اللاحقة المتماثل مع المجموعات لتحديد الشذوذ عبر قياس عدم اتساق تحول مجال الدرجة تحت مجموعات التماثل، محققةً أداءً تنافسياً ونتائج قابلة للتفسير عبر مجموعات بيانات الصور ورادار الفتحة الاصطناعية (SAR).

Yadang Alexis Rouzoumka, Jean Pinsolle, Eugénie Terreaux, Christèle Morisseau, Jean-Philippe Ovarlez, Chengfang Ren2026-02-19
💻 computer science

Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment

تقترح هذه الورقة إطار عمل MSBA-CLIP، الذي يجمع بين تعزيز المزج الناعم متعدد المتغيرات وتقدير شدة التزييف الموجه بواسطة CLIP لتحقيق أفضل مستويات التعميم والدقة في كشف التزييف العميق عبر تقنيات التزييف ومجموعات البيانات المتنوعة.

Jingwei Li, Jiaxin Tong, Pengfei Wu2026-02-19
⚡ electrical engineering

ROIX-Comp: Optimizing X-ray Computed Tomography Imaging Strategy for Data Reduction and Reconstruction

تقدم هذه الورقة البحثية ROIX-Comp، وهو إطار عمل قائم على منطقة الاهتمام يعمل على تحسين تصوير التصوير المقطعي المحوسب بالأشعة السينية من خلال الجمع بين التكميم المقيد بالخطأ وتقنيات الضغط المتقدمة لتقليل حجم البيانات بشكل كبير مع الحفاظ على المعلومات الحيوية، محققاً تحسناً بنسبة 12.34 ضعفاً في نسب الضغط مقارنة بالطرق القياسية.

Amarjit Singh, Kento Sato, Kohei Yoshida, Kentaro Uesugi, Yasumasa Joti, Takaki Hatsui, Andrès Rubio Proaño2026-02-19
🤖 AI

EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery

تقدم هذه الورقة EarthSpatialBench، وهو معيار شامل يتكون من أكثر من 325 ألف زوج من الأسئلة والأجوبة المصممة لتقييم وكشف أوجه القصور في النماذج اللغوية الكبيرة متعددة الوسائط في أداء الاستدلال المكاني الكمي المعقد على صور الأرض، بما في ذلك المسافة، والاتجاه، والطوبولوجيا، والتمثيلات الهندسية المتنوعة للأجسام.

Zelin Xu, Yupu Zhang, Saugat Adhikari, Saiful Islam, Tingsong Xiao, Zibo Liu, Shigang Chen, Da Yan, Zhe Jiang2026-02-19
🤖 machine learning

World Action Models are Zero-shot Policies

تقدم الورقة البحثية DreamZero، وهو نموذج عالمي للأفعال (World Action Model) يستفيد من نموذج انتشار فيديو (video diffusion backbone) مُدرب مسبقاً للتنبؤ بالحالات والأفعال المستقبلية، مما يتيح التحكم في حلقة مغلقة في الوقت الفعلي، وتعميماً فائقاً على المهام والبيئات غير المرئية مقارنة بنماذج الرؤية واللغة والأفعال (Vision-Language-Action models)، ونقلاً فعالاً عبر الأجساء المختلفة بأقل قدر من البيانات.

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning (…)2026-02-19
🤖 machine learning

Visual Memory Injection Attacks for Multi-Turn Conversations

تقدم هذه الورقة البحثية "حقن الذاكرة البصرية" (Visual Memory Injection - VMI)، وهو هجوم خفي جديد يتلاعب بنماذج الرؤية واللغة الكبيرة لجعلها تخرج رسائل مستهدفة محددة خلال محادثات متعددة الأدوار بعد تفاعل المستخدم مع صورة مشوهة، مما يثبت جدوى التلاعب بالمستخدمين على نطاق واسع من خلال مدخلات بصرية ذات سياق طويل.

Christian Schlarmann, Matthias Hein2026-02-19
💻 computer science

Automated Re-Identification of Holstein-Friesian Cattle in Dense Crowds

تقترح هذه الورقة مساراً مبتكراً للكشف والتقسيم والتعريف يستفيد من نماذج التحديد المحلي خالي الوزن مفتوح المفردات ونماذج "أي شيء يمكن تقسيمه" (Segment Anything) لتحقيق دقة تضاهف أحدث المعاياي في كشف وإعادة تعريف أبقار هولشتاين فريزيان في الحشود الكثيفة، مدعوماً بمجموعة بيانات كاميرات المراقبة الجديدة التي تم إصدارها والممتدة لتسعة أيام من مزرعة ألبان عاملة.

Phoenix Yu, Tilo Burghardt, Andrew W Dowsey, Neill W Campbell2026-02-19
⚡ electrical engineering

Automated Assessment of Kidney Ureteroscopy Exploration for Training

تقدم هذه الورقة إطار عمل مبتكرًا ومؤتمتًا يعتمد على فيديو منظار الحالب، يقوم بإنشاء عمليات إعادة بناء مرجعية لتحديد مواقع وضعيات الكاميرا وتحديد الكؤوس الكلوية المفقودة أثناء استكشاف نماذج الكلى الوهمية، مما يتيح تدريبًا فعالًا خارج غرفة العمليات مع تقديم تغذية راجعة موضوعية دون الحاجة إلى إشراف الخبراء.

Fangjie Li, Nicholas Kavoussi, Charan Mohan, Matthieu Chabanas, Jie Ying Wu2026-02-19
🤖 AI

MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval

يقدم MedProbCLIP إطار عمل احتمالي للرؤية واللغة ينمذج تضمينات صور الأشعة السينية للصدر والتقارير الإشعاعية كتوزيعات غاوسية لتجسيد عدم اليقين والارتباطات المتعددة إلى متعددة بشكل صريح، مما يحقق دقة استرجاع ومعايرة ومتانة فائقة مقارنة بالنماذج الحتمية الأساسية على مجموعة بيانات MIMIC-CXR.

Ahmad Elallaf, Yu Zhang, Yuktha Priya Masupalli, Jeong Yang, Young Lee, Zechun Cao, Gongbo Liang2026-02-19
🤖 machine learning

CHAI: CacHe Attention Inference for text2video

يعمل CHAI على تسريع استنتاج انتشار تحويل النص إلى فيديو من خلال تقديم "انتباه التخزين المؤقت" (Cache Attention)، وهي آلية تعيد استخدام الكوامن المخزنة مؤقتاً عبر المطالبات ذات الصلة دلالياً لتحقيق تسريع يتراوح بين 1.65x و3.35x مقارنة بـ OpenSora 1.2 مع الحفاظ على جودة فيديو عالية باستخدام 8 خطوات إزالة ضجيج فقط.

Joel Mathew Cherian, Ashutosh Muralidhara Bharadwaj, Vima Gupta, Anand Padmanabha Iyer2026-02-19