💻 computer science

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

يُعد SepPrune إطار عمل خالٍ من التدريب، وقابل للتشغيل المباشر، يقلل بكفاءة التكاليف الحسابية في النماذج اللغوية الكبيرة متعددة الوسائط عبر استخدام رموز فاصل الوسائط كاستعلامات موحدة لتقليم 80.2% من الرموز البصرية مع الاحتفاظ بـ 96.3% من الدقة الأصلية.

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu2026-07-29
💻 computer science

Beyond Static Costs: Learning-Dynamics Aware Loss Functions for Long-Tailed Classification

تقدم هذه الورقة دالة خسارة واعية بديناميكيات التعلم (LDAL)، وهي دالة هدف مبتكرة تضبط أوزان الفئات ديناميكيًا بناءً على قوة تمثيل الميزات في الوقت الفعلي، وإنتروبيا التنبؤ، والاستقرار بين الحقب، للتفوق على طرق إعادة الوزن الثابتة في مهام التصنيف طويل الذيل.

Varad Shinde, Nikhil Kumar Shrey, Magesh Rajasekaran, Md Saiful Islam Sajol, Harshil Bhargava, Subhajit Sidanta, Suprati (…)2026-07-29
💬 NLP

Shieldstral

يُعد Shieldstral نموذجاً مصنفاً للسلامة متعدد الوسائط، متكيف السياسات، ومدمجاً بحجم 3 مليارات معلمة، يعمل على توحيد مهام الإشراف على المحتوى المتنوعة ضمن إطار عمل قائم على الإجابة عن أسئلة ثنائية، مما يمكّنه من مضاهاة أو تجاوز النماذج الأكبر حجماً بكثير من خلال مجموعة بيانات ضخمة ومنقحة تضم 54.1 مليون عينة.

Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian M (…)2026-07-29
🤖 AI

Face De-Identification: A Domain-Centric Survey from Capture to Processing

تقدم هذه الورقة أول مسح شامل وموحد يرتكز على النطاق لعملية إخفاء هوية الوجه، حيث يحلل بشكل منهجي المنهجيات والتحديات عبر كامل مسار الحصول على البيانات —من النطاقات الفيزيائية والاستشعارية إلى المعالجة الرقمية اللاحقة— مع مراجعة بروتوكولات التقييم وتحديد اتجاهات البحث المستقبلية.

Hui Wei, Hao Yu, Guoying Zhao2026-07-29
🤖 machine learning

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

تقدم هذه الورقة "مودوس" (Modus)، وهو نموذج متعدد الوسائط من نوع "المفكك فقط" (decoder-only) يعمل من أي وسيط إلى أي وسيط، حيث يعامل جميع الوسائط بشكل متماثل دون مكونات خاصة بمهام معينة، مما يتيح توليداً مرناً عبر الوسائط ويحقق أداءً تنافسياً عبر مختلف المعايير المرجعية.

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan (…)2026-07-29
🤖 AI

Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

تقدم الورقة البحثية PRISM-AH، وهو إطار عمل متعدد الوسائط موجه معرفياً يتعرف على التردد والارتباك على مستوى الفيديو من خلال نمذجة التنافر عبر الوسائط بمرور الوقت ودمج الأدلة المهيكلة من نموذج لغوي كبير، محققاً مقياس F1 كلي قدره 0.6133 على مجموعة اختبار عامة.

Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy2026-07-29
💻 computer science

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

يُعد LaP-Forensics إطار عمل متعدد الوسائط للكشف عن التزييف العميق، يعمل على تعزيز المتانة ضد النماذج التوليدية المتقدمة من خلال دمج بقايا إعادة البناء القائمة على نموذج Stable Diffusion مع الدلالات اللونية (RGB) عبر نموذج استدلال مهيكل، والذي يتم تحسينه لاحقاً عبر تحسين السياسة النسبية للمجموعات (GRPO) لتحقيق كشف تنافسي عبر مختلف المولدات وتحديد مواقع الشوائب.

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen2026-07-29
💻 computer science

On the Use of Synthetic Data for Threshold Calibration in Face Recognition: Performance and Security Implications for Border Control Systems

تتقصى هذه الورقة استخدام بيانات الوجوه الاصطناعية لمعايرة عتبات التحقق في أنظمة مراقبة الحدود الأوروبية، وتجد أنه بينما تُعد البيانات الاصطناعية مفيدة للتطوير الأولي، إلا أنها تفشل في التعميم بشكل موثوق على سيناريوهات معدل المطابقة الخاطئة المنخفضة في العالم الحقيقي بسبب عدم تطابق التوزيعات الذي يؤدي إلى تدهور الأداء وزيادة الثغرات الأمنية.

Arto Apila2026-07-29
💻 computer science

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

تقدم هذه الورقة البحثية GeoMTVR، وهي مجموعة بيانات واسعة النطاق للاستدلال البصري متعدد الأدوات الجيومكانية، وGeoLens، وهو نموذج لغوي كبير متعدد الوسائط تم تدريبه باستخدام خوارزمية تعزيز تعلم متخصصة للتعامل بفعالية مع مهام الاستشعار عن بعد فائقة الدقة من خلال الاختيار الديناميكي والدمج لمختلف الأدوات البصرية بما يتجاوز مجرد التكبير البسيط.

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Ha (…)2026-07-29
🤖 machine learning

Parallel Decoding Distillation for Fast Image and Video Generation

تقدم هذه الورقة البحثية تقنية "التقطير لفك التشفير المتوازي" (Parallel Decoding Distillation - PDD)، وهي طريقة تعتمد على المسار، تتسم بالقابلية للتوسع والتبسيط، وتعمل على تسريع توليد الصور والفيديو من خلال التنبؤ بخطوات إزالة الضجيج المتعددة في كل عملية تقييم للشبكة، محققةً أداءً هو الأفضل في فئتها بـ 4 إلى 8 عمليات تقييم فقط، مع تحسين تنوع الفيديو بشكل ملحوظ مقارنة بتقنيات التقطير الحالية.

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner2026-07-29