🤖 machine learning

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

تُعد Unsafe2Safe عبارة عن خط معالجة مؤتمت بالكامل يتكون من مرحلتين، يستفيد من نماذج الرؤية واللغة وتحرير الانتشار الموجه بالتعليمات للكشف عن المناطق الحساسة في الصور وإعادة كتابتها، مما يعمل بفعالية على إخفاء مخاطر الخصوصية مع الحفاظ على البنية العامة والمنفعة اللاحقة لتدريب مجموعات البيانات واسعة النطاق.

Mih Dinh, SouYoung Jin2026-03-31
💬 NLP

ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

يقدم ResAdapt إطار عمل تكيفي في جانب المدخلات يقوم بتخصيص ميزانيات دقة بصرية لكل إطار ديناميكيًا عبر مُخصص خفيف الوزن تم تدريبه باستخدام تحسين السياسة الواعية بالتكلفة، مما يمكّن النماذج اللغوية الكبيرة متعددة الوسائط من تحسين أداء الاستدلال بشكل كبير ودعم سياقات زمنية أطول ضمن ميزانيات حوسبة ثابتة.

Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Jun Zhao, Kun Xu, Kang Liu2026-03-31
🤖 machine learning

Why Aggregate Accuracy is Inadequate for Evaluating Fairness in Law Enforcement Facial Recognition Systems

تجادل هذه الورقة بأن الدقة الإجمالية هي مقياس غير كافٍ لتقييم أنظمة التعرف على الوجوه المستخدمة في إنفاذ القانون لأنها تحجب التفاوتات الديموغرافية الحرجة في معدلات الخطأ، مما يستلزم التحول نحو أطر تقييم تراعي العدالة على مستوى المجموعات الفرعية لمنع الضرر المجتمعي غير المتناسب.

Khalid Adnan Alsayed2026-03-31
🤖 AI

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

يُعد AdaptToken إطار عمل لا يتطلب تدريبًا، حيث يستفيد من عدم اليقين الذاتي للنماذج اللغوية الكبيرة متعددة الوسائط (MLLM) والانتباه عبر الوسائط لتخصيص ميزانيات الرموز ديناميكيًا عبر مجموعات الفيديو وتمكين التوقف المبكر، مما يحسن بشكل كبير دقة وكفاءة فهم الفيديوهات الطويلة عبر مختلف المعايير وأحجام النماذج.

Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys2026-03-31
🤖 machine learning

Stepwise Credit Assignment for GRPO on Flow-Matching Models

تقدم هذه الورقة البحثية "Stepwise-Flow-GRPO"، وهي طريقة للتعلم التعزيزي لنماذج مطابقة التدفق (flow-matching) تعمل على تحسين كفاءة العينات والتقارب من خلال تخصيص الائتمان لخطوات التوليد الفردية بناءً على تحسينات المكافأة بدلاً من مكافآت الصورة النهائية الموحدة، مع الاستفادة من صيغة "تويدي" (Tweedie's formula) ومعادلة تفاضلية عشوائية مستوحاة من "DDIM" لتعزيز تقدير المكافأة الوسيطة.

Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Sing (…)2026-03-31
💬 NLP

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

يقدم SOLE-R1 نموذج استدلال لغوي-بصري يعمل كإشارة مكافأة وحيدة للتعلم التعزيزي على الروبوتات من خلال توليد تقديرات تقدم كثيفة لكل خطوة زمنية عبر استدلال تسلسلي مكاني-زماني، مما يمكن الروبوتات من إتقان مهام التلاعب غير المرئية دون الحاجة إلى مكافآت حقيقية أو عروض توضيحية، مع التفوق على المقيمات اللغوية-البصرية الحالية في المتانة ومعدلات النجاح.

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza2026-03-31
🤖 AI

U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models

تقدم الورقة البحثية U-Sketch، وهو إطار عمل فعال لتحويل الرسم التخطيطي إلى صورة يستخدم متنبئ حواف كامن بنية U-Net وشبكة تبسيط للرسومات لإنتاج صور عالية الجودة ودقيقة مكانياً مع تقليل خطوات إزالة الضجيج ووقت التنفيذ بشكل كبير مقارنة بالطرق الحالية.

Ilias Mitsouras, Eleftherios Tsonis, Paraskevi Tzouveli, Athanasios Voulodimos2026-03-30
💻 computer science

QPT V2: Masked Image Modeling Advances Visual Scoring

تقدم هذه الورقة البحثية QPT V2، وهو إطار عمل جديد للتدريب المسبق بنمذجة الصور المقنعة يوحد بين تقييم الجودة والجماليات من خلال تنسيق بيانات محددة، وإدخال عوامل التدهور، وتعديل هيكل النموذج لتحقيق أداء رائد عبر 11 معياراً من الاختبارات اللاحقة.

Qizhi Xie, Kun Yuan, Yunpeng Qu, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu2026-03-30
🤖 machine learning

Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing

تقدم هذه الورقة البحثية "التنبؤ بخطوات متغيرة موجه بالمعرفة" (KG-VSF)، وهو نهج تدريب مسبق مبتكر للنماذج التأسيسية متعددة الوسائط يستفيد من العلاقات السببية بين متغيرات المحرك والمتغير المستجيب لتوليد تمثيلات (embeddings) فائقة للنماذج لمهام الاستشعار عن بعد مثل رسم خرائط المحاصيل، وتقدير رطوبة التربة، والتنبؤ بالصور مقارنة بالطرق التقليدية للتعلم الذاتي الخاضعة للإشراف.

Praveen Ravirathinam, Ajitesh Parthasarathy, Ankush Khandelwal, Rahul Ghosh, Vipin Kumar2026-03-30
💻 computer science

Beyond Deepfake vs Real: Facial Deepfake Detection in the Open-Set Paradigm

تقترح هذه الورقة إطار عمل للكشف عن التزييف العميق يعتمد على التعلم التبايني الخاضع للإشراف، والذي يتجاوز قيود نماذج المجموعة المغلقة من خلال تحديد كل من عمليات التزييف المعروفة بفعالية، وتمييز أساليب التلاعب غير المرئية وغير المعروفة ككيانات متميزة عن الصور الحقيقية، محققاً بذلك أداءً رائداً في التعامل مع تقنيات التزييف الناشئة.

Nadarasar Bahavan, Sachith Seneviratne, Sanjay Saha, Ken Chen, Sanka Rasnayaka, Saman Halgamuge2026-03-30