💻 computer science

Image Score: Learning and Evaluating Human Preferences for Mercari Search

تقدم هذه الورقة نهجاً فعالاً من حيث التكلفة، يعتمد على النماذج اللغوية الكبيرة (LLM) باستخدام تقنية "سلسلة الأفكار" (Chain-of-Thought) لتوليد تسميات لجودة الصور ترتبط بالسلوك البشري على منصة ميركاري (Mercari) للتجارة الإلكترونية، مما يؤدي في النهاية إلى نمو كبير في المبيعات من خلال تحسين ملاءمة البحث وقابلية التفسير.

Chingis Oinar, Miao Cao, Shanshan Fu2026-05-04
🤖 machine learning

Learning Locally, Revising Globally: Global Reviser for Federated Learning with Noisy Labels

تقترح هذه الورقة البحثية "المراجع العالمي الاتحادي" (FedGR)، وهي طريقة مبتكرة تستفيد من الذاكرة البطيئة المتأصلة في النموذج العالمي تجاه الملصقات الصاخبة لتصحيح ضجيج الملصقات وتنظيم التدريب المحلي بشكل تعاوني، مما يحقق متانة فائقة ضد ضجيج الملصقات غير المتجانس في التعلم الاتحادي مقارنة بالنماذج المرجعية الرائدة.

Yuxin Tian, Mouxing Yang, Yuhao Zhou, Jian Wang, Qing Ye, Tongliang Liu, Gang Niu, Jiancheng Lv2026-05-04
💻 computer science

Diffusion Models are Secretly Zero-Shot 3DGS Harmonizers

تقدم هذه الورقة البحثية D3DR، وهي طريقة تعتمد على التعلم الصفري (zero-shot) تستفيد من معرفة الإضاءة الضمنية لنماذج الانتشار مسبقة التدريب وتقنية تخصيص مبتكرة لإدراج وإعادة إضاءة كائنات "Gaussian Splatting" ثلاثية الأبعاد في المشاهد بسلاسة، مما يحسن بشكل كبير من الاتساق البصري وجودة إعادة الإضاءة.

Vsevolod Skorokhodov, Nikita Durasov, Pascal Fua2026-05-04
💻 computer science

Color Conditional Generation with Sliced Wasserstein Guidance

تقدم الورقة البحثية SW-Guidance، وهي طريقة خالية من التدريب تعمل على تعزيز توليد الصور المشروط باللون عبر تعديل عملية أخذ عينات الانتشار باستخدام مسافة "سلايسد وارس st{{st}}" (Sliced Wasserstein distance) لضمان مطابقة الصور المولدة للوحة ألوان مرجعية وفي الوقت ذاته الحفاظ على التماسك الدلالي مع النص الموجه.

Alexander Lobashev, Maria Larchenko, Dmitry Guskov2026-05-04
🤖 machine learning

DiffMI: Breaking Face Recognition Privacy via Diffusion-Driven Training-Free Model Inversion

تقدم هذه الورقة البحثية DiffMI، وهو هجوم قلب نموذج (model inversion attack) جديد لا يتطلب تدريباً، يستفيد من نماذج الانتشار (diffusion models) لإعادة بناء الهويات الوجهية غير المرئية من التضمينات (embeddings) بكفاءة وأمانة، متفوقاً بشكل كبير على الأساليب الحالية القائمة على شبكات الخصومة التوليدية (GANs) في كل من معدل النجاح والقدرة على التكيف.

Hanrui Wang, Shuo Wang, Chun-Shien Lu, Isao Echizen2026-05-04
💻 computer science

Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

يُعد Sparse VideoGen2 (SVG2) إطار عمل خالٍ من التدريب يعمل على تسريع توليد الفيديو من خلال إدخال التبديل المدرك دلالياً لتجميع وإعادة ترتيب الرموز بناءً على التشابه الدلالي، مما يؤدي إلى تحسين تحديد الرموز الحرجة وتمكين الحوسبة الفعالة لوحدات معالجة الرسومات لتحقيق تسريع كبير مع الحفاظ على جودة توليد عالية.

Shuo Yang, Haocheng Xi, Yilong Zhao, Muyang Li, Jintao Zhang, Han Cai, Yujun Lin, Xiuyu Li, Chenfeng Xu, Jianfei Chen, S (…)2026-05-04
💻 computer science

Thought Graph Traversal for Test-time Scaling in Chest X-ray VLLMs

تقدم هذه الورقة البحثية "تتبع مخطط التفكير" (TGT)، وهو إطار عمل لتوسيع نطاق وقت الاختبار يعزز توليد تقارير الأشعة السينية للصدر في النماذج اللغوية البصرية المجمدة من خلال دمج الأولويات الطبية المهيكلة وميزانية استدلال ديناميكية لتوجيه الاستدلال المتماسك الخاص بالأعضاء دون الحاجة إلى تدريب إضافي.

Yue Yao, Zelin Wen, Yan Tong, Xinyu Tian, Xuqing Li, Xiao Ma, Dongliang Xu, Tom Gedeon2026-05-04
💻 computer science

Revisiting CroPA: A Reproducibility Study and Enhancements for Cross-Prompt Adversarial Transferability in Vision-Language Models

تتحقق هذه الورقة من فعالية هجوم "التحفيز المتقاطع" (CroPA) على نماذج الرؤية واللغة الكبيرة من خلال دراسة قابلية التكرار، وتقترح ثلاثة تحسينات رئيسية — استراتيجية تهيئة مبتكرة، واضطرابات عالمية لقابلية النقل عبر الصور، ودالة فقدان مستهدفة للانتباه — والتي تعمل مجتمعة على تحسين معدلات نجاح الهجوم العدائي وقابلية النقل عبر بنيات نماذج الرؤية واللغة المتنوعة.

Atharv Mittal, Agam Pandey, Amritanshu Tiwari, Sukrit Jindal, Swadesh Swain2026-05-04
🤖 AI

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

تقوم هذه الورقة البحثية بتقييم نماذج التأسيس متعددة الوسائط الرائدة مثل GPT-4o في مهام الرؤية الحاسوبية القياسية باستخدام إطار عمل مبتكر لتسلسل الأوامر (prompt-chaining) لتكشف أنها، بينما تعمل كنماذج عامة محترمة ذات فهم دلالي قوي، إلا أنها لا تزال تتخلف عن النماذج المتخصصة في المهام الهندسية وتظهر أنماط فشل محددة.

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir2026-05-04
💻 computer science

Image-Guided Shape-from-Template Using Mesh Inextensibility Constraints

تقترح هذه الورقة طريقة "الشكل من القالب" (Shape-from-Template) غير خاضعة للإشراف، والتي تستفيد من الملاحظات الصورية وقيود عدم قابلية الشبكة للتمدد لتحقيق سرعات إعادة بناء أسرع بـ 400 مرة وأداء فائق في التعامل مع حالات الحجب الشديدة والتفاصيل الدقيقة مقارنة بالنهج الحالية المتطورة.

Thuy Tran, Ruochen Chen, Shaifali Parashar2026-05-04