🤖 AI

Reproducing DragDiffusion: Interactive Point-Based Editing with Diffusion Models

تقدم هذه الورقة دراسة لإعادة إنتاج نتائج DragDiffusion باستخدام معيار DragBench، مما يؤكد الادعاءات الجوهرية للمنهجية فيما يتعلق بالتحرير التفاعلي القائم على النقاط، مع تحديد الحساسية الحرجة لمعلمات فائقة محددة مثل الخطوة الزمنية المثلى ومستوى الميزة، وإثبات أن التحسين متعدد الخطوات الزمنية لا يقدم أي مكاسب في الدقة رغم التكاليف الحسابية الأعلى.

Ali Subhan, Ashir Raza2026-02-16
🤖 AI

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

تقترح هذه الورقة إطار تحليل بأسلوب "فرانكشتاين" لتوضيح أن التعلم المعزز يحسن الاستدلال البصري في نماذج الرؤية واللغة ليس من خلال تعزيز الإدراك بشكل موحد، بل عبر صقل طبقات المحولات المتوسطة والمتأخرة بشكل منهجي لمواءمة الرؤية مع الاستدلال بشكل أفضل.

Xirui Li, Ming Li, Tianyi Zhou2026-02-16
💻 computer science

Semantic-aware Adversarial Fine-tuning for CLIP

تقترح هذه الورقة البحثية طريقة الضبط الدقيق العدائي المدرك دلالياً (SAFT)، وهي طريقة تعزز متانة نموذج CLIP ضد الهجمات العدائية في وضع الصفر (zero-shot) من خلال توليد أمثلة عدائية مدركة دلالياً عبر مجموعة من الأوصاف النصية المنقحة بدلاً من الاعتماد على قوالب مفردة مصاغة يدوياً.

Jiacheng Zhang, Jinhao Li, Hanxun Huang, Sarah M. Erfani, Benjamin I. P. Rubinstein, Feng Liu2026-02-16
🤖 AI

A Lightweight and Explainable DenseNet-121 Framework for Grape Leaf Disease Classification

تقترح هذه الورقة إطار عمل DenseNet-121 خفيف الوزن، وقابل للتفسير، ومُحسَّن يحقق دقة فائقة (99.27%) وقابلية للتفسير عبر تقنية Grad-CAM للكشف المبكر عن أمراض أوراق العنب، متفوقاً بذلك على نماذج الشبكات العصبية التلافيفية (CNN) الأساسية مع تمكين النشر الفعال في الوقت الفعلي.

Md. Ehsanul Haque, Md. Saymon Hosen Polash, Rakib Hasan Ovi, Aminul Kader Bulbul, Md Kamrul Siam, Tamim Hasan Saykat2026-02-16
🤖 AI

Human-Like Coarse Object Representations in Vision Models

تُظهر هذه الورقة أن التمثيلات الكلية للأجسام الشبيهة بالتمثيلات البشرية، والتي تعطي الأولوية للتنبؤات الفيزيائية الفعالة على حساب الدقة المتناهية في مستوى البكسل، تظهر بشكل طبيعي في نماذج الرؤية عند مستوى متوسط من السعة والتدريب، مما يشير إلى أن "حبيبية الجسم المثالية" هذه تنشأ من قيود الموارد بدلاً من انحيازات معمارية محددة.

Andrey Gizdov, Andrea Procopio, Yichen Li, Daniel Harari, Tomer Ullman2026-02-16
💻 computer science

Geometric Stratification for Singular Configurations of the P3P Problem via Local Dual Space

تقترح هذه الورقة إطاراً جبرياً-حسابياً منهجياً باستخدام الفضاء المزدوج المحلي لتوفير تصنيف هندسي كامل للتكوينات المنفردة في مسألة P3P، مما يميز مواقع كل من مركز الكاميرا وتكوينها المتمم بناءً على تعدد الحلول وعلاقتهما بالأسطوانة الخطرة والأسطح الدلتويدية.

Xueying Sun, Zijia Li, Nan Li2026-02-16
💻 computer science

PLLM: Pseudo-Labeling Large Language Models for CAD Program Synthesis

تقدم الورقة البحثية PLLM، وهو إطار عمل للتدريب الذاتي يستفيد من التوسيم الزائف لضبط النماذج اللغوية الكبيرة لتركيب برامج التصميم بمساعدة الحاسوب (CAD) من هندسات ثلاثية الأبعاد غير مصنفة، مما يتغلب على ندرة البيانات المزدوجة بين الشكل والبرنامج ويحسن كلاً من الدقة الهندسية وتنوع البرامج.

Yuanbo Li, Dule Shu, Yanying Chen, Matt Klenk, Daniel Ritchie2026-02-16
💻 computer science

Unbiased Gradient Estimation for Event Binning via Functional Backpropagation

تقترح هذه الورقة إطار عمل جديد لتقدير التدرج غير المنحاز في الرؤية القائمة على الأحداث من خلال الاستفادة من الانتشار العكسي الوظيفي والتكامل بالتجزئة لتخليق المشتقات الضعيفة لدوال التقسين غير المتصلة، مما يحسن بشكل كبير من كفاءة التعلم والأداء عبر مهام متنوعة لاحقة مثل تقدير الحركة الذاتية، والتدفق البصري، وتحديد الموقع ورسم الخرائط آنياً.

Jinze Chen, Wei Zhai, Han Han, Tiankai Ma, Yang Cao, Bin Li, Zheng-Jun Zha2026-02-16
💻 computer science

ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

يعالج ImageRAGTurbo مقايضات زمن الاستجابة والجودة في عملية توليد الصور من النصوص في خطوة واحدة عبر الضبط الدقيق الفعال لنماذج الانتشار باستخدام التكييف المعزز بالاسترجاع، والذي يستفيد من أزواج النص والصورة ذات الصلة لتوجيه عملية إزالة الضجيج وإنتاج صور عالية الدقة في خطوة واحدة.

Peijie Qiu, Hariharan Ramshankar, Arnau Ramisa, René Vidal, Amit Kumar K C, Vamsi Salaka, Rahul Bhagat2026-02-16
🤖 AI

IndicFairFace: Balanced Indian Face Dataset for Auditing and Mitigating Geographical Bias in Vision-Language Models

تقدم هذه الورقة البحثية IndicFairFace، وهو مجموعة بيانات جديدة ومصدرها أخلاقي تضم 14,400 صورة متوازنة عبر 28 ولاية و8 أقاليم اتحادية في الهند، بهدف قياس وتخفيف التحيز الجغرافي في نماذج الرؤية واللغة مع الحفاظ على دقة استرجاع عالية.

Aarish Shah Mohsin, Mohammed Tayyab Ilyas Khan, Mohammad Nadeem, Shahab Saquib Sohail, Erik Cambria, Jiechao Gao2026-02-16