💻 computer science

CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision

تقترح الورقة البحثية CLIP-Joint-Detect، وهو إطار عمل غير مرتبط بكاشف محدد يعزز أداء كشف الكائنات في المجموعات المغلقة عبر بنيات متنوعة من خلال دمج الإشراف البصري اللغوي التبايني بأسلوب CLIP مع خسائر الكشف القياسية عبر التدريب المشترك النهائي من طرف إلى طرف.

Behnam Raoufi, Hossein Sharify, Mohamad Mahdee Ramezanee, Khosrow Hajsadeghi, Saeed Bagheri Shouraki2026-08-06
🤖 machine learning

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

تقدم هذه الورقة إطار عمل موجهاً بالأداء يقوم بضبط النماذج اللغوية الكبيرة (LLMs) باستخدام تغذية راجعة لدقة المقارنة الزوجية من مستودع يضم أكثر من 6,000 دالة تعزيز لـ PyTorch، مما يمكنها من تصميم تحويلات بيانات مثالية ذاتياً بما يصل إلى 600 ضعف أقل من عمليات التقييم مقارنة بطرق البحث الشامل، مع استيعاب إشارات الأداء الدلالية بدلاً من الاعتماد على المكافآت الرمزية الصريحة أو التعلم المعزز.

Usha Shrestha, Dmitry Ignatov, Radu Timofte2026-08-06
🤖 machine learning

Event Driven Clustering Algorithm

تقدم هذه الورقة خوارزمية تجميع غير متزامنة ومدفوعة بالأحداث، تحقق تعقيداً زمنياً خطياً ووقت تشغيل مستقلاً عن الدقة للكشف في الوقت الفعلي عن عناقيد الأحداث الصغيرة في بيانات الكاميرا الحدثية من خلال الاستفادة من القرب المكاني والزماني.

David El-Chai Ben-Ezra, Adar Tal, Daniel Brisk2026-08-06
🤖 AI

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

تقدم الورقة البحثية AdaCorrection، وهو إطار عمل تكيفي يعزز كفاءة ودقة نماذج محولات الانتشار (Diffusion Transformers) من خلال التقدير الديناميكي لصلاحية الذاكرة المخبئية ومزج التنشيطات المخبئية مع التنشيطات الجديدة للتخفيف من الانحراف الزمني دون الحاجة إلى إعادة التدريب.

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu2026-08-06
🤖 AI

Human-in-the-Loop Atlas-Based 3D Asset Segmentation for Interactive Content Workflows

تقدم هذه الورقة البحثية مسار عمل يعتمد على وجود العنصر البشري في الحلقة (human-in-the-loop) يقوم بتوليد أطلس ثنائي الأبعاد مُعلم (parameterized) ومجزأ من نماذج ثلاثية الأبعاد عبر الجمع بين الاختيار الجشع للمشاهد (greedy view selection)، والتجزئة التفاعلية باستخدام SAM 2 وLabel Studio، والإسقاط الخلفي (back-projection)، مما يتيح مهاماً لاحقة فعالة مثل تعيين المواد ونقل الأنماط لسير عمل المحتوى التفاعلي.

Paul Julius Kühn, Saptarshi Neil Sinha, Jakob Hansen, Robin Horst2026-08-06
🤖 machine learning

When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning

لمعالجة أوجه القصور في الدفاعات الحالية القائمة على CLIPScore في اكتشاف هجمات الباب الخلفي على نماذج التعلم التبايني متعدد الوسائط، تقترح هذه الورقة CASCADE، وهو إطار عمل جديد ثنائي المراحل يستفيد من التنبؤ المطابق لإنشاء حدود ثقة قابلة للإثبات وتحقيق دقة عالية في الكشف مع حد أدنى من الإيجابيات الكاذبة.

Yiming Chen, Kemou Li, Haiwei Wu, Jiantao Zhou2026-08-06
🤖 machine learning

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

تقدم الورقة البحثية SpecDrop، وهي آلية توجيه خالية من المعلمات تُظهر أن مكاسب الأداء في بنيات "خليط الخبراء" (Mixture-of-Experts) تنبع أساساً من مواءمة دقة إشارة التدريب مع الفئات المستهدفة بدلاً من خوارزميات التوجيه المتعلمة، كما يتضح من نجاحها في مهام التصنيف دقيق التفاصيل وفشلها في التفوق على النماذج المرجعية في البيانات الضبابية متعددة الفئات.

Boyao Wang, Zhihan Lei2026-08-06
🤖 machine learning

LiNC: Lightweight Noise Correction via Per-Sample Trust and Gaussian Mixture Modeling

تُعد LiNC طريقة خفيفة الوزن لتصحيح الضجيج في التصوير الطبي، حيث تتعلم معاملات ثقة لكل عينة لدمج التسميات المرصودة مع تنبؤات النموذج ديناميكيًا، باستخدام نموذج الخليط الغاوسي لتحديد وتصحيح التسميات الضوضائية مع الحفاظ على عبء حسابي ضئيل للغاية.

Abhishek Moturu, Babak Taati, Anna Goldenberg2026-08-06
🤖 AI

TRNet: Topography-Guided Frequency Rectification and Structure-Aware Decoding for Multimodal Paddy Rice Segmentation

يُعد TRNet إطار عمل جديد للتعلم العميق متعدد الوسائط يدمج صور RGB بدقة 0.5 متر مع بيانات نموذج الارتفاع الرقمي (DEM) والمنحدر بدقة 5 أمتار للتغلب على الارتباك البصري الناجم عن التضاريس في المناطق الجبلية، محققاً دقة رائدة في تقسيم حقول الأرز المغمورة من خلال التصحيح الترددي الموجه بالتضاريس وفك التشفير الواعي بالبنية.

Kaiwen Xiao, Chunlong Fu, Liping Zheng, Yanfeng Su2026-08-06
💻 computer science

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

يُعدُّ TriCLE نظاماً رؤيوياً لغوياً ثلاثي الأنماط قابلاً للنشر على الحافة، يقوم بتوليف البيانات الحرارية والعمق من صور طائرات أحادية اللون (RGB) لتحقيق تجميع تصنيفي عالي الدقة وذي صلة هندسية في ظل قيود صارمة على الذاكرة والحوسبة.

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy (…)2026-08-06