💻 computer science

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

تُعد VQQA إطار عمل موحداً متعدد الوكلاء يعمل على تعزيز جودة توليد الفيديو من خلال الاستفيد من الأسئلة المرئية المولدة ديناميكياً وانتقادات النماذج اللغوية البصرية (VLM) كمتدرجات دلالية لتمكين التحسين الفعال للمطالبات في الأنظمة ذات الصندوق الأسود دون الحاجة إلى الوصول إلى نماذج الصندوق الأبيض.

Yiwen Song, Tomas Pfister, Yale Song2026-03-16
🤖 AI

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

يُعد SPARROW نموذجًا لغويًا بصريًا متعدد الوسائط للفيديو يعتمد على البكسل، حيث يعمل على تعزيز الدقة المكانية والاتساق المرجعي الزمني من خلال تقديم ميزات تتبع محددة الهدف وتصميم ثنائي للمطالبات، محققًا تحسينات ملحوظة في الأداء عبر معايير قياسية متعددة دون الاعتماد على كواشف خارجية.

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer2026-03-16
🔢 mathematics

Generation of maximal snake polyominoes using a deep neural network

تقدم هذه الورقة نموذج انتشار لإزالة الضجيج يسمى "انتشار فضاء البكسل المهيكل" (SPS Diffusion)، والذي يتعلم توليد متعددات الأضلاع الثعبانية القصوى من البيانات دون ترميز قيود صريحة، وينجح في التعميم على شبكات كبيرة تصل إلى 28×28 رغم حدوث أخطاء هيكلية عرضية.

Benjamin Gauthier, Alain Goupil, Fadel Toure2026-03-16
🤖 AI

Revisiting Model Stitching In the Foundation Model Era

تُثبت هذه الورقة أن نماذج الرؤية التأسيسية غير المتجانسة يمكن دمجها بفعالية باستخدام فقد مطابقة ميزات بسيط عند الطبقة قبل الأخيرة للهدف، مما يتيح إنشاء بنية قابلة للتحكم في المقايضة بين الدقة وزمن الاستجابة (شجرة دمج نماذج الرؤية التأسيسية) تتفوق على النماذج الفردية مع دمج نقاط قوتها المتكاملة.

Zheda Mai, Ke Zhang, Fu-En Wang, Zixiao Ken Wang, Albert Y. C. Chen, Lu Xia, Min Sun, Wei-Lun Chao, Cheng-Hao Kuo2026-03-16
⚡ electrical engineering

Unmasking Biases and Reliability Concerns in Convolutional Neural Networks Analysis of Cancer Pathology Images

تكشف هذه الورقة أن تقييمات الشبكات العصبية التلافيفية القياسية في علم أمراض السرطان غالباً ما تكون غير موثوقة بسبب تحيزات خفية، حيث تحقق النماذج في كثير من الأحيان دقة عالية (تصل إلى 93٪) على أجزاء من خلفية الصورة تفتقر إلى أي معلومات سريرية، مما يضلل الباحثين بشأن قدراتها التشخيصية الحقيقية.

Michael Okonoda, Eder Martinez, Abhilekha Dalal, Lior Shamir2026-03-16
🤖 machine learning

Bases of Steerable Kernels for Equivariant CNNs: From 2D Rotations to the Lorentz Group

تقدم هذه الورقة طريقة عامة وميسرة لبناء قواعد حقيقية ومركبة صريحة لنواة التوجيه (steerable kernels) للشبكات العصبية الالتفافية المتكافئة (equivariant CNNs) عبر مختلف مجموعات التماثل وأنواع الموترات، وذلك من خلال الاستفادة من شرط الثبات النقطي ومعادلة التوجيه، مما يلغي الحاجة إلى حساب معاملات كليس-غوردان (Clebsch-Gordan coefficients).

Alan Garbarz2026-03-16
💻 computer science

Adaptation of Weakly Supervised Localization in Histopathology by Debiasing Predictions

تقدم هذه الورقة البحثية SFDA-DeP، وهي طريقة تكييف نطاق خالية من المصدر لتحديد المواقع في علم الأمراض النسيجية ضعيف الإشراف، والتي تخفف من تدهور الأداء الناتج عن تحولات النطاق وانحياز التنبؤ من خلال تحديد وتصحيح التنبؤات مفرطة الثقة بشكل تكراري عبر نهج مستوحى من "إلغاء التعلم الآلي".

Alexis Guichemerre, Banafsheh Karimian, Soufiane Belharbi, Natacha Gillet, Nicolas Thome, Pourya Shamsolmoali, Mohammadh (…)2026-03-16
🤖 machine learning

Curriculum Sampling: A Two-Phase Curriculum for Efficient Training of Flow Matching

تقدم هذه الورقة البحثية "أخذ عينات المنهج الدراسي" (Curriculum Sampling)، وهي استراتيجية تدريب ثنائية المرحلة لنماذج "مطابقة التدفق" (Flow Matching) تعتمد في البداية على أخذ عينات زمنية منحازة للمنتصف للتعلم السريع للهياكل، ثم تنتقل لاحقًا إلى أخذ العينات الموحد لصقل الحدود، مما يحقق جودة صورة فائقة وتقاربًا أسرع في مجموعة بيانات CIFAR-10 مقارنة بطرق أخذ العينات الثابتة.

Pengwei Sun2026-03-16
🤖 AI

Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation

تقترح الورقة البحثية SERA، وهي بنية توجيه خبراء مكانية-دلالية فعالة في المعلمات، تستخدم محولات مدركة للتعبيرات ودمجاً حافظاً للهندسة مع توجيه خبراء تكيفي لتحسين التماسك المكاني ودقة الحدود بشكل كبير في تقسيم الصور المرجعية، لا سيما عند استخدام نماذج خلفية مسبقة التدريب ومجمدة.

Alaa Dalaq, Muzammil Behzad2026-03-16
🤖 AI

VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models

يُعد VLM4Rec إطار عمل توصية خفيف الوزن يستفيد من نماذج الرؤية واللغة الكبيرة لتحويل صور العناصر إلى أوصاف لغوية طبيعية صريحة من أجل المحاذاة الدلالية، مما يثبت أن التمثيل الدلالي عالي الجودة يتفوق على دمج الميزات المعقد في مهام التوصية متعددة الوسائط.

Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang2026-03-16