💻 computer science

Explainable Part-Based Vehicle Classifier with Spatial Awareness

تقدم هذه الورقة نظاماً مطوراً لتصنيف المركبات القابل للتفسير يدمج خرائط الاحتمالية المكانية لأجزاء المركبة ضمن إطار عمل شجرة القرار، محققاً دقة تضاهي الشبكات العصبية الالتفافية (CNNs) المتطورة مع تحسين المتانة ضد الكشوفات الخاطئة وقابلية التفسير للنموذج بشكل كبير.

Andreas Caduff (Competence Center for Intelligent Sensors and Networks, Lucerne University of Applied Science and Art) (…)2026-05-12
💻 computer science

BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing

يُعد BRIDGE إطار عمل مبتكر لتحرير الصور محلياً باستخدام أقنعة خشنة، حيث يقضي على انحياز شكل القناع من خلال فصل مسارات توليد الخلفية والموضوع، وإدخال بوابة هندسية منفصلة قابلة للتعلم لتوجيه التضمينات الموضعية ديناميكياً، مما يحقق أداءً هو الأفضل في فئته من حيث الحفاظ على استقرار الخلفية مع ضمان الحرية الهندسية للمناطق المعدلة.

Peilin Xiong, Honghui Yuan, Junwen Chen, Keiji Yanai2026-05-12
💻 computer science

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

تقدم هذه الورقة البحثية "المُشفر التلقائي المتوافق مع الأولوية" (Prior-Aligned AutoEncoder - PAE)، وهو مُجزئ (tokenizer) مبتكر يعمل على تحسين خصائص المتشعب الكامن (latent manifold) بشكل صريح — وتحديداً البنية المكانية المتماسكة، والاستمرارية المحلية، والدلالات العالمية — لتحقيق جودة توليد رائدة عالمياً وتسارع ملحوظ في التقارب في نماذج الانتشار الكامن مقارنة بالأساليب الحالية التي تركز فقط على دقة إعادة البناء.

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zh (…)2026-05-12
💻 computer science

Seeing Across Skies and Streets: Feedforward 3D Reconstruction from Satellite, Drone, and Ground Images

يقدم هذا البحث نموذج Cross3R، وهو نموذج تغذية أمامية يستفيد من صورة وسيطة لطائرة بدون طيار للتغلب على قيود مناظر الأقمار الصناعية العمودية، مما يتيح تقدير الوضعية سداسية درجات الحرية (6-DoF) وإعادة البناء ثلاثي الأبعاد لصور الأرض والطائرات بدون الطيار والأقمار الصناعية في آن واحد دون الحاجة إلى معرفة الأوضاع النسبية.

Qiwei Wang, Zhongyao Tuo, Xianghui Ze, Yujiao Shi2026-05-12
💻 computer science

Rethinking Dense Optical Flow without Test-Time Scaling

تقترح هذه الورقة إطار عمل لتدفق بصري فعال حاسبياً يستفيد من النماذج التأسيسية المجمدة (DINO-v2 والعمق أحادي العين) لتحقيق دقة تضاهي أحدث ما توصل إليه العلم في تمريرة أمامية واحدة، مما يثبت أن المسبقات البصرية والهندسية القوية يمكن أن تحل بفعالية محل التحسين التكراري أثناء الاختبار الذي تتطلبه عادةً طرق التدفق البصري الكثيف الحالية.

Praroop Chanda, Suryansh Kumar2026-05-12
💻 computer science

TRAS: An Interactive Software for Tracing Tree Ring Cross Sections

تقدم الورقة البحثية TRAS، وهي مجموعة برمجيات مفتوحة المصدر ومتعددة المنصات تجمع بين خوارزميات معالجة الصور الكلاسيكية والتعلم العميق لأتمتة كشف وقياس حلقات الأشجار مع توفير واجهة تفاعلية للتصحيح اليدوي، مما يقلل بشكل كبير من الوقت والذاتية المرتبطين بالتحليل التقليدي لعلم تاريخ الأشجار.

Henry Marichal, Diego Passarella, Gregory Randall2026-05-12
💻 computer science

Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models

تقترح هذه الورقة إطار عمل HFRU، وهو إطار لنسيان التعزيز يعمل على مشفر الرؤية باستخدام تحسين قائم على GRPO ومكافأة تجريد لتحقيق نسيان دلالي عميق للمعرفة الحساسة في نماذج الرؤية واللغة مع منع هلوسة الأشياء بفعالية.

Kaidi Jia, Yujie Lin, Chengyi Yang, Jiayao Ma, Jinsong Su2026-05-12
💻 computer science

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

يُعد MoCoTalk إطار عمل جديد لانتشار الفيديو متعدد الشروط يحقق أداءً فائقاً في توليد الرؤوس المتحدثة القابلة للتحكم من خلال توحيد ملامح الهوية، والوضعية، والتعبيرات، وإشارات الصوت عبر موجه متعدد الشروط تكيفي وشبكة تظليل معززة للفم متخصصة لحل التداخل وتعزيز المحاذاة السمعية البصرية.

Xinyan Ye, Jiankang Deng, Abbas Edalat2026-05-12
🤖 AI

Benchmarking ResNet Backbones in RT-DETR: Impact of Depth and Regularization under environmental conditions

تُقارن هذه الدراسة أداء نموذج RT-DETR مع مختلف هياكل ResNet الخلفية في ظل ظروف بيئية روبوتية تنافسية، كاشفةً أن النماذج ذات العمق المتوسط مثل ResNet50 وResNet34 توفر التوازن الأمثل بين الدقة والثقة وزمن الاستجابة اعتماداً على ما إذا كان التحدي الرئيسي يكمن في تباين الإضاءة أو تباين الخلفية.

Pamela Barboza, Víctor Castelli, Belén Pereira, Ricardo Grando, Bruna de Vargas, Augusto Calfani2026-05-12
🤖 machine learning

Reasoning emerges from constrained inference manifolds in large language models

تقترح هذه الورقة أن الاستدلال في النماذج اللغوية الكبيرة هو عملية ديناميكية جوهرية تحكمها قيود هندسية ومعلوماتية، حيث لا ينبثق الأداء الفعال إلا عندما تنظم ديناميكيات الاستدلال الداخلي نفسها ذاتياً في متشعبات منخفضة الأبعاد تحافظ على حجم معلوماتي غير متحلل، مما يتيح إطاراً تشخيصياً جديداً خالياً من التسميات.

Yanbiao Ma, Fei Luo, Linfeng Zhang, Chuangxin Zhao, Mingxuan Wang, Yinan Wu, Zhe Qian, Yang Lu, Long Chen, Zhao Cao, Xia (…)2026-05-12