🤖 machine learning

DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery

تقترح هذه الورقة البحثية DiffuSAM، وهو مسار هجين يدمج إشارات التوطين القائمة على الانتشار مع نماذج تجزئة متقدمة مثل RemoteSAM وSAM3 لتحقيق توطين كائنات قوي وصفرِي القدرة في صور الاستشعار عن بعد، متفوقاً بشكل كبير على الأساليب الحالية ذات الحالة الراهنة المتطورة.

Geet Sethi, Panav Shah, Ashutosh Gandhe, Soumitra Darshan Nayak2026-04-21
🔢 mathematics

Towards Symmetry-sensitive Pose Estimation: A Rotation Representation for Symmetric Object Classes

تقدم هذه الورقة البحثية SARR، وهو تمثيل دوران مبتكر يدمج تناظر الكائن لحل غموض التوجه، مما يمكن الشبكات العصبية التلافيفية (CNNs) القياسية من تحقيق أداء رائد في تقدير الوضعية سداسية الأبعاد (6D pose estimation) للأجسام المتناظرة دون الحاجة إلى نماذج ثلاثية الأبعاد أو دوال خسارة متخصصة.

Andreas Kriegler, Csaba Beleznai, Margrit Gelautz2026-04-21
📊 statistics

Style-Based Neural Architectures for Real-Time Weather Classification

تقدم هذه الورقة ثلاث بنيات عصبية قائمة على الأسلوب — وهي Multi-PatchGAN، وTruncated ResNet50، وTruncated ResNet50 مع مصفوفة جرام والانتباه — والتي تستفيد من استخراج الميزات الأسلوبية لتحقيق تصنيف حالة الطقية في الوقت الفعلي وبأداء رائد مع قدرة قوية على التعميم عبر مختلف المهام القائمة على المظهر.

Hamed Ouattara, Pascal Houssam Salmane, Pierre Duthon, Frédéric Bernardin, Omar Ait Aider2026-04-21
⚡ electrical engineering

Relative State Estimation using Event-Based Propeller Sensing

تقدم هذه الورقة إطار عمل لتقدير الحالة النسبية اللامركزي لأسراب الطائرات رباعية المراوح التي تستفيد من الكاميرات الحدثية لتتبع حركة المراوح، واستخراج بيانات التردد والاتجاه من رحلات خارجية واقعية للتغلب على مشكلات زمن التأخير، وغموض المقياس، والقيود البصرية لطرق الكاميرا أحادية العدسة التقليدية.

Ravi Kumar Thakur, Luis Granados Segura, Jan Klivan, Radim Špetlík, Tobiáš Vinklárek, Matouš Vrba, Martin Saska2026-04-21
💬 NLP

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

تقدم هذه الورقة البحثية نموذج ESsEN، وهو محول رؤية ولغة ثنائي البرج، مدمج وفعال من حيث عدد المعلمات، يستفيد من الشبكات الالتفافية التقليدية ويُظهر أداءً فائقًا في بيئات الموارد المنخفضة مقارنة بالنماذج الأكبر حجمًا.

Clayton Fields, Casey Kennington2026-04-21
🤖 machine learning

Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

تتحدى هذه الورقة البحثية فرضية التمثيل الأفلاطوني من خلال إثبات أن التوافق العابر للأنماط المُبلغ عنه بين نماذج النصوص والصور هو توافق هش، يعتمد على إعدادات تقييم محدودة وصغيرة النطاق، ويفشل في الصمود عند اختباره على مجموعات بيانات أكبر وسيناريوهات واقعية متعددة إلى متعددة، مما يشير إلى أن الأنماط المختلفة تتعلم تمثيلات غنية ولكن متميزة للواقع بدلاً من تمثيل واحد متقارب.

A. Sophia Koepke, Daniil Zverev, Shiry Ginosar, Alexei A. Efros2026-04-21
💬 NLP

Automatic Modeling of Social Concepts Evoked by Art Images as Multimodal Frames

تقترح هذه الورقة نهجاً برمجياً وأنطولوجيا جديدة تترجم النظريات المعرفية إلى أطر متعددة الوسائط لنمذجة وكشف المفاهيم الاجتماعية المجردة، مثل الثورة أو الصداقة، تلقائياً داخل الصور الفنية من خلال دمج البيانات متعددة الحواس لمعالجة الفجوة الدلالية.

Delfina Sol Martinez Pandiani, Valentina Presutti2026-04-20
🤖 AI

When Cultures Meet: Multicultural Text-to-Image Generation

تقدم هذه الورقة المهمة الجديدة المتمثلة في توليد الصور من النصوص متعددة الثقافات، وتقدم معياراً شاملاً ومجموعة بيانات لتقييم النماذج الرائدة عبر الأبعاد الثقافية والديموغرافية، وتقترح إطار عمل MosAIG، وهو إطار متعدد الوكلاء يستفيد من شخصيات النماذج اللغوية الكبيرة المتميزة ثقافياً لتحسين جودة الصور والتجذر الثقافي.

Parth Bhalerao, Mounika Yalamarty, Brian Trinh, Oana Ignat2026-04-20
💻 computer science

An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval

تقدم هذه الورقة أول دراسة تجريبية شاملة تثبت جدوى البيانات الاصطناعية البحتة لاسترجاع الأشخاص القائم على النصوص، وذلك من خلال تقديم مسار توليد موحد خالٍ من البيانات الحقيقية، وإثبات فعاليته كبديل مستقل أو كتعزيز تكميلي عبر سيناريوهات متنوعة.

Min Cao, Yuxin Lu, Ziyin Zeng, Dong Yi, Jinqiao Wang, Mang Ye2026-04-20
💻 computer science

Predicting Video Slot Attention Queries from Random Slot-Feature Pairs

تقترح هذه الورقة البحثية RandSF.Q، وهي طريقة لتعلم الكائنات المركزية في الفيديو غير الخاضعة للإشراف، تقدم "مُنتقلاً" (transitioner) مبتكرًا يتم تدريبه على أزواج عشوائية من ميزات الفتحات (slot-feature pairs) لدمج معلومات الإطارات المستقبلية وتعلم ديناميكيات الانتقال، مما يؤدي إلى تفوقها بشكل كبير على الأساليب الحالية الرائدة في اكتشاف الكائنات وفهم المشهد.

Rongzhen Zhao, Jian Li, Juho Kannala, Joni Pajarinen2026-04-20