🤖 AI

RAAP: Retrieval-Augmented Affordance Prediction with Cross-Image Action Alignment

تقدم الورقة البحثية إطار عمل RAAP، الذي يوحد بين التعلم القائم على الاسترجاع والمحاذاة لفصل تحديد موقع التلامس عن التنبؤ باتجاه الحركة، مما يتيح تلاعباً روبوتياً قوياً في وضع الصفر (zero-shot) عبر أجسام وفئات غير مرئية وبأقل قدر من بيانات التدريب.

Qiyuan Zhuang, He-Yang Xu, Yijun Wang, Xin-Yang Zhao, Yang-Yang Li, Xiu-Shen Wei2026-04-01
💻 computer science

Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions

تقدم هذه الورقة إطار استدلال موجّه بالأدوات وخالٍ من التدريب، يزود نماذج الرؤية واللغة بأدوات معالجة صور عامة ونظام توجيه للتغلب على انحيازها المنهجي في التعرف على الأوهام البصرية، محققاً تعميماً قوياً عبر المتغيرات غير المألوفة هيكلياً مع تسليط الضوء على القيود الرئيسية في قدراتها على الاستدلال المكاني وحساسيتها لآثار الضغط.

Xuesong Wang, Harry Wang2026-04-01
💻 computer science

SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering

يُعد SeGPruner إطار عمل مبتكر للإجابة على الأسئلة ثلاثية الأبعاد، حيث يعزز كفاءة الاستدلال بشكل كبير من خلال تقليل الرموز المرئية بنسبة 91% عبر آلية مزدوجة تعتمد على الحفاظ على البروز الدلالي القائم على الانتباه والتنوع المكاني الموجه هندسياً، مما يحافظ على أداء استدلال قوي مع معالجة فائض الرموز في مسارات العمل متعددة المشاهد.

Wenli Li, Kai Zhao, Haoran Jiang, Enquan Yang, Yi Su, Dan Zeng2026-04-01
💻 computer science

EarthEmbeddingExplorer: A Web Application for Cross-Modal Retrieval of Global Satellite Images

تقدم هذه الورقة EarthEmbeddingExplorer، وهو تطبيق ويب سحابي الأصل يسد الفجوة بين النماذج التأسيسية الأكاديمية لمراقبة الأرض والاستخدام العملي من خلال تمكين الاسترجاع التفاعلي عبر الوسائط المتعددة لصور الأقمار الصناعية العالمية عبر استعلامات اللغة الطبيعية، والوسائط المرئية، والموقع الجغرافي.

Yijie Zheng, Weijie Wu, Bingyue Wu, Long Zhao, Guoqing Li, Mikolaj Czerkawski, Konstantin Klemmer2026-04-01
💻 computer science

FedDBP: Enhancing Federated Prototype Learning with Dual-Branch Features and Personalized Global Fusion

تقترح الورقة البحثية FedDBP، وهي طريقة جديدة لتعلم النماذج الأولية الاتحادية تعزز دقة الميزات والقدرة على التمييز من خلال مسقط ثنائي الفروع من جانب العميل، وتحسن التجميع العالمي عبر استراتيجية دمج مخصصة من جانب الخادم تستفيد من معلومات فيشر، متفوقة بذلك على الأساليب المتقدمة الحالية.

Ningzhi Gao, Siquan Huang, Leyu Shi, Ying Gao2026-04-01
💻 computer science

Square Superpixel Generation and Representation Learning via Granular Ball Computing

تقترح هذه الورقة طريقة لتوليد السوبر بيكسل المربع بناءً على الحوسبة الحبيبية التي تستبدل المناطق غير المنتظمة بكتل مربعة متعددة المقاييس لتمكين المعالجة المتوازية الفعالة والتكامل السلس من طرف إلى طرف في بنيات التعلم العميق مثل الشبكات العصبية الرسومية (GNNs) والمحولات البصرية (ViTs).

Shuyin Xia, Meng Yang, Dawei Dai, Fan Chen, Shilin Zhao, Junwei Han, Xinbo Gao, Guoyin Wang, Wen Lu2026-04-01
🤖 AI

Quantization with Unified Adaptive Distillation to enable multi-LoRA based one-for-all Generative Vision Models on edge

تقدم هذه الورقة QUAD، وهو إطار عمل موحد يتيح استنتاجاً فعالاً لنماذج الرؤية التوليدية متعددة المهام على الأجهزة الطرفية من خلال معاملة أوزان LoRA كمدخلات وقت التشغيل وتوظيف التدريب الواعي بالكمية لتحقيق تخفيضات كبيرة في بصمة الذاكرة وزمن الاستجابة مع الحفاظ على جودة بصرية عالية.

Sowmya Vajrala, Aakash Parmar, Prasanna R, Sravanth Kodavanti, Manjunath Arveti, Srinivas Soumitri Miriyala, Ashok Senap (…)2026-04-01
🤖 AI

Generating Key Postures of Bharatanatyam Adavus with Pose Estimation

تقترح هذه الورقة إطار عمل توليدي مدرك للوضعية يدمج تقدير الوضعية والإشراف لتخليق وضعيات رقص "بهاراتاناتيام" دقيقة تشريحياً وأصيلة أسلوبياً بدقة، مما يعزز الحفظ الرقمي ونشر هذا الفن التقليدي.

Jagadish Kashinath Kamble, Jayanta Mukhopadhyay, Debaditya Roy, Partha Pratim Das2026-04-01
🤖 AI

Turbo4DGen: Ultra-Fast Acceleration for 4D Generation

يُعد Turbo4DGen أول إطار عمل مخصص لتسريع التوليد رباعي الأبعاد القائم على الانتشار، والذي يستخدم ذاكرة تخزين مؤقت مكانيّة-زمانيّة، وتقليم انتباه مدرك للدلالات، ومجدولاً تكيفياً لتحقيق تسريع بمقدار 9.7 ضعفاً مع الحفاظ على الجودة ومعالجة اختناقات الذاكرة.

Yuanbin Man, Ying Huang, Zhile Ren, Miao Yin2026-04-01
💻 computer science

FlowID : Enhancing Forensic Identification with Latent Flow-Matching Models

يُعد FlowID طريقة لإعادة بناء الوجوه مع الحفاظ على الهوية، حيث تستفيد من نماذج مطابقة التدفق الكامنة والتقنيع القائم على الانتباه لإزالة العيوب من صور الوفيات العنيفة لأغراض تحديد الهوية الجنائية، وقد تم التحقق من صحتها بواسطة معيار InjuredFaces الجديد.

Jules Ripoll, David Bertoin, Alasdair Newson, Charles Dossal, Jose Pablo Baraybar2026-04-01