🤖 AI

ART: Adaptive Relational Transformer for Pedestrian Trajectory Prediction with Temporal-Aware Relations

تقترح الورقة البحثية نموذج "المحول العلاقاتي التكيفي" (ART)، وهو إطار عمل مبتكر للتنبؤ بمسارات المشاة يجمع بين "رسم بياني علاقي مدرك زمنياً" لنمذجة التفاعلات المتطورة، وآلية "تقليم التفاعل التكيفي" لتعزيز الكفاءة الحسابية، محققاً أداءً هو الأفضل في فئته على المعايير القياسية.

Ruochen Li, Ziyi Chang, Junyan Hu, Jiannan Li, Amir Atapour-Abarghouei, Hubert P. H. Shum2026-04-07
💻 computer science

Motion-Adaptive Multi-Scale Temporal Modelling with Skeleton-Constrained Spatial Graphs for Efficient 3D Human Pose Estimation

تقترح هذه الورقة البحثية MASC-Pose، وهو إطار عمل فعال لتقدير وضعية الجسم ثلاثي الأبعاد، يجمع بين وحدة نمذجة زمنية متعددة المقاييس تكيفية لالتقاط ديناميكيات الحركة غير المتجانسة، وشبكة عصبية رسومية (GCN) تكيفية مقيدة بالهيكل لضمان دقة التفاعل المكاني، محققاً دقة قوية في المعايير القياسية.

Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei2026-04-07
💻 computer science

Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

تقترح هذه الورقة DreamPRVR، وهو إطار عمل للاسترجاع من الخشن إلى الناعم يستخدم نماذج الانتشار الخاضعة للإشراف النصي لتوليد سجلات دلالية سياقية عالمية، مما يعزز استرجاع الفيديو ذي الصلة الجزئية من خلال معالجة غموض الاستعلام والضجيج المحلي بفعالية.

Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen2026-04-07
💻 computer science

Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning

تقدم هذه الورقة البحثية إطار عمل LaPR، وهو إطار لاسترجاع المطالبات المعتمد على التسميات (label-aware prompt retrieval) الذي يعزز أداء التعلم السياقي البصري (Visual In-Context Learning) من خلال دمج تلميحات التسمية الصريحة في تمثيلات المطالبات واستخدام آلية "خليط من الخبراء" (mixture-of-experts) لاستنتاج أنماط تسمية متكيفة مع الاستعلام، وذلك لمعالجة أوجه القصور في الطرق السابقة التي تغفل اتساق التسميات.

Tianci Luo, Haohao Pan, Jinpeng Wang, Niu Lian, Xinrui Chen, Bin Chen, Shu-Tao Xia, Chun Yuan2026-04-07
💻 computer science

Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos

تقترح هذه الورقة نهجاً مبتكراً للتنبؤ بالتفاعلات بين الإنسان والأشياء في فيديوهات الرؤية من منظور الشخص الأول باستخدام نماذج الرؤية اللغوية الكبيرة، والتي تدمج تقنية "مجموعة العلامات" (Set-of-Mark) للترسيخ البصري، وتحليل مسار نظرة العين لفهم القصد، واستراتيجية أخذ العينات الأسية العكسية للديناميكيات الزمنية، محققةً أداءً هو الأفضل في فئته على مجموعة بيانات HD-EPIC.

Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella2026-04-07
💻 computer science

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

يقدم DiffSparse إطار عمل قابلاً للتفاضل وقابلاً للتدريب من البداية إلى النهاية، يعمل على تحسين تشتت الرموز على مستوى الطبقات ويستخدم استراتيجية تدريب مكونة من مرحلتين لتسريع نماذج محولات الانتشار بشكل كبير مع الحفاظ على جودة التوليد أو حتى تحسينها.

Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum2026-04-07
💻 computer science

FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning

تقدم هذه الورقة FunFact، وهو إطار عمل يستفيد من استدلال الرسم البياني العاملي (factor-graph reasoning) لبناء رسوم بيانية للمشاهد الوظيفية ثلاثية الأبعاد ذات مفردات مفتوحة واحتمالية، وذلك عبر الاستنتاج المشترك لعلاقات الكائنات من خلال الأولويات المستمدة من النماذج اللغوية الكبيرة (LLM) والقيود الهندسية، مما يؤدي إلى تحسين حل الغموض ومعايرة الثقة مقارنة بالطرق الحالية.

Zhengyu Fu, René Zurbrügg, Kaixian Qu, Marc Pollefeys, Marco Hutter, Hermann Blum, Zuria Bauer2026-04-07
💻 computer science

M2StyleGS: Multi-Modality 3D Style Transfer with Gaussian Splatting

يُعد M2StyleGS إطار عمل جديد لنقل الأنماط ثلاثية الأبعاد في الوقت الفعلي، يستفيد من تقنية الـ 3D Gaussian Splatting وميزات CLIP متعددة الوسائط لتطبيق الأنماط الفنية من النصوص أو الصور على المشاهد ثلاثية الأبعاد بمرونة، محققاً جودة بصرية واتساقاً فائقين من خلال المحاذاة الدقيقة للميزات وخسائر الملاحظة والكبح المتخصصة.

Xingyu Miao, Xueqi Qiu, Haoran Duan, Yawen Huang, Xian Wu, Jingjing Deng, Yang Long2026-04-07
🤖 AI

InCaRPose: In-Cabin Relative Camera Pose Estimation Model and Dataset

تقدم الورقة البحثية InCaRPose، وهو نموذج قائم على تقنية "ترانسفورمر" (Transformer) تم تدريبه على بيانات اصطناعية، ويحقق تقديرًا قويًا وفي الوقت الفعلي لوضعية الكاميرا النسبية بمقياس متري لبيئات مقصورات السيارات ذات التشوه العالي، مما يعالج تحديات المعايرة الحرجة لأنظمة مراقبة السائق.

Felix Stillger, Lukas Hahn, Frederik Hasecke, Tobias Meisen2026-04-07
💻 computer science

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

تقدم هذه الورقة البحثية ActivityForensics، وهو أول معيار واسع النطاق لتحديد مواقع تزييف الفيديو على مستوى الأنشطة، إلى جانب طريقة أساسية تعتمد على الانتشار تسمى TADiff وبروتوكولات تقييم شاملة لمعالجة التحدي المتزايد المتمثل في الأفعال البشرية المتلاعب بها دلالياً في مقاطع الفيديو.

Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang2026-04-07