💻 computer science

HyVIC: A Metric-Driven Spatio-Spectral Hyperspectral Image Compression Architecture Based on Variational Autoencoders

تقدم الورقة البحثية HyVIC، وهي بنية مشفر تلقائي تبايني مكاني-طيفي مدفوع بالمعايير، تعالج قيود نماذج ضغط الصور الطبيعية الحالية من خلال الموازنة الصريحة بين تعلم الميزات المكانية والطيفية، مما يحقق دقة إعادة بناء هي الأفضل في فئتها عبر مختلف نسب الضغط.

Martin Hermann Paul Fuchs, Behnood Rasti, Begüm Demir2026-03-30
💻 computer science

Learnable Quantum Efficiency Filters for Urban Hyperspectral Segmentation

تقدم هذه الورقة البحثية "الكفاءة الكمية القابلة للتعلم" (LQE)، وهي طريقة لتقليل الأبعاد مستوحاة من الفيزياء وتتميز بالقابلية للتفسير، تقوم بتمثيل دوال استجابة طيفية سلسة ومحدودة لتعزيز أداء تقسيم الصور فائقة الطيف في المناطق الحضرية وكفاءة المعلمات بشكل كبير، مع سد الفجوة بين الإدراك فائق الطيف وتصميم المستشعرات متعددة الأطياف القائم على البيانات.

Imad Ali Shah, Jiarong Li, Ethan Delaney, Enda Ward, Martin Glavin, Edward Jones, Brian Deegan2026-03-30
💻 computer science

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

يُعد OVI-MAP نظاماً آنياً لرسم الخرائط التدريجية ثلاثية الأبعاد للمثيلات ذات الدلالات المفتوحة، حيث يفصل بين إعادة بناء المثيلات غير المرتبطة بفئات وبين الاستدلال الدلالي باستخدام نماذج الرؤية واللغة لتحقيق تتبع مستقر وتوسيم صفري القدرة في البيئات المعقدة.

Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath2026-03-30
🤖 AI

Beyond MACs: Hardware Efficient Architecture Design for Vision Backbones

تنتقد هذه الورقة الاعتماد على عمليات الضرب والجمع (MACs) كمقياس للكفاءة للنماذج الأساسية للرؤية الحاسوبية على الأجهزة الطرفية، وتقدم بنية LowFormer التي تتميز بآلية Lowtention مبتكرة لمعالجة أوجه القصور هذه، وتثبت تفوقها في السرعة والدقة عبر مختلف المنصات العتادية والمهام اللاحقة.

Moritz Nottebaum, Matteo Dunnhofer, Christian Micheloni2026-03-30
💻 computer science

HolisticSemGes: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching

يقدم HolisticSemGes نموذج مطابقة تدفق تبايني يولد إيماءات مصاحبة للكلام شاملة ومرتكزة دلالياً من خلال الاستفادة من أزواج الصوت والنص غير المتطابقة كعينات سلبية للتغلب على أوجه القصور في الأساليب الحالية في إنتاج حركات متفرقة ومتسقة عبر الوسائط.

Lanmiao Liu, Esam Ghaleb, Aslı Özyürek, Zerrin Yumak2026-03-30
💻 computer science

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

يُعد VGGRPO إطار عمل للتعلم المعزز الموجه بالهندسة الكامنة، والذي يعزز توليد الفيديو المتسق مع العالم من خلال إدخال نموذج هندسة كامنة لإعادة بناء المشهد رباعي الأبعاد بشكل مباشر، وتوظيف تحسين السياسة النسبي الجماعي مع مكافآت قائمة على الهندسة لتحسين التماسك الهندسي واستقرار الكاميرا دون العبء الحسابي الناتج عن فك ترميز VAE المتكرر.

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore (…)2026-03-30
🤖 AI

Think over Trajectories: Leveraging Video Generation to Reconstruct GPS Trajectories from Cellular Signaling

تقدم هذه الورقة Sig2GPS، وهو نهج مبتكر يعيد بناء مسارات نظام تحديد المواقع العالمي (GPS) عالية الدقة من بيانات إشارات الخلايا الخلوية الخشنة عبر إعادة صياغة المشكلة كمسألة توليد فيديو مرئي للخرائط، وذلك باستخدام مجموعة بيانات متخصصة والتعلم المعزز للتفوق على الأساليب الحالية في الدقة والقابلية للتوسع.

Ruixing Zhang, Hanzhang Jiang, Leilei Sun, Liangzhe Han, Jibin Wang, Weifeng Lv2026-03-30
💬 NLP

PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning

تقدم الورقة البحثية PerceptionComp، وهو معيار مرجعي مُصنف يدويًا يضم 1,114 سؤالاً معقدًا عبر 279 فيديو متنوعًا تتطلب استدلالًا إدراكيًا متعدد الخطوات وطويل المدى، مما يكشف أن النماذج الحالية المتطورة وحتى البشر يعانون بشكل كبير مع المهام التي تتطلب منطقًا تركيبيًا وأدلة بصرية متكررة.

Shaoxuan Li, Zhixuan Zhao, Hanze Deng, Zirun Ma, Shulin Tian, Zuyan Liu, Yushi Hu, Haoning Wu, Yuhao Dong, Benlin Liu, Z (…)2026-03-30
🤖 machine learning

Tunable Soft Equivariance with Guarantees

تقترح هذه الورقة إطاراً عاماً لبناء نماذج متكافئة لينة قابلة للضبط عن طريق إسقاط الأوزان مسبقة التدريب في فضاء جزئي مصمم، مما يوفر حدود خطأ نظرية ويُظهر أداءً محسناً عبر مهام متنوعة مع تقليل خطأ التكافؤ على ImageNet.

Md Ashiqur Rahman, Lim Jun Hao, Jeremiah Jiang, Teck-Yian Lim, Raymond A. Yeh2026-03-30
💻 computer science

GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation

تقدم الورقة البحثية GaussianGPT، وهو نموذج ترانسفورمر (transformer) ذاتي الانحدار يقوم بتوليد مشاهد ثلاثية الأبعاد عبر التنبؤ برموز منفصلة مشتقة من عناصر غاوس الأولية المضغوطة، مما يوفر بديلاً قابلاً للتوسع والتحكم مقارنة بالنهج القائم على الانتشار لبناء المشاهد ثلاثية الأبعاد خطوة بخطوة.

Nicolas von Lützow, Barbara Rössle, Katharina Schmid, Matthias Nießner2026-03-30